[控场AI]
基准

Exploit Bench

专门衡量AI网络安全攻防能力的基准测试,覆盖漏洞识别、利用链构造和渗透测试场景,属于任务完成型评估范式,要求模型在沙盒环境中完成端到端渗透测试

时间轴 (近 90 天)

9月17日

OpenAI公布Astra在Exploit Bench达到100%

待验证50%
9月17日

Exploit Bench是用于评估模型自动化漏洞利用能力的安全领域基准

待验证50%

全部知识事实 (2)

来源文章