基准
Exploit Bench
专门衡量AI网络安全攻防能力的基准测试,覆盖漏洞识别、利用链构造和渗透测试场景,属于任务完成型评估范式,要求模型在沙盒环境中完成端到端渗透测试
时间轴 (近 90 天)
9月17日
OpenAI公布Astra在Exploit Bench达到100%
待验证50%
9月17日
Exploit Bench是用于评估模型自动化漏洞利用能力的安全领域基准
待验证50%
专门衡量AI网络安全攻防能力的基准测试,覆盖漏洞识别、利用链构造和渗透测试场景,属于任务完成型评估范式,要求模型在沙盒环境中完成端到端渗透测试
OpenAI公布Astra在Exploit Bench达到100%
Exploit Bench是用于评估模型自动化漏洞利用能力的安全领域基准