[控场AI]
基准CyberGym漏洞发现基准

CyberGym

用于评测AI模型网络安全能力的公开基准,重点考察模型在漏洞发现与利用链各环节的自动化能力

时间轴 (近 90 天)

9月12日

发布方宣称DeepSeek-V4.1-Flash在DeepSWE、CyberGym和Automation Bench三项基准测试中表现优于Opus 5和GPT-5.6 Sol

待验证50%
9月12日

DeepSWE、CyberGym和Automation Bench分别对应软件工程、网络安全和自动化智能体任务的评测

待验证50%

全部知识事实 (2)

来源文章