BenchmarkCyberGym漏洞发现基准
CyberGym
用于评测AI模型网络安全能力的公开基准,重点考察模型在漏洞发现与利用链各环节的自动化能力
Timeline (last 90 days)
Sep 12
发布方宣称DeepSeek-V4.1-Flash在DeepSWE、CyberGym和Automation Bench三项基准测试中表现优于Opus 5和GPT-5.6 Sol
Unverified50%
Sep 12
DeepSWE、CyberGym和Automation Bench分别对应软件工程、网络安全和自动化智能体任务的评测
Unverified50%