[KongchangAI]
BenchmarkCyberGym漏洞发现基准

CyberGym

用于评测AI模型网络安全能力的公开基准,重点考察模型在漏洞发现与利用链各环节的自动化能力

Timeline (last 90 days)

Sep 12

发布方宣称DeepSeek-V4.1-Flash在DeepSWE、CyberGym和Automation Bench三项基准测试中表现优于Opus 5和GPT-5.6 Sol

Unverified50%
Sep 12

DeepSWE、CyberGym和Automation Bench分别对应软件工程、网络安全和自动化智能体任务的评测

Unverified50%

All Facts (2)

Source Articles