基准
CyberSecEval
Meta推出的网络安全领域AI能力评估基准,同时衡量模型在防御性知识输出与有害能力抑制两个维度上的表现
时间轴 (近 90 天)
9月29日
CyberSecEval引入了「网络攻击辅助率」等指标,尝试量化模型在多大程度上协助了潜在恶意行为
待验证50%
9月12日
CyberSecEval 是 Meta 发布的安全基准,用于评估模型在代码漏洞识别、CTF 解题和安全问答上的表现
待验证50%
8月26日
CyberGym是专门评估AI模型在网络安全和代码安全审查领域能力的基准框架,涵盖漏洞检测、恶意代码识别、安全配置审计、依赖项风险评估等维度
待验证50%