待验证50% 置信基准精确时间
评估模型安全能力的基准包括Meta推出的CyberSecEval和NYU CTF Bench
1
来源数
50%
置信度
长期有效
时效性
2026/7/10
首次发现
来源
OpenAI发布GPT-5.6:网络安全能力成核心卖点
rss2026/7/9
相关事实
待验证CyberSecEval由Meta推出,同时测量模型生成网络攻击辅助内容的风险倾向与安全防御知识的准确性;NYU CTF Bench基于真实CTF竞赛题目考察模型实战能力85% 相似待验证网络安全能力基准测试的类似框架包括DARPA的Cyber Grand Challenge和Meta的PurpleLlama CyberSecEval66% 相似待验证GStack的CISO命令遵循OWASP TOP 10和STRIDE威胁建模标准进行安全审查64% 相似待验证同一段网络扫描代码在安全研究场景中是合法工具,在攻击场景中可能是恶意载荷,使意图识别困难62% 相似待验证计算机使用能力的核心安全风险包括Prompt Injection攻击和未经授权访问敏感本地数据62% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/470911API
curl https://kongchang.com/api/v1/knowledge/claims/470911MCP
get_claim(id=470911)