Unverified50% confidenceFactExact time
网络安全能力基准测试的类似框架包括DARPA的Cyber Grand Challenge和Meta的PurpleLlama CyberSecEval
1
Sources
50%
Confidence
Long-term
Relevance
8/15/2026
First Seen
Sources
Related Claims
UnverifiedCyberSecEval由Meta推出,同时测量模型生成网络攻击辅助内容的风险倾向与安全防御知识的准确性;NYU CTF Bench基于真实CTF竞赛题目考察模型实战能力70% similarUnverified大模型在网络安全领域的核心应用场景包括静态代码审计、动态威胁情报分析、渗透测试辅助和安全日志自然语言问答68% similarUnverifiedDARPA投入6000万美元设计的Cyber Grand Challenge中,50%的手工精选挑战包含意料之外的未知漏洞;AIXCC项目在DEF CON上找到的漏洞中有18个是非预期的68% similarUnverified评估模型安全能力的基准包括Meta推出的CyberSecEval和NYU CTF Bench66% similarUnverified同一段网络扫描代码在安全研究场景中是合法工具,在攻击场景中可能是恶意载荷,使意图识别困难66% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/753377API
curl https://kongchang.com/api/v1/knowledge/claims/753377MCP
get_claim(id=753377)