Unverified50% confidenceFactExact time
安全评测数据集代表性工作包括AdvBench、HarmBench、SALAD-Bench,尚未形成像MMLU那样统一标准
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/10/2026
First Seen
Valid until: 10/8/2026
Sources
LLM安全基准测试:现状、挑战与实践指南
hackernewshackernews7/6/2026
Related Claims
Unverified目前尚未出现像MMLU那样被普遍引用的统一LLM安全评测标准73% similarUnverified大模型安全问题目前尚无类似CVE的标准化分类体系,漏洞严重程度评估缺乏统一标准65% similarUnverified报价过低(明显低于市场行情)的检测服务需警惕'分包'风险——部分机构接单后转包给资质外实验室,或减少实际检测项目仅套用模板出报告,这类报告CMA编号可能查无此单或与实际检测不符59% similarUnverified目前业界尚无公认的Prompt质量评估标准59% similarUnverified测试沙箱中的该模型未配备已部署模型所具备的全部防护措施,例如能在可疑行为时发出标记的分类器58% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/461668API
curl https://kongchang.com/api/v1/knowledge/claims/461668MCP
get_claim(id=461668)