待验证50% 置信事实精确时间
冻结基准的设计针对AI评测领域的数据污染问题,MMLU、HumanEval等知名基准都面临数据污染困境
1
来源数
50%
置信度
长期有效
时效性
2026/8/24
首次发现
来源
涉及实体
相关事实
已验证基准污染(Benchmark Contamination)是当前大模型评估领域面临的重要挑战,模型训练数据中可能已包含公开的测试题目导致评估结果失真61% 相似待验证引导式生成模型面临数据依赖挑战,极端事件数据本就稀缺,数据质量直接决定估算可靠性61% 相似待验证使用真实项目中近期披露的漏洞构建评测集,能规避训练数据污染并还原生产场景复杂度61% 相似待验证CSAM检测AI模型面临误报率与漏报率的权衡难题:过于敏感会误拦截正常内容,过于宽松会放过违法内容60% 相似待验证业界应对大模型非确定性的测试策略包括将温度设为 0、使用 LLM-as-Judge,以及使用 Mock 数据隔离 API 调用60% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/792899API
curl https://kongchang.com/api/v1/knowledge/claims/792899MCP
get_claim(id=792899)