已验证75% 置信事实时间未知
基准污染(Benchmark Contamination)是当前大模型评估领域面临的重要挑战,模型训练数据中可能已包含公开的测试题目导致评估结果失真
3
来源数
75%
置信度
长期有效
时效性
2026/6/1
首次发现
来源
Percy Liang确认出席CAIS 2026:AI安全与大模型评估的前沿对话
twitterJeffDean
涉及实体
相关事实
待验证数据泄漏分为目标泄漏和训练-测试污染两类,会导致模型性能被系统性高估74% 相似待验证Benchmark overfitting is a systemic limitation where models score high through targeted training on test sets without corresponding improvements in generalization.73% 相似待验证部分模型存在针对测试集过度优化的风险,导致榜单分数与真实场景表现出现偏差(Benchmark饱和)72% 相似已验证若用含测试集的全量数据计算均值和标准差,会导致预处理泄漏,使评估指标虚高,无法真实反映模型泛化能力72% 相似已验证基准数据污染是指测试集公开后其题目可能出现在后续模型的预训练语料中,导致得分反映记忆而非真实推理能力71% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/22964API
curl https://kongchang.com/api/v1/knowledge/claims/22964MCP
get_claim(id=22964)