待验证50% 置信事实精确时间
基准测试污染(Benchmark Contamination)是指模型在训练过程中有意或无意接触到评测集数据,从而在测试中获得虚高分数
1
来源数
50%
置信度
长期有效
时效性
2026/9/11
首次发现
来源
涉及实体
相关事实
待验证使用模型训练过程中未接触过的unseen样本可以有效避免评测污染(benchmark contamination),提高测试可信度77% 相似待验证benchmark优化存在训练数据污染问题,许多模型通过'见过'测试题来提升分数73% 相似待验证评测游戏(Benchmark Gaming)指AI公司通过选择性使用特定基准测试来最大化模型表现分数的行为,包括数据污染和针对特定评测集过度优化73% 相似待验证Benchmark hacking可通过数据污染(测试集泄漏进训练数据)、针对特定基准题型格式专项训练、选择性报告最优基准成绩等方式人为提高基准测试分数71% 相似待验证固定基准测试的测试集一旦公开就可能被纳入训练数据导致评测失效70% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/894802API
curl https://kongchang.com/api/v1/knowledge/claims/894802MCP
get_claim(id=894802)