部分验证85% 置信事实精确时间
基准污染指模型在训练过程中已见过测试题目,导致评分虚高、无法反映真实泛化能力
5
来源数
85%
置信度
长期有效
时效性
2026/7/5
首次发现
来源
OpenAI支持Appia基金会:AI通用标准化的破局之路
rss2026/6/23
相关事实
待验证研究表明即使是部分污染(模型只见过题目而非答案),也可能显著提升得分74% 相似待验证基准测试面临饱和(Saturation)和数据污染(Data Contamination)两个系统性挑战,当多个主流模型得分超过95%时测试集失去区分能力74% 相似待验证评估模型不能只看智能指标,还要看Token使用效率和工具调用次数,工具调用次数过多会导致上下文污染72% 相似待验证2023年,研究人员证明只需污染不到1%的训练数据,就能在特定触发条件下改变模型行为72% 相似待验证2023年多项独立研究表明部分顶级模型在标准数学推理测试中分数极高,但在等价的重新表述版本上成绩大幅下滑,表明模型学习的是测试模式而非真正的推理能力70% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/112155API
curl https://kongchang.com/api/v1/knowledge/claims/112155MCP
get_claim(id=112155)