待验证50% 置信事实精确时间
Benchmark 失效的根本原因在于训练集污染与题库饱和两个问题
1
来源数
50%
置信度
长期有效
时效性
2026/9/23
首次发现
来源
涉及实体
相关事实
已验证基准污染(Benchmark Contamination)是当前大模型评估领域面临的重要挑战,模型训练数据中可能已包含公开的测试题目导致评估结果失真76% 相似已验证基准污染是指测试题目可能已出现在训练数据中,导致高分不能真正代表泛化能力69% 相似已验证仅用成功轨迹训练的模型往往存在分布外泛化的严重缺陷,遇到工具返回错误时便丧失纠偏能力69% 相似待验证Benchmark overfitting is a systemic limitation where models score high through targeted training on test sets without corresponding improvements in generalization.69% 相似待验证文章推断种子导致的崩坏源于采样过程本身的数值冲突,与训练数据无关67% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/943511API
curl https://kongchang.com/api/v1/knowledge/claims/943511MCP
get_claim(id=943511)