待验证50% 置信事实精确时间
2023年前后包括BIG-bench、HELM在内的多个学术benchmark被指出存在测试集污染问题,即模型训练数据中可能已包含评测题目导致成绩虚高
1
来源数
50%
置信度
长期有效
时效性
2026/9/25
首次发现
来源
涉及实体
相关事实
已验证基准污染是指测试题目可能已出现在训练数据中,导致高分不能真正代表泛化能力79% 相似已验证基准污染(Benchmark Contamination)是当前大模型评估领域面临的重要挑战,模型训练数据中可能已包含公开的测试题目导致评估结果失真78% 相似待验证行业基准测试正从MMLU、HumanEval转向更贴近真实工程场景的SWE-bench等下一代基准,原因是前者存在数据污染风险且难度上限不足以区分顶尖模型73% 相似已验证若用含测试集的全量数据计算均值和标准差,会导致预处理泄漏,使评估指标虚高,无法真实反映模型泛化能力71% 相似待验证传统回归测试面临核心困境:全量回归耗时过长,而随机选择可能遗漏关键场景71% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/949534API
curl https://kongchang.com/api/v1/knowledge/claims/949534MCP
get_claim(id=949534)