Unverified50% confidenceFactExact time
当测试题目可能已出现在训练数据中时,高分并不能真正代表泛化能力,这被称为基准污染
1
Sources
50%
Confidence
Long-term
Relevance
8/26/2026
First Seen
Sources
Related Entities
Related Claims
Verified基准测试面临污染(Contamination)风险,若训练数据中包含测试题目或近似变体,模型高分可能部分源于背题而非真实能力80% similarUnverified2024年多项研究发现部分模型在标准基准上的优秀表现源于训练数据中混入了基准测试题目本身(数据污染)72% similarUnverifiedMMLU、GSM8K、HumanEval三大基准均已出现不同程度的污染问题,研究者发现多款主流模型训练数据中存在与测试题高度重叠的内容70% similarUnverified对齐训练优化的是模型在已知场景下的统计行为,而非建立可形式化验证的安全边界,面对训练分布之外的罕见指令组合或角色扮演框架时可能失效70% similarUnverified测试评估体系应有前测-中测-后测三个节点,且测试指标与训练目标一致(练爆发就测纵跳/30米冲刺,练耐力就测VO2max或最大摄氧量);只在开头做一次评估、后续无量化追踪的课程无法验证效果69% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/804698API
curl https://kongchang.com/api/v1/knowledge/claims/804698MCP
get_claim(id=804698)