Unverified60% confidenceFactExact time
MMLU、GSM8K、HumanEval三大基准均已出现不同程度的污染问题,研究者发现多款主流模型训练数据中存在与测试题高度重叠的内容
2
Sources
60%
Confidence
Long-term
Relevance
7/10/2026
First Seen
Sources
LLM安全基准测试:现状、挑战与实践指南
hackernewshackernews7/6/2026
Related Claims
Unverified2024年多项研究发现部分模型在标准基准上的优秀表现源于训练数据中混入了基准测试题目本身(数据污染)75% similarUnverified当测试题目可能已出现在训练数据中时,高分并不能真正代表泛化能力,这被称为基准污染70% similarVerified基准测试面临污染(Contamination)风险,若训练数据中包含测试题目或近似变体,模型高分可能部分源于背题而非真实能力67% similarUnverifiedML系统的独特性包括数据是一等公民、非确定性输出、模型随时间退化需重训练监控、以及GPU与成本约束64% similarVerified训练数据投毒可在模型权重层面植入持久性后门,危害远超应用层越狱,但实施门槛更高,通常需要对训练流程有控制权64% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/461660API
curl https://kongchang.com/api/v1/knowledge/claims/461660MCP
get_claim(id=461660)