Unverified50% confidenceFactTime unknown
AI benchmark suites like MMLU, HumanEval, and MATH may produce inflated scores due to benchmark contamination, where models have indirectly encountered test data during training.
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/2/2026
First Seen
Valid until: 9/30/2026
Sources
Related Claims
UnverifiedScale AI在2024年的分析显示,部分模型在MMLU上的分数膨胀可能高达5-10个百分点,因测试集已泄露到训练数据中72% similarUnverified模型在标准化评测基准(如HumanEval、MMLU)上的高分表现与真实工作场景中的可靠性之间存在显著差距66% similarPartially Verified基准污染指模型在训练过程中已见过测试题目,导致评分虚高、无法反映真实泛化能力66% similarUnverified当前顶尖AI模型在CTF基准上的得分仍远低于人类专家水平,尤其是涉及动态调试和二进制分析的题目类别66% similarUnverified2024年研究表明即使AI生成内容仅占训练数据的10-20%,在多代训练后也足以引发可测量的质量退化66% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/55594API
curl https://kongchang.com/api/v1/knowledge/claims/55594MCP
get_claim(id=55594)