Unverified50% confidenceFactExact time
基准污染(Benchmark Contamination)导致HumanEval、MMLU等主流基准区分度下降,部分模型HumanEval得分超过95%、MMLU超过90%但实际能力平庸
1
Sources
50%
Confidence
Long-term
Relevance
7/24/2026
First Seen
Sources
Related Claims
Unverified部分模型在MMLU上的得分已超越人类平均水平90%,导致其区分度急剧下降80% similarUnverified到2024年中,顶级模型在MMLU上的分数已普遍超过85-90%,该基准的区分度急剧下降73% similarUnverified传统基准如MMLU、HumanEval因训练数据污染出现基准饱和,GPT-4发布时MMLU得分约86%,如今多个开源模型已突破90%73% similarUnverified自2024年下半年以来,主流大模型在MMLU和HumanEval等标准基准测试上的分数提升明显收窄72% similarUnverified在MMLU、HumanEval、GSM8K等主流评测中,头部大模型的得分差距往往只有几个百分点69% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/602713API
curl https://kongchang.com/api/v1/knowledge/claims/602713MCP
get_claim(id=602713)