Unverified50% confidenceFactExact time
自2024年下半年以来,主流大模型在MMLU和HumanEval等标准基准测试上的分数提升明显收窄
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/2/2026
First Seen
Valid until: 9/30/2026
Sources
Related Claims
Unverified到2024年中,顶级模型在MMLU上的分数已普遍超过85-90%,该基准的区分度急剧下降76% similarUnverifiedScale AI在2024年的分析显示,部分模型在MMLU上的分数膨胀可能高达5-10个百分点,因测试集已泄露到训练数据中76% similarUnverified2024年下半年以来,业界普遍观察到主流大模型在标准评测集上的得分提升幅度明显收窄,这一现象被称为'Scaling Law放缓'75% similarUnverified基准污染(Benchmark Contamination)导致HumanEval、MMLU等主流基准区分度下降,部分模型HumanEval得分超过95%、MMLU超过90%但实际能力平庸72% similarUnverified在MMLU、HumanEval、GSM8K等主流评测中,头部大模型的得分差距往往只有几个百分点71% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/52871API
curl https://kongchang.com/api/v1/knowledge/claims/52871MCP
get_claim(id=52871)