待验证50% 置信事实精确时间
自2024年下半年以来,主流大模型在MMLU和HumanEval等标准基准测试上的分数提升明显收窄
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/2
首次发现
有效期至:2026/9/30
来源
相关事实
待验证到2024年中,顶级模型在MMLU上的分数已普遍超过85-90%,该基准的区分度急剧下降76% 相似待验证Scale AI在2024年的分析显示,部分模型在MMLU上的分数膨胀可能高达5-10个百分点,因测试集已泄露到训练数据中76% 相似待验证2024年下半年以来,业界普遍观察到主流大模型在标准评测集上的得分提升幅度明显收窄,这一现象被称为'Scaling Law放缓'75% 相似待验证基准污染(Benchmark Contamination)导致HumanEval、MMLU等主流基准区分度下降,部分模型HumanEval得分超过95%、MMLU超过90%但实际能力平庸72% 相似待验证在MMLU、HumanEval、GSM8K等主流评测中,头部大模型的得分差距往往只有几个百分点71% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/52871API
curl https://kongchang.com/api/v1/knowledge/claims/52871MCP
get_claim(id=52871)