待验证85% 置信事实时间未知
顶尖大语言模型在MMLU上的得分已普遍突破90%,导致该测试区分度正在下降
1
来源数
85%
置信度
中期 (~90 天)
时效性
2026/5/31
首次发现
有效期至:2026/8/29
来源
Claude 4.5 vs Gemini 3 Pro:编程能力全面对决
bilibiliClaudeEvangelist
涉及实体
相关事实
待验证部分模型在MMLU上的得分已超越人类平均水平90%,导致其区分度急剧下降84% 相似待验证在HumanEval等代码能力基准测试中,顶级大语言模型的通过率已超过90%75% 相似待验证一项针对GPT-4的研究显示,对MMLU题目进行语义等价改写后,模型准确率在部分子集上下降超过10个百分点70% 相似待验证到2024年中,顶级模型在MMLU上的分数已普遍超过85-90%,该基准的区分度急剧下降70% 相似待验证基准污染(Benchmark Contamination)导致HumanEval、MMLU等主流基准区分度下降,部分模型HumanEval得分超过95%、MMLU超过90%但实际能力平庸66% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/4056API
curl https://kongchang.com/api/v1/knowledge/claims/4056MCP
get_claim(id=4056)