Unverified85% confidenceFactTime unknown
顶尖大语言模型在MMLU上的得分已普遍突破90%,导致该测试区分度正在下降
1
Sources
85%
Confidence
Medium-term (~90 days)
Relevance
5/31/2026
First Seen
Valid until: 8/29/2026
Sources
Claude 4.5 vs Gemini 3 Pro:编程能力全面对决
bilibiliClaudeEvangelist
Related Entities
Related Claims
Unverified部分模型在MMLU上的得分已超越人类平均水平90%,导致其区分度急剧下降84% similarUnverified在HumanEval等代码能力基准测试中,顶级大语言模型的通过率已超过90%75% similarUnverified一项针对GPT-4的研究显示,对MMLU题目进行语义等价改写后,模型准确率在部分子集上下降超过10个百分点70% similarUnverified到2024年中,顶级模型在MMLU上的分数已普遍超过85-90%,该基准的区分度急剧下降70% similarUnverified基准污染(Benchmark Contamination)导致HumanEval、MMLU等主流基准区分度下降,部分模型HumanEval得分超过95%、MMLU超过90%但实际能力平庸66% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/4056API
curl https://kongchang.com/api/v1/knowledge/claims/4056MCP
get_claim(id=4056)