Unverified70% confidenceFactTime unknown
在MMLU、HumanEval、GSM8K等主流评测中,头部大模型的得分差距往往只有几个百分点
1
Sources
70%
Confidence
Long-term
Relevance
6/1/2026
First Seen
Sources
DeepSeek V4 Pro优惠期延长至2026年5月:开发者成本利好全解读
twitterdeepseek_ai
Related Entities
Related Claims
Unverified中间层模型在MMLU、HumanEval等基准上通常能达到旗舰模型80%以上的得分,却只需不到30%的推理成本75% similarUnverified斯坦福大学HAI研究所2024年度AI指数报告显示,顶级闭源模型在MMLU基准上的最高分与第五名之间的差距,已从2022年的约8个百分点收窄至不足2个百分点72% similarUnverified自2024年下半年以来,主流大模型在MMLU和HumanEval等标准基准测试上的分数提升明显收窄71% similarUnverified模型在标准化评测基准(如HumanEval、MMLU)上的高分表现与真实工作场景中的可靠性之间存在显著差距71% similarUnverified当综合评估指数中顶尖模型得分接近天花板时会出现基准饱和问题,60分对59分的差距在统计学上通常处于误差范围之内70% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/27923API
curl https://kongchang.com/api/v1/knowledge/claims/27923MCP
get_claim(id=27923)