Unverified85% confidenceBenchmarkExact time
Models like GPT-4 and Claude 3.5 surpassed 90% accuracy on MMLU, significantly diminishing its discriminative power
1
Sources
85%
Confidence
Medium-term (~90 days)
Relevance
8/3/2026
First Seen
Sources
Related Entities
Related Claims
Unverified在MMLU、HumanEval等主流基准测试上,Claude 3.5、GPT-4o、Gemini 1.5 Pro、Grok-2之间的分差已压缩至统计误差范围内69% similarUnverifiedGLM 4.6在HumanEval、MBPP、SWE-bench等代码评测基准以及MMLU、GPQA等综合能力基准上的表现对齐Claude 3.4和Claude 3.4.567% similarUnverified在GPT-4发布初期,主流模型在GPQA上的准确率约为35-40%,人类领域专家基准线约为65%,随机猜测为25%67% similarUnverifiedGemini 3.5 Pro在MMLU Pro基准测试中得分89.4分,领先GPT 5.5和Claude65% similarUnverified在 GSM8K 基准上,标准思维链准确率约为 56%-63%(GPT-3 规模),PAL 可提升至 72% 以上65% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/680092API
curl https://kongchang.com/api/v1/knowledge/claims/680092MCP
get_claim(id=680092)