待验证85% 置信基准精确时间
Models like GPT-4 and Claude 3.5 surpassed 90% accuracy on MMLU, significantly diminishing its discriminative power
1
来源数
85%
置信度
中期 (~90 天)
时效性
2026/8/3
首次发现
来源
涉及实体
相关事实
待验证在MMLU、HumanEval等主流基准测试上,Claude 3.5、GPT-4o、Gemini 1.5 Pro、Grok-2之间的分差已压缩至统计误差范围内69% 相似待验证GLM 4.6在HumanEval、MBPP、SWE-bench等代码评测基准以及MMLU、GPQA等综合能力基准上的表现对齐Claude 3.4和Claude 3.4.567% 相似待验证在GPT-4发布初期,主流模型在GPQA上的准确率约为35-40%,人类领域专家基准线约为65%,随机猜测为25%67% 相似待验证Gemini 3.5 Pro在MMLU Pro基准测试中得分89.4分,领先GPT 5.5和Claude65% 相似待验证在 GSM8K 基准上,标准思维链准确率约为 56%-63%(GPT-3 规模),PAL 可提升至 72% 以上65% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/680092API
curl https://kongchang.com/api/v1/knowledge/claims/680092MCP
get_claim(id=680092)