待验证50% 置信基准精确时间
MMLU涵盖57个学科的多项选择题,GPT-4在此测试上首次突破86%的人类专家水平
1
来源数
50%
置信度
长期有效
时效性
2026/7/15
首次发现
来源
相关事实
待验证在GPT-4发布初期,主流模型在GPQA上的准确率约为35-40%,人类领域专家基准线约为65%,随机猜测为25%65% 相似待验证Models like GPT-4 and Claude 3.5 surpassed 90% accuracy on MMLU, significantly diminishing its discriminative power63% 相似待验证Claude Opus 5在智能体搜索BrowseComp上得分30.8%,与GPT系列基本持平;工具增强多学科推理64.7%;生物学人类可解问题上高达90.1%63% 相似待验证在MMLU、HumanEval等主流基准测试上,Claude 3.5、GPT-4o、Gemini 1.5 Pro、Grok-2之间的分差已压缩至统计误差范围内61% 相似待验证在Agent's Last Exam基准测试中,GPT-5.6 Soul(extra high档)得分近54%,Fable(max档)为45%60% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/521285API
curl https://kongchang.com/api/v1/knowledge/claims/521285MCP
get_claim(id=521285)