Unverified50% confidenceBenchmarkExact time
在GPT-4发布初期,主流模型在GPQA上的准确率约为35-40%,人类领域专家基准线约为65%,随机猜测为25%
1
Sources
50%
Confidence
Long-term
Relevance
7/9/2026
First Seen
Sources
OpenAI评估负责人:我们一直在低估AI模型的真实能力
bilibiliGelai_AI7/8/2026
Related Claims
UnverifiedClaude Opus 5在智能体搜索BrowseComp上得分30.8%,与GPT系列基本持平;工具增强多学科推理64.7%;生物学人类可解问题上高达90.1%72% similarUnverified在Artificial Analysis第三方评测的编码指数(推理模式)上,GPT-5 Mini High的得分比Haiku 4.5高出9个点71% similarUnverifiedGPQA是2023年推出的研究生级别问答基准,其题目即便借助搜索引擎辅助,非专业人士正确率也仅约30%71% similarUnverifiedGPQA由纽约大学2023年发布,题目设计为即便借助搜索引擎普通人正确率也仅约34%71% similarUnverified早期GPT-4在SWE-bench的通过率仅为1.7%,Claude 3 Opus约为4.8%,直到2024年中才突破20%70% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/362872API
curl https://kongchang.com/api/v1/knowledge/claims/362872MCP
get_claim(id=362872)