待验证50% 置信基准精确时间
在GPT-4发布初期,主流模型在GPQA上的准确率约为35-40%,人类领域专家基准线约为65%,随机猜测为25%
1
来源数
50%
置信度
长期有效
时效性
2026/7/9
首次发现
来源
OpenAI评估负责人:我们一直在低估AI模型的真实能力
bilibiliGelai_AI2026/7/8
相关事实
待验证Claude Opus 5在智能体搜索BrowseComp上得分30.8%,与GPT系列基本持平;工具增强多学科推理64.7%;生物学人类可解问题上高达90.1%72% 相似待验证在Artificial Analysis第三方评测的编码指数(推理模式)上,GPT-5 Mini High的得分比Haiku 4.5高出9个点71% 相似待验证GPQA是2023年推出的研究生级别问答基准,其题目即便借助搜索引擎辅助,非专业人士正确率也仅约30%71% 相似待验证GPQA由纽约大学2023年发布,题目设计为即便借助搜索引擎普通人正确率也仅约34%71% 相似待验证早期GPT-4在SWE-bench的通过率仅为1.7%,Claude 3 Opus约为4.8%,直到2024年中才突破20%70% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/362872API
curl https://kongchang.com/api/v1/knowledge/claims/362872MCP
get_claim(id=362872)