GPQA(Graduate-Level Google-Proof Q&A)是一个面向研究生水平的专业知识问答基准测试,旨在评估大型语言模型在生物学、化学、物理学等自然科学领域的深度推理与专业知识掌握能力。题目由领域专家设计,难度较高,即使借助搜索引擎也难以轻易作答,常被用于衡量模型在专业领域的极限推理表现。
GPT-5.5在GPQA博士级科学推理基准上从78.5%提升到85.6%
Kimi K2.5在AMM5 2025综合能力测试中获得96.1分,在GPQA Diamond高难度问题测试中获得87.6分
O4-mini在GPQA博士级问答评测中准确率超过80%
Mercury 2 在 GPQA 测试(研究生水平科学推理)中得分约 75 分
GPQA Diamond测试题目来自生物学、化学、物理学等领域的博士级别知识,领域专家平均正确率约65%
Gemini 3.1 Pro在GPQA Diamond测试中得分94.3%,超过OpenAI的o4和GPT-5.2
GPQA Diamond由纽约大学研究团队构建,人类专家(博士生)的平均正确率约为65%,非专业人类约为34%
在GPQA Diamond(博士级推理)测评中,Claude Opus 4.7以94.2%夺冠,DeepSeek V4 Pro以90.1%拿下开源第一
GPQA由纽约大学研究团队设计,非专业人士使用搜索引擎答题准确率约34%,领域专家平均得分约65%
Llama 3.3在HumanEval、iFEVOL和GPQA等基准测试中相比前代展现出重大改进