[控场AI]
基准

GPQA

GPQA(Graduate-Level Google-Proof Q&A)是一个面向研究生水平的专业知识问答基准测试,旨在评估大型语言模型在生物学、化学、物理学等自然科学领域的深度推理与专业知识掌握能力。题目由领域专家设计,难度较高,即使借助搜索引擎也难以轻易作答,常被用于衡量模型在专业领域的极限推理表现。

核心事实

时间轴 (近 90 天)

10月4日

Astra在Artificial Analysis智能指数上低于GLM 5.3 Flash等小模型,因该指数基于已过时饱和的基准(如GPQA)

待验证50%
9月29日

评估大模型代码能力常用HumanEval和SWE-bench,综合推理常用MMLU和GPQA,指令遵循常用IFEval

待验证50%
9月29日

评估大语言模型能力常用的基准测试包括 MMLU、HumanEval、MATH 和 GPQA

待验证50%
9月28日

LiveNerf每天重新运行一批独立基准测试,例如GPQA和SWE-bench,并将结果绘制成图表记录在GitHub仓库中

待验证50%
9月22日

综合智能指数常见子基准包括 MMLU、HumanEval、MBPP、MATH、GSM8K、GPQA 和 LongBench

待验证50%
9月16日

GPQA(Graduate-Level Google-Proof Q&A)专注于博士级别的科学推理难题

待验证60%
9月16日

MMLU、GPQA、SWE-bench是当前AI社区广泛认可的模型评估基准

待验证50%
9月16日

评估本地模型是否适合需求可参考 MMLU、HumanEval 等标准化基准测试分数

待验证50%
9月12日

近年出现的高难度评测包括GPQA(研究生级科学问答)、SWE-bench(真实软件工程任务)以及各类Agentic评测

待验证50%
9月11日

DeepSeek V4.1 Flash 在纯学术、纯知识型任务(如 GPQA)上有所欠缺,不适合承担深度学术研究或复杂文字创作工作

待验证50%

还有 14 条时间轴事件

全部知识事实 (20)

已验证

标准AI基准测试包括MMLU(涵盖57个学科的综合知识测试)、GPQA(研究生级别专业问答)、SWE-bench(真实软件工程任务)、HumanEval和MBPP(编程能力)、MATH和GSM8K(数学推理)

85%
已验证

AI领域模型能力的可信评估依赖标准化基准测试,常见评测集包括MMLU、HumanEval、MATH、GPQA

80%
已验证

DeepSeek V4.1 Flash 在 GPQA、HLE 等方面的评分低于此前版本

75%
已验证

GPQA是专为博士级科学问答设计的基准,题目难度使领域专家也仅能答对约65%

70%
已验证

GPQA(研究生级别专业问答)专注于需要博士级专业知识的问题

65%
待验证

The industry has begun shifting toward more challenging benchmarks like GPQA and MATH as older benchmarks lose discriminative power

80%
待验证

GPQA(Graduate-Level Google-Proof Q&A)专注于博士级别的科学推理难题

60%
待验证

GPQA是研究生级别科学问答基准,SWE-bench针对软件工程真实任务

60%
待验证

GPQA由纽约大学研究团队设计,非专业人士使用搜索引擎答题准确率约34%,领域专家平均得分约65%

60%
待验证

Astra在Artificial Analysis智能指数上低于GLM 5.3 Flash等小模型,因该指数基于已过时饱和的基准(如GPQA)

50%
待验证

评估大模型代码能力常用HumanEval和SWE-bench,综合推理常用MMLU和GPQA,指令遵循常用IFEval

50%
待验证

评估大语言模型能力常用的基准测试包括 MMLU、HumanEval、MATH 和 GPQA

50%
待验证

LiveNerf每天重新运行一批独立基准测试,例如GPQA和SWE-bench,并将结果绘制成图表记录在GitHub仓库中

50%
待验证

综合智能指数常见子基准包括 MMLU、HumanEval、MBPP、MATH、GSM8K、GPQA 和 LongBench

50%
待验证

MMLU、GPQA、SWE-bench是当前AI社区广泛认可的模型评估基准

50%
待验证

评估本地模型是否适合需求可参考 MMLU、HumanEval 等标准化基准测试分数

50%
待验证

近年出现的高难度评测包括GPQA(研究生级科学问答)、SWE-bench(真实软件工程任务)以及各类Agentic评测

50%
待验证

DeepSeek V4.1 Flash 在纯学术、纯知识型任务(如 GPQA)上有所欠缺,不适合承担深度学术研究或复杂文字创作工作

50%
待验证

业界常用的基准测试还包括GSM8K(数学推理)、GPQA(研究生级别问答)、ARC(科学推理)

50%
待验证

MMLU涵盖57个学科的选择题,GPQA专注博士级别科学问题且经过Google-Proof设计,HumanEval聚焦Python代码生成

50%

来源文章