[KongchangAI]
Benchmark

GPQA

GPQA(Graduate-Level Google-Proof Q&A)是一个面向研究生水平的专业知识问答基准测试,旨在评估大型语言模型在生物学、化学、物理学等自然科学领域的深度推理与专业知识掌握能力。题目由领域专家设计,难度较高,即使借助搜索引擎也难以轻易作答,常被用于衡量模型在专业领域的极限推理表现。

Core Facts

Timeline (last 90 days)

Sep 12

近年出现的高难度评测包括GPQA(研究生级科学问答)、SWE-bench(真实软件工程任务)以及各类Agentic评测

Unverified50%
Sep 11

DeepSeek V4.1 Flash 在纯学术、纯知识型任务(如 GPQA)上有所欠缺,不适合承担深度学术研究或复杂文字创作工作

Unverified50%
Sep 11

DeepSeek V4.1 Flash 在 GPQA、HLE 等方面的评分低于此前版本

Unverified50%
Sep 11

业界常用的基准测试还包括GSM8K(数学推理)、GPQA(研究生级别问答)、ARC(科学推理)

Unverified50%
Sep 8

GPQA是研究生级别科学问答基准,SWE-bench针对软件工程真实任务

Unverified50%
Sep 4

MMLU涵盖57个学科的选择题,GPQA专注博士级别科学问题且经过Google-Proof设计,HumanEval聚焦Python代码生成

Unverified50%
Sep 3

许多经典基准已趋于饱和(如HellaSwag上多个模型得分超过95%),业界正在开发更具区分度的新基准如GPQA、SWE-bench、LiveBench

Unverified50%
Sep 2

行业普遍依赖MMLU、HumanEval、GPQA、SWE-bench等基准测试衡量模型能力

Unverified50%
Aug 30

基准测试饱和(benchmark saturation)指当多个模型在某项基准上都接近满分时该基准失去区分能力,促使社区推出 GPQA、SWE-bench 等新评测标准

Unverified50%
Aug 27

GPQA由纽约大学等机构于2023年开发,包含448道需博士级专业知识的问题,人类领域专家准确率约81%,非专家约34%

Unverified50%

4 more timeline events

All Facts (14)

Verified

标准AI基准测试包括MMLU(涵盖57个学科的综合知识测试)、GPQA(研究生级别专业问答)、SWE-bench(真实软件工程任务)、HumanEval和MBPP(编程能力)、MATH和GSM8K(数学推理)

70%
Verified

GPQA(研究生级别专业问答)专注于需要博士级专业知识的问题

65%
Unverified

The industry has begun shifting toward more challenging benchmarks like GPQA and MATH as older benchmarks lose discriminative power

80%
Unverified

近年出现的高难度评测包括GPQA(研究生级科学问答)、SWE-bench(真实软件工程任务)以及各类Agentic评测

50%
Unverified

DeepSeek V4.1 Flash 在纯学术、纯知识型任务(如 GPQA)上有所欠缺,不适合承担深度学术研究或复杂文字创作工作

50%
Unverified

DeepSeek V4.1 Flash 在 GPQA、HLE 等方面的评分低于此前版本

50%
Unverified

业界常用的基准测试还包括GSM8K(数学推理)、GPQA(研究生级别问答)、ARC(科学推理)

50%
Unverified

GPQA是研究生级别科学问答基准,SWE-bench针对软件工程真实任务

50%
Unverified

MMLU涵盖57个学科的选择题,GPQA专注博士级别科学问题且经过Google-Proof设计,HumanEval聚焦Python代码生成

50%
Unverified

许多经典基准已趋于饱和(如HellaSwag上多个模型得分超过95%),业界正在开发更具区分度的新基准如GPQA、SWE-bench、LiveBench

50%
Unverified

行业普遍依赖MMLU、HumanEval、GPQA、SWE-bench等基准测试衡量模型能力

50%
Unverified

基准测试饱和(benchmark saturation)指当多个模型在某项基准上都接近满分时该基准失去区分能力,促使社区推出 GPQA、SWE-bench 等新评测标准

50%
Unverified

GPQA由纽约大学等机构于2023年开发,包含448道需博士级专业知识的问题,人类领域专家准确率约81%,非专家约34%

50%
Unverified

Mythos Preview比Mythos 5早发布两个多月,但在UK AISI cyber ranges、GPQA、HLE+tools、OSWorld及多数病毒学任务等多项基准测试上超越了Mythos 5

50%

Source Articles