GPQA
GPQA(Graduate-Level Google-Proof Q&A)是一个面向研究生水平的专业知识问答基准测试,旨在评估大型语言模型在生物学、化学、物理学等自然科学领域的深度推理与专业知识掌握能力。题目由领域专家设计,难度较高,即使借助搜索引擎也难以轻易作答,常被用于衡量模型在专业领域的极限推理表现。
Core Facts
Timeline (last 90 days)
近年出现的高难度评测包括GPQA(研究生级科学问答)、SWE-bench(真实软件工程任务)以及各类Agentic评测
DeepSeek V4.1 Flash 在纯学术、纯知识型任务(如 GPQA)上有所欠缺,不适合承担深度学术研究或复杂文字创作工作
DeepSeek V4.1 Flash 在 GPQA、HLE 等方面的评分低于此前版本
业界常用的基准测试还包括GSM8K(数学推理)、GPQA(研究生级别问答)、ARC(科学推理)
GPQA是研究生级别科学问答基准,SWE-bench针对软件工程真实任务
MMLU涵盖57个学科的选择题,GPQA专注博士级别科学问题且经过Google-Proof设计,HumanEval聚焦Python代码生成
许多经典基准已趋于饱和(如HellaSwag上多个模型得分超过95%),业界正在开发更具区分度的新基准如GPQA、SWE-bench、LiveBench
行业普遍依赖MMLU、HumanEval、GPQA、SWE-bench等基准测试衡量模型能力
基准测试饱和(benchmark saturation)指当多个模型在某项基准上都接近满分时该基准失去区分能力,促使社区推出 GPQA、SWE-bench 等新评测标准
GPQA由纽约大学等机构于2023年开发,包含448道需博士级专业知识的问题,人类领域专家准确率约81%,非专家约34%
4 more timeline events
All Facts (14)
标准AI基准测试包括MMLU(涵盖57个学科的综合知识测试)、GPQA(研究生级别专业问答)、SWE-bench(真实软件工程任务)、HumanEval和MBPP(编程能力)、MATH和GSM8K(数学推理)
70%VerifiedGPQA(研究生级别专业问答)专注于需要博士级专业知识的问题
65%UnverifiedThe industry has begun shifting toward more challenging benchmarks like GPQA and MATH as older benchmarks lose discriminative power
80%Unverified近年出现的高难度评测包括GPQA(研究生级科学问答)、SWE-bench(真实软件工程任务)以及各类Agentic评测
50%UnverifiedDeepSeek V4.1 Flash 在纯学术、纯知识型任务(如 GPQA)上有所欠缺,不适合承担深度学术研究或复杂文字创作工作
50%UnverifiedDeepSeek V4.1 Flash 在 GPQA、HLE 等方面的评分低于此前版本
50%Unverified业界常用的基准测试还包括GSM8K(数学推理)、GPQA(研究生级别问答)、ARC(科学推理)
50%UnverifiedGPQA是研究生级别科学问答基准,SWE-bench针对软件工程真实任务
50%UnverifiedMMLU涵盖57个学科的选择题,GPQA专注博士级别科学问题且经过Google-Proof设计,HumanEval聚焦Python代码生成
50%Unverified许多经典基准已趋于饱和(如HellaSwag上多个模型得分超过95%),业界正在开发更具区分度的新基准如GPQA、SWE-bench、LiveBench
50%Unverified行业普遍依赖MMLU、HumanEval、GPQA、SWE-bench等基准测试衡量模型能力
50%Unverified基准测试饱和(benchmark saturation)指当多个模型在某项基准上都接近满分时该基准失去区分能力,促使社区推出 GPQA、SWE-bench 等新评测标准
50%UnverifiedGPQA由纽约大学等机构于2023年开发,包含448道需博士级专业知识的问题,人类领域专家准确率约81%,非专家约34%
50%UnverifiedMythos Preview比Mythos 5早发布两个多月,但在UK AISI cyber ranges、GPQA、HLE+tools、OSWorld及多数病毒学任务等多项基准测试上超越了Mythos 5
50%