[KongchangAI]
Benchmark

GPQA Diamond

GPQA Diamond是一个面向研究生级别专业知识的问答基准测试,属于GPQA(Graduate-Level Google-Proof Q&A)系列中难度最高的子集。该基准涵盖生物学、化学、物理学等自然科学领域,题目由领域专家设计,旨在评估大型语言模型在高难度专业推理任务上的能力,是衡量前沿AI模型科学理解水平的重要参考标准之一。

Timeline (last 90 days)

Oct 8

GPQA Diamond是针对博士级科学知识的多项选择题集,覆盖生物、化学、物理,领域专家平均正确率约65%

Unverified50%
Oct 6

在全部 38 项基准中,Aplomb 1 在 8 项上拿到 5.3B 以内模型最高分,包括 MMLU-Pro、GPQA Diamond 和 BBH

Unverified50%
Oct 5

IQ3S档位在GPQA Diamond上得92.93(BF16基线91.92),LiveCodeBench V6为86.86(对比87.43),三项任务平均93.26对93.12,体积不到BF16的四分之一(约22%)

Unverified50%
Sep 25

GPQA Diamond是测试研究生级别科学推理能力的基准,普通人类表现约35%,顶级闭源模型在60-75%区间

Unverified50%
Sep 25

评测覆盖MMLU-Pro、GPQA Diamond、GSM8K、德语MGSM和IFEval五个基准

Unverified50%
Sep 11

NVFP4版Qwen3-27B在MMLU Pro和GPQA Diamond基准上相较未压缩FP16仅有微弱损失

Unverified50%
Sep 11

V4.1 Flash在SWE软件工程基准上得74.2、终端基准90.6、Tonka Forces评测3471分(VS Pro为3348分)

Expired60%
Sep 3

Qwen3.8-27B在Terminal Bench、GPQA Diamond、HLE测试中均落后于Claude Opus 4.6(分别为73 vs 78.2、89.2 vs 91.3、30.8 vs 40)

Unverified60%

All Facts (9)

Source Articles