[KongchangAI]
BenchmarkKingBench

KingBench 3

一套面向大语言模型的综合能力评测基准,涵盖模拟、3D交互、SVG绘制、数学推理和微调等多个维度

Timeline (last 90 days)

Sep 30

在UP主的KingBench 3八项测试中,GPT-6 Sol得66/80(82.5%),Opus 5.5得75/80(93.75%),Opus领先11.25个百分点

Unverified50%
Sep 15

在3D手表题上,此前历史最高纪录是 Muse Spark 1.3 拿下的8分

Expired50%
Sep 15

Qwen3 Max 0902 在 KingBench 3 的3D手表题上拿到满分10分,是任何模型在该题上的首个满分

Expired50%
Sep 15

Qwen3 Max 0902 相比上一版在电梯模拟、隐形眼镜盒、弓箭射击三道题上失分,仅在3D手表题上加分

Expired50%
Sep 11

在8项KingBench 3小型测试中,Astra在3D折叠桌、熊猫吃汉堡SVG和3D腕表测试上取胜,Fable在电梯、眼镜盒和射箭上占优

Unverified50%
Sep 11

GPT-6 Astra在KingBench 3基准上获得90%的高分(72/80)

Unverified50%
Sep 11

Fable 5.1在KingBench 3小型测试中获得74/80(92.5%),比Astra高2分

Unverified50%
Jul 23

在博主的KingBench基准测试中,Qwen3该版本获得65/80分(81.25%),位列第二名

Unverified50%
Jul 11

Grok 4.5生成的Minecraft克隆版在所有顶尖模型中排名第三,前两名分别是Fable 5和GPT 5.5

Unverified50%

All Facts (6)

Source Articles