[控场AI]
基准

MMLU-Pro

原版MMLU基准测试的加强版,将选项数量从4个扩展至10个,并引入更多需要深度推理而非记忆的题目,更难通过猜测刷高分

时间轴 (近 90 天)

10月6日

在全部 38 项基准中,Aplomb 1 在 8 项上拿到 5.3B 以内模型最高分,包括 MMLU-Pro、GPQA Diamond 和 BBH

待验证50%
10月2日

2.0 的知识类能力下滑(MMLU-Pro 72.5 对比基础 78.5),竞赛级代码能力下降(LiveCodeBench 51 对比 56)

待验证50%
9月25日

评测覆盖MMLU-Pro、GPQA Diamond、GSM8K、德语MGSM和IFEval五个基准

待验证50%
9月25日

在MMLU-Pro基准上Flash-Next IQ4_XS得分83.8%,Qwen3 27B FP8得分75.0%

待验证50%
9月8日

多个前沿模型在MMLU上的得分差距已缩小到百分之一的量级,推动了MMLU-Pro和ARC-AGI等更高难度基准的出现

待验证50%

全部知识事实 (5)

来源文章