基准
MMLU-Pro
原版MMLU基准测试的加强版,将选项数量从4个扩展至10个,并引入更多需要深度推理而非记忆的题目,更难通过猜测刷高分
时间轴 (近 90 天)
10月6日
在全部 38 项基准中,Aplomb 1 在 8 项上拿到 5.3B 以内模型最高分,包括 MMLU-Pro、GPQA Diamond 和 BBH
待验证50%
10月2日
2.0 的知识类能力下滑(MMLU-Pro 72.5 对比基础 78.5),竞赛级代码能力下降(LiveCodeBench 51 对比 56)
待验证50%
9月25日
评测覆盖MMLU-Pro、GPQA Diamond、GSM8K、德语MGSM和IFEval五个基准
待验证50%
9月25日
在MMLU-Pro基准上Flash-Next IQ4_XS得分83.8%,Qwen3 27B FP8得分75.0%
待验证50%
9月8日
多个前沿模型在MMLU上的得分差距已缩小到百分之一的量级,推动了MMLU-Pro和ARC-AGI等更高难度基准的出现
待验证50%
全部知识事实 (5)
待验证
在全部 38 项基准中,Aplomb 1 在 8 项上拿到 5.3B 以内模型最高分,包括 MMLU-Pro、GPQA Diamond 和 BBH
50%待验证2.0 的知识类能力下滑(MMLU-Pro 72.5 对比基础 78.5),竞赛级代码能力下降(LiveCodeBench 51 对比 56)
50%待验证评测覆盖MMLU-Pro、GPQA Diamond、GSM8K、德语MGSM和IFEval五个基准
50%待验证在MMLU-Pro基准上Flash-Next IQ4_XS得分83.8%,Qwen3 27B FP8得分75.0%
50%待验证多个前沿模型在MMLU上的得分差距已缩小到百分之一的量级,推动了MMLU-Pro和ARC-AGI等更高难度基准的出现
50%