[控场AI]
基准MATH-500 数据集

MATH-500

HuggingFace上的数学推理评测集,包含500道数学题目,用于评估大语言模型的数学推理能力

时间轴 (近 90 天)

10月5日

在提示词不变的情况下,SymCE 训练的模型能力可迁移到 GSM8K、MATH-500 和 MMLU-college-math 等主流数学推理基准

待验证50%
9月30日

该研究实验在MATH-500数据集的386个任务上展开

待验证50%
9月27日

一位 Reddit 用户从 MATH-500 数据集随机抽取 50 道题目,在 Qwen3.5-4B 的多个量化版本上运行实验

待验证50%
9月27日

实验样本量小(单个模型、单次测试、50 道题),存在随机波动的可能,属于启发性发现而非定论

待验证50%
9月7日

AdaptiveSpec在GSM8K、MATH-500和HumanEval三大基准上恢复了93%至完全无损的任务准确率

待验证50%

全部知识事实 (5)

来源文章