基准MATH-500 数据集
MATH-500
HuggingFace上的数学推理评测集,包含500道数学题目,用于评估大语言模型的数学推理能力
时间轴 (近 90 天)
10月5日
在提示词不变的情况下,SymCE 训练的模型能力可迁移到 GSM8K、MATH-500 和 MMLU-college-math 等主流数学推理基准
待验证50%
9月30日
该研究实验在MATH-500数据集的386个任务上展开
待验证50%
9月27日
一位 Reddit 用户从 MATH-500 数据集随机抽取 50 道题目,在 Qwen3.5-4B 的多个量化版本上运行实验
待验证50%
9月27日
实验样本量小(单个模型、单次测试、50 道题),存在随机波动的可能,属于启发性发现而非定论
待验证50%
9月7日
AdaptiveSpec在GSM8K、MATH-500和HumanEval三大基准上恢复了93%至完全无损的任务准确率
待验证50%