GSM8K
小学数学应用题基准测试,包含8500道小学水平数学题,用于评估大语言模型的基础数学推理能力
核心事实
时间轴 (近 90 天)
在GSM8K数学推理任务上,Qwen模型适应能保持答案格式合规性,但精确匹配保留效果在0.6B规模受随机种子影响混杂,在1.7B规模甚至有所恶化
在提示词不变的情况下,SymCE 训练的模型能力可迁移到 GSM8K、MATH-500 和 MMLU-college-math 等主流数学推理基准
MMLU、HumanEval、GSM8K等广泛引用的LLM基准均以单轮、封闭式任务为主,模型在固定输入下产生输出后即评分结束
MMLU、HumanEval、GSM8K等主流评测集长期公开在互联网上,模型在预训练或微调阶段极可能接触过这些题目
该实验运行在第 14 个会话达到论文设定的适应标准(连续三个会话通过),前 36 个会话中 bold rate 和 list rate 两个指标均呈下降趋势
仓库中签入的一个 GSM8K 实验在关闭 hermes memory 条件下,使用 72 个会话的作业流,用 Qwen3-32B 扮演学生 persona,用 Qwen3-4B-Thinking 作为被训练的策略模型
知识保留通常通过MMLU、GSM8K、HumanEval等标准基准测试来量化,但目前学术界和工程社区对推理效率的评估尚无标准化框架
评测在树莓派4B(8GB内存、无GPU)上进行,使用来自DeepMind Mathematics、GSM8K和RuleTaker三个数据集共100条提示词
GSM8K是由OpenAI发布的小学数学应用题基准,包含约8500道需要多步推理的文字题
MMLU、HumanEval、GSM8K等曾被广泛引用的基准都先后出现过污染或质疑
还有 40 条时间轴事件
全部知识事实 (20)
基准污染是指测试题目可能已出现在训练数据中,导致高分不能真正代表泛化能力
85%已验证标准AI基准测试包括MMLU(涵盖57个学科的综合知识测试)、GPQA(研究生级别专业问答)、SWE-bench(真实软件工程任务)、HumanEval和MBPP(编程能力)、MATH和GSM8K(数学推理)
85%已验证GSM8K是由OpenAI于2021年发布的小学数学应用题基准,包含约8500道需要2至8步推理的题目
80%已验证在MMLU、HumanEval、GSM8K等主流评测中,头部大模型的得分差距往往只有几个百分点
80%已验证GSM8K, released by OpenAI, contains approximately 8,500 elementary school math word problems designed to test multi-step reasoning ability
75%已验证HumanEval由OpenAI设计,包含164道Python编程题;GSM8K包含8500道小学数学应用题;MMLU涵盖57个学科领域的选择题
75%已验证AI模型基准测试通常在MMLU、HumanEval、GSM8K等标准数据集上评估模型的推理、编码和数学能力
70%已验证当测试题目可能已出现在训练数据中时,高分并不能真正代表泛化能力,这被称为基准污染
65%已验证业界常用的AI评测包括MMLU(大规模多任务语言理解)、HumanEval(代码生成)、GSM8K(数学推理)等,但每个基准只能衡量特定维度的能力
65%已验证泛化能力的取舍需要通过MMLU、GSM8K、HumanEval等跨领域测试集系统验证
65%已验证MMLU、HumanEval、MT-Bench是AI社区广泛认可的标准化基准测试集
65%待验证自我一致性(Self-Consistency)方法由Xuezhi Wang等人提出,在GSM8K等数学推理基准测试中将准确率提升了10%以上
70%部分验证GSM8K是小学数学推理基准,HumanEval是代码生成基准,HellaSwag是常识推理基准
65%待验证MMLU涵盖57个学科、近16,000道选择题;HumanEval由OpenAI开发包含164个编程题;GSM8K包含8,500道小学数学应用题
60%待验证HumanEval由164道Python编程题组成,GSM8K包含8,500道小学数学应用题
60%待验证当前AI模型评测主要依赖标准化基准测试(如MMLU、HumanEval、GSM8K等),但存在数据污染风险和与实际应用脱节的问题
60%待验证在GSM8K数学推理基准上,Self-Consistency相比单次贪婪解码可将准确率提升约17个百分点
60%待验证在GSM8K数学推理任务上,Qwen模型适应能保持答案格式合规性,但精确匹配保留效果在0.6B规模受随机种子影响混杂,在1.7B规模甚至有所恶化
50%待验证在提示词不变的情况下,SymCE 训练的模型能力可迁移到 GSM8K、MATH-500 和 MMLU-college-math 等主流数学推理基准
50%待验证MMLU、HumanEval、GSM8K等广泛引用的LLM基准均以单轮、封闭式任务为主,模型在固定输入下产生输出后即评分结束
50%