微软TailSFT:过滤已拟合样本,让SFT更好地为RL铺路

SFT与RL之间被忽视的鸿沟
在大模型的后训练流程中,监督微调(SFT)与强化学习(RL)几乎是标准的两步走范式:先用SFT让模型学会遵循指令、掌握任务格式,再用RL(如GRPO、PPO)进一步提升推理与生成质量。然而,微软研究团队提出了一个尖锐的问题——标准的SFT流程,真的能训练出一个适合做RL的模型吗?
他们的答案是:不能。
这个结论看似简单,却触及了后训练流程中一个长期被忽视的结构性问题。多数团队默认SFT只是RL之前的"热身",越充分越好。但微软的研究揭示了一个反直觉的事实:过度充分的SFT,反而可能损害后续RL的探索空间。
要理解这一结论的分量,需要先明确SFT与RL各自的工作机制。监督微调(Supervised Fine-Tuning)是在预训练模型基础上,使用人工标注的高质量问答对进行有监督训练,使模型学会按照指令生成符合期望格式和内容的回答。而强化学习阶段则通过奖励信号引导模型生成更优质的输出——模型会对同一问题采样多个候选回答,根据奖励模型或规则验证器的反馈来更新策略。此处提到的GRPO(Group Relative Policy Optimization)是DeepSeek提出的一种强化学习算法,通过对同一问题采样一组回答并计算组内相对奖励来估计优势函数,省去了PPO中价值网络的开销;PPO(Proximal Policy Optimization)则是OpenAI提出的经典策略梯度算法,通过裁剪目标函数限制更新幅度以保证训练稳定性。两者虽然机制不同,但都依赖于模型能够采样出足够多样的候选回答。

标准SFT的隐性代价:过度拟合压缩探索空间
研究人员指出了标准SFT的一个核心缺陷:在训练过程中,模型会持续在那些已经拟合良好的序列上消耗梯度。
当模型已经学会了某类样本,继续在这些样本上训练并不会带来实质提升,反而会让模型的输出分布不断收窄——变得越来越"确定"、越来越"自信"。
这对RL来说是致命的。强化学习的本质是在一个概率分布上进行探索与试错,通过奖励信号找到更优的生成路径。如果SFT已经把模型的分布压得过窄,RL在后续阶段就缺乏足够的探索余地,能够采样到的多样化候选答案变少,学习效率自然下降。
从信息论的角度来理解,这一问题更加清晰。在强化学习中,"探索"(exploration)与"利用"(exploitation)的平衡是核心挑战。模型需要在已知的高奖励路径(利用)和未被充分尝试的新路径(探索)之间做权衡。当SFT过度收敛时,模型的输出概率分布趋向于尖峰分布——即熵大幅降低,大部分概率质量集中在少数几个token序列上。这意味着在RL阶段采样时,模型几乎只会生成非常相似的回答,无法有效探索其他可能更优的生成路径。RL算法通常需要初始策略具备足够的熵水平才能进行有效的策略改进,而过度SFT恰恰摧毁了这一前提条件。
这就形成了一个悖论:SFT做得"太好",可能恰恰让模型失去了RL阶段最需要的探索潜力。
TailSFT核心机制:动态过滤已拟合样本
针对这一问题,微软提出了名为 TailSFT 的方法。它的核心思想非常克制——只做一个修改。
聚焦建模不足的尾部数据
TailSFT在训练过程中动态识别并过滤掉那些模型已经拟合良好的序列,把学习资源集中投放到数据分布中"建模不足的尾部"(under-modeled tail)。
这里的"尾部"概念源自统计学中的长尾分布理论。在训练数据中,不同样本的难度分布通常呈现长尾特征:大量样本属于模型容易学会的"头部",而少量困难样本构成"尾部"。传统SFT对所有样本一视同仁地计算梯度,导致头部样本在训练后期贡献的梯度信号本质上是噪声——它们的loss已经很低,继续优化只会让模型在这些模式上过度自信。TailSFT通过在训练过程中动态评估每个序列的拟合程度(通常基于序列级别的loss或困惑度),将loss已经足够低的样本排除出当前batch的梯度计算,从而实现了一种自适应的课程学习效果。
通过将梯度聚焦在这些尚未充分学会的困难样本上,TailSFT既避免了在简单样本上的无效重复训练,又保留了模型输出分布的多样性,从而为后续RL保留了更宽的探索空间。
值得强调的是,这是研究团队实现的唯一改动。相比引入复杂的新架构或训练目标,这种"最小侵入式"的设计更容易被现有流程采纳,也更有说服力——效果的提升可以清晰归因于这一处修改。
实验结果:覆盖率与最终性能的双重提升
研究在 OLMo-3 7B 模型上进行了验证,结果颇具说服力。OLMo(Open Language Model)是Allen Institute for AI(AI2)主导开发的完全开源大语言模型系列,OLMo-3是其第三代版本。选择这一模型具有方法论上的意义:其训练数据、代码和权重均完全开源,确保了实验的可复现性和可信度。7B参数量级是当前学术研究中最常用的规模,既能展示方法的有效性,又不需要极端的计算资源,便于其他团队验证和跟进。
SFT阶段的答案覆盖率提升
用 pass@16 指标衡量模型的答案覆盖能力(即在16次采样中至少答对的概率):
- 编程任务:绝对提升最高达 16.8 分
- 数学任务:绝对提升最高达 3.1 分
pass@k是代码生成和数学推理领域常用的评估指标,最早在OpenAI的Codex论文中被系统化定义。pass@k衡量的是对同一个问题独立采样k次,其中至少有一次答对的概率。pass@1反映模型单次生成的准确率,而pass@16则反映模型在16次独立采样中覆盖正确答案的能力。两者的差异揭示了模型分布的重要特性:如果pass@16远高于pass@1,说明模型的概率分布中包含正确答案但未将其置于最高概率位置——这恰恰是RL可以发挥作用的空间,通过奖励信号将正确答案的生成概率提升上来。
pass@16 的提升意味着模型保留了更丰富的正确答案候选,这正是RL探索所需要的"原料"。
RL阶段的收益传导
更关键的是,这些具有更高覆盖率的检查点,在经过 GRPO 强化学习后,最终的 pass@1(单次采样准确率)也随之提升:
- 最终 pass@1 提升最高达 3.9 分
- 在部分设置下,早期奖励的攀升速度比标准SFT基线快 2.5 倍
这组数据完成了一个完整的因果链条:TailSFT保留了更宽的探索分布 → RL阶段有更多探索空间 → 更快的奖励收敛与更高的最终性能。
对大模型后训练实践的启示
TailSFT 的价值不仅在于具体的性能数字,更在于它重新定义了SFT在后训练流水线中的角色定位。
当前主流的大模型后训练流水线通常包含多个阶段:SFT(指令微调)→ 奖励模型训练(或使用规则验证器)→ RL对齐(如RLHF/GRPO)→ 可选的DPO等直接偏好优化。这一范式最早由InstructGPT论文奠定,后被ChatGPT、Claude、Gemini等主流模型广泛采用。然而,各阶段之间的耦合效应长期缺乏系统性研究,多数团队依赖经验调参来协调各阶段的训练强度。TailSFT的工作正是填补了SFT到RL这一关键过渡环节的理论和方法空白。
长期以来,业界倾向于将SFT与RL视为两个独立优化的环节,各自追求本阶段的最优。但微软的这项工作提醒我们:SFT不应只为自己负责,而应为整个后训练流程负责。 一个"完美收敛"的SFT模型,未必是RL的最佳起点。
对于正在构建大模型后训练流水线的团队,这带来几点实用思考:
- 重新审视SFT的训练强度:过度训练可能在无形中削弱下游RL的潜力。
- 关注分布多样性而非单纯的拟合精度:pass@k 这类覆盖率指标,可能比传统的loss或pass@1更能预示RL阶段的表现。
- 低成本改造的可行性:TailSFT仅需在样本层面做过滤,无需改动模型结构或RL算法,工程落地门槛较低。
结语
在大模型能力竞赛日趋白热化的当下,算法层面的"暴力堆料"正逐渐让位于对训练流程本身的精细化理解。TailSFT 正是这一趋势的缩影——它没有引入炫目的新概念,而是通过对SFT与RL关系的深刻洞察,找到了一处四两拨千斤的改进点。
对于关注后训练技术演进的研究者与工程师而言,这项工作提供了一个重要视角:在追求单阶段最优之前,先想清楚下一阶段真正需要什么样的模型。
论文与详情可参见微软官方发布的研究资料。
相关推荐

30岁零经验转型NLP:语言技术背景如何抓住AI时代机遇
30岁人类语言技术(HLT)毕业生零经验如何转型NLP?本文分析LLM时代语言学背景的差异化优势,提供从技术基础重建、项目积累到岗位切入的完整重启路径,帮助冷门交叉学科毕业生找到职业出路。

Mistral开源Shieldstral:用自然语言定义AI安全护栏的多模态模型
Mistral发布开源多模态安全护栏模型Shieldstral,支持运行时用自然语言定义安全策略,可同时评估文本和图像内容,仅需16GB显存即可本地部署,为AI应用提供灵活高效的内容安全防护方案。

11款AI编程Agent横评:Codex综合第一,Claude Code硬实力最强
系统横评Codex、Claude Code、Cursor、OpenCode等11款主流AI编程Agent,从上手速度、任务能力、生态成熟度、可控性和性价比五个维度打分排名,附选型建议与国产方案推荐。