监督微调(Supervised Fine-Tuning,SFT)是一种机器学习技术,指在预训练模型基础上,使用标注好的指令-响应对数据进行有监督训练,使模型学习遵循指令并生成符合预期的输出。在大语言模型对齐流程中,SFT是使模型具备对话和指令跟随能力的关键步骤,训练时通常仅对模型回复部分计算损失,以引导模型学习正确的回答模式。
过度充分的SFT可能损害后续RL的探索空间,一个完美收敛的SFT模型未必是RL的最佳起点
标准SFT流程中模型会持续在已经拟合良好的序列上消耗梯度,导致输出分布收窄、熵降低,从而压缩了后续RL的探索空间
微软研究团队提出了名为TailSFT的方法,通过在训练过程中动态识别并过滤掉模型已经拟合良好的序列,将学习资源集中到建模不足的尾部数据上
点版本升级通过监督微调(SFT)、强化学习人类反馈(RLHF)或直接偏好优化(DPO)等后训练技术进行,成本低于全新预训练
监督微调(SFT)使用'提示-回答'示例对训练模型,使其从输出乱码变为能进行有意义的问答
SFT微调有效但导致小模型通用知识下降,即灾难性遗忘现象,因小模型容量瓶颈突出
在 SFT 中少而精的高质量数据往往优于海量的低质量数据
一个典型的后训练流水线是:预训练 → 监督微调(SFT)→ 偏好优化(RLHF / DPO / GRPO)
一个典型的对话AI模型训练需经历四个阶段:预训练、有监督微调(SFT)、奖励模型训练和近端策略优化(PPO)
典型的SFT数据集可能只有数万到数十万条样本,远小于预训练数据规模
2 more timeline events
当代前沿模型的训练方法包括RLHF(基于人类反馈的强化学习)及其后继者RLAIF和过程奖励模型(PRM)
80%Verified大模型训练经历三个核心阶段:预训练、有监督微调(SFT)和偏好对齐
65%VerifiedSFT训练时模型只在assistant部分计算损失(损失掩码技术),即只学习如何回答,不学习如何提问
65%Unverified继续预训练(CPT)后通常还需要再做一轮SFT才能恢复模型的对话能力,因为CPT可能会削弱模型在SFT阶段学到的指令遵循能力
85%Partially Verified从预训练检查点到可商用产品需经历监督式指令微调(SFT)和基于人类反馈的强化学习(RLHF)两个后训练阶段
65%UnverifiedSFT阶段的学习率通常比预训练低1-2个数量级,以避免破坏预训练阶段学到的通用知识
60%Unverified过度充分的SFT可能损害后续RL的探索空间,一个完美收敛的SFT模型未必是RL的最佳起点
50%Unverified微软研究团队提出了名为TailSFT的方法,通过在训练过程中动态识别并过滤掉模型已经拟合良好的序列,将学习资源集中到建模不足的尾部数据上
50%Unverified标准SFT流程中模型会持续在已经拟合良好的序列上消耗梯度,导致输出分布收窄、熵降低,从而压缩了后续RL的探索空间
50%Unverified点版本升级通过监督微调(SFT)、强化学习人类反馈(RLHF)或直接偏好优化(DPO)等后训练技术进行,成本低于全新预训练
50%Unverified监督微调(SFT)使用'提示-回答'示例对训练模型,使其从输出乱码变为能进行有意义的问答
50%UnverifiedSFT微调有效但导致小模型通用知识下降,即灾难性遗忘现象,因小模型容量瓶颈突出
50%Unverified一个典型的后训练流水线是:预训练 → 监督微调(SFT)→ 偏好优化(RLHF / DPO / GRPO)
50%Unverified在 SFT 中少而精的高质量数据往往优于海量的低质量数据
50%Unverified一个典型的对话AI模型训练需经历四个阶段:预训练、有监督微调(SFT)、奖励模型训练和近端策略优化(PPO)
50%Unverified典型的SFT数据集可能只有数万到数十万条样本,远小于预训练数据规模
50%Unverified2018年BERT与GPT的出现开启了预训练+微调范式
50%