[控场AI]
概念Supervised Fine-Tuning / 有监督微调

SFT

监督微调(Supervised Fine-Tuning,SFT)是一种机器学习技术,指在预训练模型基础上,使用标注好的指令-响应对数据进行有监督训练,使模型学习遵循指令并生成符合预期的输出。在大语言模型对齐流程中,SFT是使模型具备对话和指令跟随能力的关键步骤,训练时通常仅对模型回复部分计算损失,以引导模型学习正确的回答模式。

核心事实

时间轴 (近 90 天)

10月4日

与监督微调相比,MTRL 不需要人工标注每一步的正确动作,只需定义最终结果的好坏标准,降低了数据标注难度

待验证50%
10月3日

预训练和SFT只提供正向监督,而DPO及RL相邻技术提供负向监督的杠杆,能降低错误序列的概率

待验证50%
10月2日

初版采用普通监督微调(SFT),数据来自 1396 组对话中的 139845 条真实及合成消息

待验证50%
10月2日

企业构建智能客服通常不从头训练模型,而是基于现有模型通过SFT监督微调、LoRA微调注入内部数据

待验证50%
9月30日

压缩思考长度的常见做法是构造短思考-正确答案配对数据进行SFT,或设计长度惩罚奖励函数进行强化学习训练

待验证50%
9月25日

Pistis的训练流程分为两个阶段:第一阶段为大规模多模态监督微调(SFT),第二阶段为交替蒸馏与强化学习(IDRL)

待验证50%
9月24日

相比全量预训练,SFT 所需的数据量和算力要小得多,但仍需要 GPU 集群、分布式训练框架以及检查点管理和实验追踪能力

待验证50%
9月24日

在已有基础模型(如Llama、Mistral系列)上进行监督微调(SFT)或偏好对齐训练(RLHF/DPO),只需数百到数千条高质量任务样本,即可在有限GPU资源下完成

待验证50%
9月22日

SJR在实验中全面超越了端到端SFT、STaR/RFT以及RLFT等多种训练方法

待验证50%
9月20日

推理模型与普通 LLM 的核心区别在于训练方式而非架构,推理模型在预训练和监督微调基础上引入了强化学习阶段

待验证50%

还有 27 条时间轴事件

全部知识事实 (20)

已验证

现代大语言模型通常经历预训练、监督微调(SFT)和基于人类反馈的强化学习(RLHF)三个训练阶段

80%
已验证

当代前沿模型的训练方法包括RLHF(基于人类反馈的强化学习)及其后继者RLAIF和过程奖励模型(PRM)

80%
已验证

大模型训练经历三个核心阶段:预训练、有监督微调(SFT)和偏好对齐

75%
已验证

领域微调通常先通过监督微调(SFT)注入领域知识,再经过基于人类反馈的强化学习(RLHF)对齐用户偏好

65%
已验证

SFT训练时模型只在assistant部分计算损失(损失掩码技术),即只学习如何回答,不学习如何提问

65%
待验证

大模型核心原理包括Transformer架构、预训练、SFT监督微调、RLHF人类反馈强化学习等关键概念

95%
待验证

继续预训练(CPT)后通常还需要再做一轮SFT才能恢复模型的对话能力,因为CPT可能会削弱模型在SFT阶段学到的指令遵循能力

85%
待验证

经过强化学习(RL)训练的模型在Agent任务中表现优于仅经过SFT的模型

70%
部分验证

从预训练检查点到可商用产品需经历监督式指令微调(SFT)和基于人类反馈的强化学习(RLHF)两个后训练阶段

65%
待验证

监督微调(SFT)使用'提示-回答'示例对模型进行训练,让模型学会以对话形式响应,从而使输出更连贯

60%
待验证

SFT微调有效但导致小模型通用知识下降,即灾难性遗忘现象,因小模型容量瓶颈突出

60%
待验证

2018年BERT与GPT的出现开启了预训练+微调范式

60%
待验证

SFT阶段的学习率通常比预训练低1-2个数量级,以避免破坏预训练阶段学到的通用知识

60%
待验证

与监督微调相比,MTRL 不需要人工标注每一步的正确动作,只需定义最终结果的好坏标准,降低了数据标注难度

50%
待验证

预训练和SFT只提供正向监督,而DPO及RL相邻技术提供负向监督的杠杆,能降低错误序列的概率

50%
待验证

初版采用普通监督微调(SFT),数据来自 1396 组对话中的 139845 条真实及合成消息

50%
待验证

企业构建智能客服通常不从头训练模型,而是基于现有模型通过SFT监督微调、LoRA微调注入内部数据

50%
待验证

压缩思考长度的常见做法是构造短思考-正确答案配对数据进行SFT,或设计长度惩罚奖励函数进行强化学习训练

50%
待验证

Pistis的训练流程分为两个阶段:第一阶段为大规模多模态监督微调(SFT),第二阶段为交替蒸馏与强化学习(IDRL)

50%
待验证

相比全量预训练,SFT 所需的数据量和算力要小得多,但仍需要 GPU 集群、分布式训练框架以及检查点管理和实验追踪能力

50%

来源文章