SFT
监督微调(Supervised Fine-Tuning,SFT)是一种机器学习技术,指在预训练模型基础上,使用标注好的指令-响应对数据进行有监督训练,使模型学习遵循指令并生成符合预期的输出。在大语言模型对齐流程中,SFT是使模型具备对话和指令跟随能力的关键步骤,训练时通常仅对模型回复部分计算损失,以引导模型学习正确的回答模式。
核心事实
时间轴 (近 90 天)
与监督微调相比,MTRL 不需要人工标注每一步的正确动作,只需定义最终结果的好坏标准,降低了数据标注难度
预训练和SFT只提供正向监督,而DPO及RL相邻技术提供负向监督的杠杆,能降低错误序列的概率
初版采用普通监督微调(SFT),数据来自 1396 组对话中的 139845 条真实及合成消息
企业构建智能客服通常不从头训练模型,而是基于现有模型通过SFT监督微调、LoRA微调注入内部数据
压缩思考长度的常见做法是构造短思考-正确答案配对数据进行SFT,或设计长度惩罚奖励函数进行强化学习训练
Pistis的训练流程分为两个阶段:第一阶段为大规模多模态监督微调(SFT),第二阶段为交替蒸馏与强化学习(IDRL)
相比全量预训练,SFT 所需的数据量和算力要小得多,但仍需要 GPU 集群、分布式训练框架以及检查点管理和实验追踪能力
在已有基础模型(如Llama、Mistral系列)上进行监督微调(SFT)或偏好对齐训练(RLHF/DPO),只需数百到数千条高质量任务样本,即可在有限GPU资源下完成
SJR在实验中全面超越了端到端SFT、STaR/RFT以及RLFT等多种训练方法
推理模型与普通 LLM 的核心区别在于训练方式而非架构,推理模型在预训练和监督微调基础上引入了强化学习阶段
还有 27 条时间轴事件
全部知识事实 (20)
现代大语言模型通常经历预训练、监督微调(SFT)和基于人类反馈的强化学习(RLHF)三个训练阶段
80%已验证当代前沿模型的训练方法包括RLHF(基于人类反馈的强化学习)及其后继者RLAIF和过程奖励模型(PRM)
80%已验证大模型训练经历三个核心阶段:预训练、有监督微调(SFT)和偏好对齐
75%已验证领域微调通常先通过监督微调(SFT)注入领域知识,再经过基于人类反馈的强化学习(RLHF)对齐用户偏好
65%已验证SFT训练时模型只在assistant部分计算损失(损失掩码技术),即只学习如何回答,不学习如何提问
65%待验证大模型核心原理包括Transformer架构、预训练、SFT监督微调、RLHF人类反馈强化学习等关键概念
95%待验证继续预训练(CPT)后通常还需要再做一轮SFT才能恢复模型的对话能力,因为CPT可能会削弱模型在SFT阶段学到的指令遵循能力
85%待验证经过强化学习(RL)训练的模型在Agent任务中表现优于仅经过SFT的模型
70%部分验证从预训练检查点到可商用产品需经历监督式指令微调(SFT)和基于人类反馈的强化学习(RLHF)两个后训练阶段
65%待验证监督微调(SFT)使用'提示-回答'示例对模型进行训练,让模型学会以对话形式响应,从而使输出更连贯
60%待验证SFT微调有效但导致小模型通用知识下降,即灾难性遗忘现象,因小模型容量瓶颈突出
60%待验证2018年BERT与GPT的出现开启了预训练+微调范式
60%待验证SFT阶段的学习率通常比预训练低1-2个数量级,以避免破坏预训练阶段学到的通用知识
60%待验证与监督微调相比,MTRL 不需要人工标注每一步的正确动作,只需定义最终结果的好坏标准,降低了数据标注难度
50%待验证预训练和SFT只提供正向监督,而DPO及RL相邻技术提供负向监督的杠杆,能降低错误序列的概率
50%待验证初版采用普通监督微调(SFT),数据来自 1396 组对话中的 139845 条真实及合成消息
50%待验证企业构建智能客服通常不从头训练模型,而是基于现有模型通过SFT监督微调、LoRA微调注入内部数据
50%待验证压缩思考长度的常见做法是构造短思考-正确答案配对数据进行SFT,或设计长度惩罚奖励函数进行强化学习训练
50%待验证Pistis的训练流程分为两个阶段:第一阶段为大规模多模态监督微调(SFT),第二阶段为交替蒸馏与强化学习(IDRL)
50%待验证相比全量预训练,SFT 所需的数据量和算力要小得多,但仍需要 GPU 集群、分布式训练框架以及检查点管理和实验追踪能力
50%