概念OPD / On-Policy Distillation
在线策略蒸馏
大模型训练中的一种蒸馏技术路线,让学生模型在训练过程中持续用自身当前策略生成响应,再由教师模型对这些响应打分或提供概率监督,使学生模型学习改进自身当前错误
时间轴 (近 90 天)
10月2日
2.0 改用在线策略蒸馏,模型自己生成回复由教师模型对每个 token 打分,设置了两个教师(初版模型加隐藏真人指令负责聊天,纯基础模型负责指令遵循/工具调用/代码)
待验证50%
大模型训练中的一种蒸馏技术路线,让学生模型在训练过程中持续用自身当前策略生成响应,再由教师模型对这些响应打分或提供概率监督,使学生模型学习改进自身当前错误
2.0 改用在线策略蒸馏,模型自己生成回复由教师模型对每个 token 打分,设置了两个教师(初版模型加隐藏真人指令负责聊天,纯基础模型负责指令遵循/工具调用/代码)