概念Omni-domain Policy Distillation / 全域策略蒸馏
OPD
一种多教师知识蒸馏训练技术,同时引入多个在不同领域各有专精的教师模型,让小模型在单次训练中融合多条能力主线,显著提升单位参数的能力密度
时间轴 (近 90 天)
9月16日
OpenBMB采用强化学习结合OPD(全域策略蒸馏)的方式,把16个专家模型(含5个agent专家)的能力合并进MiniCPM5-2B
待验证50%
一种多教师知识蒸馏训练技术,同时引入多个在不同领域各有专精的教师模型,让小模型在单次训练中融合多条能力主线,显著提升单位参数的能力密度
OpenBMB采用强化学习结合OPD(全域策略蒸馏)的方式,把16个专家模型(含5个agent专家)的能力合并进MiniCPM5-2B