[控场AI]
概念Omni-domain Policy Distillation / 全域策略蒸馏

OPD

一种多教师知识蒸馏训练技术,同时引入多个在不同领域各有专精的教师模型,让小模型在单次训练中融合多条能力主线,显著提升单位参数的能力密度

时间轴 (近 90 天)

9月16日

OpenBMB采用强化学习结合OPD(全域策略蒸馏)的方式,把16个专家模型(含5个agent专家)的能力合并进MiniCPM5-2B

待验证50%

全部知识事实 (1)

来源文章