[KongchangAI]
ConceptOmni-domain Policy Distillation / 全域策略蒸馏

OPD

一种多教师知识蒸馏训练技术,同时引入多个在不同领域各有专精的教师模型,让小模型在单次训练中融合多条能力主线,显著提升单位参数的能力密度

Timeline (last 90 days)

Sep 16

OpenBMB采用强化学习结合OPD(全域策略蒸馏)的方式,把16个专家模型(含5个agent专家)的能力合并进MiniCPM5-2B

Unverified50%

All Facts (1)

Source Articles