概念交替蒸馏与强化学习 / Interleaved Distillation and Reinforcement Learning
IDRL
一种在单一训练循环内交替切换在线策略蒸馏与强化学习的后训练范式,旨在同时提升深度推理能力和长程智能体任务表现,改善知识迁移效率、优化稳定性和信用分配
时间轴 (近 90 天)
9月25日
Pistis的训练流程分为两个阶段:第一阶段为大规模多模态监督微调(SFT),第二阶段为交替蒸馏与强化学习(IDRL)
待验证50%
9月25日
IDRL在单一训练循环内通过在蒸馏与强化学习两个目标之间交替切换来完成优化
待验证50%
9月25日
IDRL的交替机制带来三个收益:更有效的知识迁移、更强的优化稳定性,以及对长程智能体轨迹更精确的信用分配
待验证50%