概念Reinforcement Learning from Contrastive Distillation / 对比蒸馏强化学习
RLCD
一种新颖的模型训练范式,通过构造正负样本对进行对比学习,结合强化学习信号蒸馏模型输出分布。与PPO不同,RLCD借助优质输出与劣质输出的对比引导策略改进,在无需人工标注奖励的场景下具有优势。
时间轴 (近 90 天)
9月18日
RLCD是作者自称的(非官方命名)基于策略梯度的强化学习方法,针对严格正确评分规则优化决策模型,只有当模型输出数学上校准的概率时才获得最大奖励
待验证50%
9月17日
被对标的架构(作者称之为 Jev)采用并行采样,通过 RLCD 进行训练,输出置信度分布和 schema 选择
待验证50%
9月17日
RLCD通过构造正负样本对进行对比学习,结合强化学习信号蒸馏模型输出分布,在无需人工标注奖励的场景下具有优势
待验证60%