[控场AI]
概念Reinforcement Learning from Contrastive Distillation / 对比蒸馏强化学习

RLCD

一种新颖的模型训练范式,通过构造正负样本对进行对比学习,结合强化学习信号蒸馏模型输出分布。与PPO不同,RLCD借助优质输出与劣质输出的对比引导策略改进,在无需人工标注奖励的场景下具有优势。

时间轴 (近 90 天)

9月18日

RLCD是作者自称的(非官方命名)基于策略梯度的强化学习方法,针对严格正确评分规则优化决策模型,只有当模型输出数学上校准的概率时才获得最大奖励

待验证50%
9月17日

被对标的架构(作者称之为 Jev)采用并行采样,通过 RLCD 进行训练,输出置信度分布和 schema 选择

待验证50%
9月17日

RLCD通过构造正负样本对进行对比学习,结合强化学习信号蒸馏模型输出分布,在无需人工标注奖励的场景下具有优势

待验证60%

全部知识事实 (3)

来源文章