[KongchangAI]
ConceptReinforcement Learning from Contrastive Distillation / 对比蒸馏强化学习

RLCD

一种新颖的模型训练范式,通过构造正负样本对进行对比学习,结合强化学习信号蒸馏模型输出分布。与PPO不同,RLCD借助优质输出与劣质输出的对比引导策略改进,在无需人工标注奖励的场景下具有优势。

Timeline (last 90 days)

Oct 5

使用无偏的留一法(leave-one-out)估计器能够恢复RLCD大部分性能差距

Unverified50%
Oct 5

RLCD的奖励归一化机制将带噪声的得分函数项放大了3.6到15倍,是其性能差距的主要原因

Unverified50%
Oct 5

RLCD(Reinforcement Learning from Contrastive Distillation)配方比标准交叉熵落后2.5到3.0个百分点

Unverified50%
Oct 3

Jev 的训练方法叫 RLCD(Reinforcement Learning for Calibrated Decisions,面向校准决策的强化学习),把校准作为优化目标

Unverified50%
Sep 28

RLCD(Reinforcement Learning for Calibrated Decisions)是 TypeSafe 的产品 Jev 背后的方法,旨在解决 RLVR 忽视置信度的问题

Unverified50%
Sep 28

RLCD 的关键改动是把 0/1 奖励替换成适当评分规则(proper scoring rule)

Unverified50%
Sep 28

作者推测 RLCD 采用 Brier 分数作为评分规则,但 TypeSafe 官方尚未公开具体的奖励函数实现

Unverified50%
Sep 28

RLCD 在 Brier 分数之外叠加了按箱(per-bin)计算的校准惩罚项,类似 ECE 的思路,在过度自信区间降低奖励、信心不足区间提高奖励

Unverified50%
Sep 28

真正有效的做法是把校准惩罚按箱归因(per-bin attribution),只有在不同置信度区间之间制造奖励差异才能转化为有意义的梯度信号

Unverified50%
Sep 28

校准奖励存在一个未验证的风险:可能只是把所有输出的置信度压平到中间值,在 ECE 指标上表现好却丧失判别信息

Unverified50%

9 more timeline events

All Facts (19)

Unverified

Jev声称使用RLCD训练方法

60%
Unverified

RLCD是作者自称的(非官方命名)基于策略梯度的强化学习方法,针对严格正确评分规则优化决策模型,只有当模型输出数学上校准的概率时才获得最大奖励

60%
Unverified

RLCD通过构造正负样本对进行对比学习,结合强化学习信号蒸馏模型输出分布,在无需人工标注奖励的场景下具有优势

60%
Unverified

RLCD的奖励归一化机制将带噪声的得分函数项放大了3.6到15倍,是其性能差距的主要原因

50%
Unverified

使用无偏的留一法(leave-one-out)估计器能够恢复RLCD大部分性能差距

50%
Unverified

RLCD(Reinforcement Learning from Contrastive Distillation)配方比标准交叉熵落后2.5到3.0个百分点

50%
Unverified

Jev 的训练方法叫 RLCD(Reinforcement Learning for Calibrated Decisions,面向校准决策的强化学习),把校准作为优化目标

50%
Unverified

RLCD(Reinforcement Learning for Calibrated Decisions)是 TypeSafe 的产品 Jev 背后的方法,旨在解决 RLVR 忽视置信度的问题

50%
Unverified

RLCD 的关键改动是把 0/1 奖励替换成适当评分规则(proper scoring rule)

50%
Unverified

作者推测 RLCD 采用 Brier 分数作为评分规则,但 TypeSafe 官方尚未公开具体的奖励函数实现

50%
Unverified

RLCD 在 Brier 分数之外叠加了按箱(per-bin)计算的校准惩罚项,类似 ECE 的思路,在过度自信区间降低奖励、信心不足区间提高奖励

50%
Unverified

真正有效的做法是把校准惩罚按箱归因(per-bin attribution),只有在不同置信度区间之间制造奖励差异才能转化为有意义的梯度信号

50%
Unverified

校准奖励存在一个未验证的风险:可能只是把所有输出的置信度压平到中间值,在 ECE 指标上表现好却丧失判别信息

50%
Unverified

RLCD将优化目标从人类满意度切换为决策校准度,即模型输出的置信度与实际正确率高度匹配

50%
Unverified

Diogo Almeida花了两年时间研发一种新的训练方法RLCD(面向校准决策的强化学习)

50%
Unverified

Laya是一款开源决策模型,基于Jev架构演进而来,通过RLCD训练方法在多项Jev基准测试中实现超越

50%
Unverified

被对标的架构(作者称之为 Jev)采用并行采样,通过 RLCD 进行训练,输出置信度分布和 schema 选择

50%
Unverified

被对比的jev架构采用并行采样,通过RLCD(对比蒸馏强化学习)训练,输出置信度分布和schema选择

50%
Unverified

PPO与RLCD两套方案都试图脱离自回归范式、用强化学习产出结构化的概率或置信度输出

50%

Source Articles