RLCD
一种新颖的模型训练范式,通过构造正负样本对进行对比学习,结合强化学习信号蒸馏模型输出分布。与PPO不同,RLCD借助优质输出与劣质输出的对比引导策略改进,在无需人工标注奖励的场景下具有优势。
Timeline (last 90 days)
使用无偏的留一法(leave-one-out)估计器能够恢复RLCD大部分性能差距
RLCD的奖励归一化机制将带噪声的得分函数项放大了3.6到15倍,是其性能差距的主要原因
RLCD(Reinforcement Learning from Contrastive Distillation)配方比标准交叉熵落后2.5到3.0个百分点
Jev 的训练方法叫 RLCD(Reinforcement Learning for Calibrated Decisions,面向校准决策的强化学习),把校准作为优化目标
RLCD(Reinforcement Learning for Calibrated Decisions)是 TypeSafe 的产品 Jev 背后的方法,旨在解决 RLVR 忽视置信度的问题
RLCD 的关键改动是把 0/1 奖励替换成适当评分规则(proper scoring rule)
作者推测 RLCD 采用 Brier 分数作为评分规则,但 TypeSafe 官方尚未公开具体的奖励函数实现
RLCD 在 Brier 分数之外叠加了按箱(per-bin)计算的校准惩罚项,类似 ECE 的思路,在过度自信区间降低奖励、信心不足区间提高奖励
真正有效的做法是把校准惩罚按箱归因(per-bin attribution),只有在不同置信度区间之间制造奖励差异才能转化为有意义的梯度信号
校准奖励存在一个未验证的风险:可能只是把所有输出的置信度压平到中间值,在 ECE 指标上表现好却丧失判别信息
9 more timeline events
All Facts (19)
Jev声称使用RLCD训练方法
60%UnverifiedRLCD是作者自称的(非官方命名)基于策略梯度的强化学习方法,针对严格正确评分规则优化决策模型,只有当模型输出数学上校准的概率时才获得最大奖励
60%UnverifiedRLCD通过构造正负样本对进行对比学习,结合强化学习信号蒸馏模型输出分布,在无需人工标注奖励的场景下具有优势
60%UnverifiedRLCD的奖励归一化机制将带噪声的得分函数项放大了3.6到15倍,是其性能差距的主要原因
50%Unverified使用无偏的留一法(leave-one-out)估计器能够恢复RLCD大部分性能差距
50%UnverifiedRLCD(Reinforcement Learning from Contrastive Distillation)配方比标准交叉熵落后2.5到3.0个百分点
50%UnverifiedJev 的训练方法叫 RLCD(Reinforcement Learning for Calibrated Decisions,面向校准决策的强化学习),把校准作为优化目标
50%UnverifiedRLCD(Reinforcement Learning for Calibrated Decisions)是 TypeSafe 的产品 Jev 背后的方法,旨在解决 RLVR 忽视置信度的问题
50%UnverifiedRLCD 的关键改动是把 0/1 奖励替换成适当评分规则(proper scoring rule)
50%Unverified作者推测 RLCD 采用 Brier 分数作为评分规则,但 TypeSafe 官方尚未公开具体的奖励函数实现
50%UnverifiedRLCD 在 Brier 分数之外叠加了按箱(per-bin)计算的校准惩罚项,类似 ECE 的思路,在过度自信区间降低奖励、信心不足区间提高奖励
50%Unverified真正有效的做法是把校准惩罚按箱归因(per-bin attribution),只有在不同置信度区间之间制造奖励差异才能转化为有意义的梯度信号
50%Unverified校准奖励存在一个未验证的风险:可能只是把所有输出的置信度压平到中间值,在 ECE 指标上表现好却丧失判别信息
50%UnverifiedRLCD将优化目标从人类满意度切换为决策校准度,即模型输出的置信度与实际正确率高度匹配
50%UnverifiedDiogo Almeida花了两年时间研发一种新的训练方法RLCD(面向校准决策的强化学习)
50%UnverifiedLaya是一款开源决策模型,基于Jev架构演进而来,通过RLCD训练方法在多项Jev基准测试中实现超越
50%Unverified被对标的架构(作者称之为 Jev)采用并行采样,通过 RLCD 进行训练,输出置信度分布和 schema 选择
50%Unverified被对比的jev架构采用并行采样,通过RLCD(对比蒸馏强化学习)训练,输出置信度分布和schema选择
50%UnverifiedPPO与RLCD两套方案都试图脱离自回归范式、用强化学习产出结构化的概率或置信度输出
50%