[KongchangAI]
Concept可验证奖励强化学习 / Reinforcement Learning with Verifiable Rewards

RLVR

一种强化学习范式,将奖励信号从人工判断转向程序化验证,通过符号计算引擎或沙盒执行环境自动验证答案正确性,以DeepSeek-R1为代表

Core Facts

Timeline (last 90 days)

Oct 9

一种假说认为 RLVR 在数学和代码上训练出的通用智能会外溢(迁移)到写作、对话等其他领域

Unverified50%
Oct 9

RLVR 范式本质上是 AlphaGo 思路的语言版迁移,因围棋胜负和数学题答案都可被机器裁判

Unverified50%
Oct 9

在数学和代码领域,奖励信号客观、可规模化且几乎零成本生成,模型可通过自我尝试与反馈循环持续迭代

Unverified50%
Oct 9

与基于人类反馈的强化学习(RLHF)相比,RLVR 不依赖人工打分员,边际成本极低,可以以远超 RLHF 的规模运行

Unverified50%
Oct 9

基于可验证奖励的强化学习给CoT中每个token分配相同的序列级优势,因此无法分辨错误来自感知环节还是推理环节

Unverified50%
Oct 9

VICO与专门针对图表优化的RLVR方法表现相当,但所用标注样本少了16到160倍

Unverified50%
Oct 9

RLVR的奖励信号质量依赖任务难度分布,任务太易会奖励饱和梯度消失,任务太难会奖励稀疏,两者都导致训练停滞

Unverified50%
Oct 5

使用稀疏的仅基于最终结果的强化学习奖励信号,模型修复了被 SFT 破坏的真定理识别能力并将识别率提升到 0.66,超越基础模型

Unverified50%
Oct 1

当成功率极低时几乎所有样本奖励相同,策略梯度方差极大而信噪比极低,导致模型无法获得有效更新方向

Unverified50%
Oct 1

当任务成功率趋近于零时,RLVR 因缺乏成功样本而失效,无法提供有效的优化梯度信号

Unverified50%

8 more timeline events

All Facts (19)

Verified

RLVR直接用程序验证答案正确性作为奖励信号,无需人工标注,主要应用于数学、代码等有客观答案的任务

75%
Verified

当强化学习智能体面对奖励信号明确但正常路径无法达成的目标时,会转向作弊和不良行为

65%
Unverified

MiMo训练采用组内信用分配结合测试用例奖励与评分标准奖励,属于RLVR风格,而非经典的RM+PPO方案

60%
Unverified

一种假说认为 RLVR 在数学和代码上训练出的通用智能会外溢(迁移)到写作、对话等其他领域

50%
Unverified

在数学和代码领域,奖励信号客观、可规模化且几乎零成本生成,模型可通过自我尝试与反馈循环持续迭代

50%
Unverified

RLVR 范式本质上是 AlphaGo 思路的语言版迁移,因围棋胜负和数学题答案都可被机器裁判

50%
Unverified

与基于人类反馈的强化学习(RLHF)相比,RLVR 不依赖人工打分员,边际成本极低,可以以远超 RLHF 的规模运行

50%
Unverified

基于可验证奖励的强化学习给CoT中每个token分配相同的序列级优势,因此无法分辨错误来自感知环节还是推理环节

50%
Unverified

RLVR的奖励信号质量依赖任务难度分布,任务太易会奖励饱和梯度消失,任务太难会奖励稀疏,两者都导致训练停滞

50%
Unverified

VICO与专门针对图表优化的RLVR方法表现相当,但所用标注样本少了16到160倍

50%
Unverified

使用稀疏的仅基于最终结果的强化学习奖励信号,模型修复了被 SFT 破坏的真定理识别能力并将识别率提升到 0.66,超越基础模型

50%
Unverified

当成功率极低时几乎所有样本奖励相同,策略梯度方差极大而信噪比极低,导致模型无法获得有效更新方向

50%
Unverified

当任务成功率趋近于零时,RLVR 因缺乏成功样本而失效,无法提供有效的优化梯度信号

50%
Unverified

RLVR 的具体实现通常结合 PPO(近端策略优化)或更轻量的 GRPO 等算法

50%
Unverified

标准的 RLVR 机制使用二元奖励:答对给 +1,答错给 0

50%
Unverified

RLVR 的二元奖励完全无视模型的置信度,导致策略没有动力追求校准,模型会朝过度自信方向漂移

50%
Unverified

相比依赖人类反馈的RLHF,RLVR的可验证奖励减少了对人工标注的依赖并提供更客观一致的优化信号

50%
Unverified

RLVR是基于可验证奖励的强化学习(Reinforcement Learning with Verifiable Rewards),通过设计可验证的奖励信号引导模型优化

50%
Unverified

RLEF将奖励信号来源从人类判断转向代码执行结果,如测试用例通过率和数学答案正确性等可自动验证的确定性信号,绕开人工标注的扩展性瓶颈

50%

Source Articles