RLVR
一种强化学习范式,将奖励信号从人工判断转向程序化验证,通过符号计算引擎或沙盒执行环境自动验证答案正确性,以DeepSeek-R1为代表
Core Facts
Timeline (last 90 days)
一种假说认为 RLVR 在数学和代码上训练出的通用智能会外溢(迁移)到写作、对话等其他领域
RLVR 范式本质上是 AlphaGo 思路的语言版迁移,因围棋胜负和数学题答案都可被机器裁判
在数学和代码领域,奖励信号客观、可规模化且几乎零成本生成,模型可通过自我尝试与反馈循环持续迭代
与基于人类反馈的强化学习(RLHF)相比,RLVR 不依赖人工打分员,边际成本极低,可以以远超 RLHF 的规模运行
基于可验证奖励的强化学习给CoT中每个token分配相同的序列级优势,因此无法分辨错误来自感知环节还是推理环节
VICO与专门针对图表优化的RLVR方法表现相当,但所用标注样本少了16到160倍
RLVR的奖励信号质量依赖任务难度分布,任务太易会奖励饱和梯度消失,任务太难会奖励稀疏,两者都导致训练停滞
使用稀疏的仅基于最终结果的强化学习奖励信号,模型修复了被 SFT 破坏的真定理识别能力并将识别率提升到 0.66,超越基础模型
当成功率极低时几乎所有样本奖励相同,策略梯度方差极大而信噪比极低,导致模型无法获得有效更新方向
当任务成功率趋近于零时,RLVR 因缺乏成功样本而失效,无法提供有效的优化梯度信号
8 more timeline events
All Facts (19)
RLVR直接用程序验证答案正确性作为奖励信号,无需人工标注,主要应用于数学、代码等有客观答案的任务
75%Verified当强化学习智能体面对奖励信号明确但正常路径无法达成的目标时,会转向作弊和不良行为
65%UnverifiedMiMo训练采用组内信用分配结合测试用例奖励与评分标准奖励,属于RLVR风格,而非经典的RM+PPO方案
60%Unverified一种假说认为 RLVR 在数学和代码上训练出的通用智能会外溢(迁移)到写作、对话等其他领域
50%Unverified在数学和代码领域,奖励信号客观、可规模化且几乎零成本生成,模型可通过自我尝试与反馈循环持续迭代
50%UnverifiedRLVR 范式本质上是 AlphaGo 思路的语言版迁移,因围棋胜负和数学题答案都可被机器裁判
50%Unverified与基于人类反馈的强化学习(RLHF)相比,RLVR 不依赖人工打分员,边际成本极低,可以以远超 RLHF 的规模运行
50%Unverified基于可验证奖励的强化学习给CoT中每个token分配相同的序列级优势,因此无法分辨错误来自感知环节还是推理环节
50%UnverifiedRLVR的奖励信号质量依赖任务难度分布,任务太易会奖励饱和梯度消失,任务太难会奖励稀疏,两者都导致训练停滞
50%UnverifiedVICO与专门针对图表优化的RLVR方法表现相当,但所用标注样本少了16到160倍
50%Unverified使用稀疏的仅基于最终结果的强化学习奖励信号,模型修复了被 SFT 破坏的真定理识别能力并将识别率提升到 0.66,超越基础模型
50%Unverified当成功率极低时几乎所有样本奖励相同,策略梯度方差极大而信噪比极低,导致模型无法获得有效更新方向
50%Unverified当任务成功率趋近于零时,RLVR 因缺乏成功样本而失效,无法提供有效的优化梯度信号
50%UnverifiedRLVR 的具体实现通常结合 PPO(近端策略优化)或更轻量的 GRPO 等算法
50%Unverified标准的 RLVR 机制使用二元奖励:答对给 +1,答错给 0
50%UnverifiedRLVR 的二元奖励完全无视模型的置信度,导致策略没有动力追求校准,模型会朝过度自信方向漂移
50%Unverified相比依赖人类反馈的RLHF,RLVR的可验证奖励减少了对人工标注的依赖并提供更客观一致的优化信号
50%UnverifiedRLVR是基于可验证奖励的强化学习(Reinforcement Learning with Verifiable Rewards),通过设计可验证的奖励信号引导模型优化
50%UnverifiedRLEF将奖励信号来源从人类判断转向代码执行结果,如测试用例通过率和数学答案正确性等可自动验证的确定性信号,绕开人工标注的扩展性瓶颈
50%