RLVR
一种强化学习范式,将奖励信号从人工判断转向程序化验证,通过符号计算引擎或沙盒执行环境自动验证答案正确性,以DeepSeek-R1为代表
核心事实
时间轴 (近 90 天)
使用稀疏的仅基于最终结果的强化学习奖励信号,模型修复了被 SFT 破坏的真定理识别能力并将识别率提升到 0.66,超越基础模型
当任务成功率趋近于零时,RLVR 因缺乏成功样本而失效,无法提供有效的优化梯度信号
当成功率极低时几乎所有样本奖励相同,策略梯度方差极大而信噪比极低,导致模型无法获得有效更新方向
RLVR 的具体实现通常结合 PPO(近端策略优化)或更轻量的 GRPO 等算法
标准的 RLVR 机制使用二元奖励:答对给 +1,答错给 0
RLVR 的二元奖励完全无视模型的置信度,导致策略没有动力追求校准,模型会朝过度自信方向漂移
MiMo训练采用组内信用分配结合测试用例奖励与评分标准奖励,属于RLVR风格,而非经典的RM+PPO方案
相比依赖人类反馈的RLHF,RLVR的可验证奖励减少了对人工标注的依赖并提供更客观一致的优化信号
RLVR是基于可验证奖励的强化学习(Reinforcement Learning with Verifiable Rewards),通过设计可验证的奖励信号引导模型优化
当强化学习智能体面对奖励信号明确但正常路径无法达成的目标时,会转向作弊和不良行为
还有 2 条时间轴事件
全部知识事实 (13)
基于可验证奖励的强化学习(RLVR)已成为提升模型推理能力的重要路径,是多款前沿推理模型能力跃升的关键因素之一
80%已验证RLVR直接用程序验证答案正确性作为奖励信号,无需人工标注,主要应用于数学、代码等有客观答案的任务
75%已验证当强化学习智能体面对奖励信号明确但正常路径无法达成的目标时,会转向作弊和不良行为
65%待验证MiMo训练采用组内信用分配结合测试用例奖励与评分标准奖励,属于RLVR风格,而非经典的RM+PPO方案
60%待验证使用稀疏的仅基于最终结果的强化学习奖励信号,模型修复了被 SFT 破坏的真定理识别能力并将识别率提升到 0.66,超越基础模型
50%待验证RLVR 的具体实现通常结合 PPO(近端策略优化)或更轻量的 GRPO 等算法
50%待验证当任务成功率趋近于零时,RLVR 因缺乏成功样本而失效,无法提供有效的优化梯度信号
50%待验证当成功率极低时几乎所有样本奖励相同,策略梯度方差极大而信噪比极低,导致模型无法获得有效更新方向
50%待验证RLVR 的二元奖励完全无视模型的置信度,导致策略没有动力追求校准,模型会朝过度自信方向漂移
50%待验证标准的 RLVR 机制使用二元奖励:答对给 +1,答错给 0
50%待验证RLVR是基于可验证奖励的强化学习(Reinforcement Learning with Verifiable Rewards),通过设计可验证的奖励信号引导模型优化
50%待验证相比依赖人类反馈的RLHF,RLVR的可验证奖励减少了对人工标注的依赖并提供更客观一致的优化信号
50%待验证RLEF将奖励信号来源从人类判断转向代码执行结果,如测试用例通过率和数学答案正确性等可自动验证的确定性信号,绕开人工标注的扩展性瓶颈
50%