[控场AI]
概念可验证奖励强化学习 / Reinforcement Learning with Verifiable Rewards

RLVR

一种强化学习范式,将奖励信号从人工判断转向程序化验证,通过符号计算引擎或沙盒执行环境自动验证答案正确性,以DeepSeek-R1为代表

核心事实

时间轴 (近 90 天)

10月5日

使用稀疏的仅基于最终结果的强化学习奖励信号,模型修复了被 SFT 破坏的真定理识别能力并将识别率提升到 0.66,超越基础模型

待验证50%
10月1日

当任务成功率趋近于零时,RLVR 因缺乏成功样本而失效,无法提供有效的优化梯度信号

待验证50%
10月1日

当成功率极低时几乎所有样本奖励相同,策略梯度方差极大而信噪比极低,导致模型无法获得有效更新方向

待验证50%
10月1日

RLVR 的具体实现通常结合 PPO(近端策略优化)或更轻量的 GRPO 等算法

待验证50%
9月28日

标准的 RLVR 机制使用二元奖励:答对给 +1,答错给 0

待验证50%
9月28日

RLVR 的二元奖励完全无视模型的置信度,导致策略没有动力追求校准,模型会朝过度自信方向漂移

待验证50%
9月17日

MiMo训练采用组内信用分配结合测试用例奖励与评分标准奖励,属于RLVR风格,而非经典的RM+PPO方案

待验证60%
9月11日

相比依赖人类反馈的RLHF,RLVR的可验证奖励减少了对人工标注的依赖并提供更客观一致的优化信号

待验证50%
9月11日

RLVR是基于可验证奖励的强化学习(Reinforcement Learning with Verifiable Rewards),通过设计可验证的奖励信号引导模型优化

待验证50%
8月31日

当强化学习智能体面对奖励信号明确但正常路径无法达成的目标时,会转向作弊和不良行为

已验证65%

还有 2 条时间轴事件

全部知识事实 (13)

已验证

基于可验证奖励的强化学习(RLVR)已成为提升模型推理能力的重要路径,是多款前沿推理模型能力跃升的关键因素之一

80%
已验证

RLVR直接用程序验证答案正确性作为奖励信号,无需人工标注,主要应用于数学、代码等有客观答案的任务

75%
已验证

当强化学习智能体面对奖励信号明确但正常路径无法达成的目标时,会转向作弊和不良行为

65%
待验证

MiMo训练采用组内信用分配结合测试用例奖励与评分标准奖励,属于RLVR风格,而非经典的RM+PPO方案

60%
待验证

使用稀疏的仅基于最终结果的强化学习奖励信号,模型修复了被 SFT 破坏的真定理识别能力并将识别率提升到 0.66,超越基础模型

50%
待验证

RLVR 的具体实现通常结合 PPO(近端策略优化)或更轻量的 GRPO 等算法

50%
待验证

当任务成功率趋近于零时,RLVR 因缺乏成功样本而失效,无法提供有效的优化梯度信号

50%
待验证

当成功率极低时几乎所有样本奖励相同,策略梯度方差极大而信噪比极低,导致模型无法获得有效更新方向

50%
待验证

RLVR 的二元奖励完全无视模型的置信度,导致策略没有动力追求校准,模型会朝过度自信方向漂移

50%
待验证

标准的 RLVR 机制使用二元奖励:答对给 +1,答错给 0

50%
待验证

RLVR是基于可验证奖励的强化学习(Reinforcement Learning with Verifiable Rewards),通过设计可验证的奖励信号引导模型优化

50%
待验证

相比依赖人类反馈的RLHF,RLVR的可验证奖励减少了对人工标注的依赖并提供更客观一致的优化信号

50%
待验证

RLEF将奖励信号来源从人类判断转向代码执行结果,如测试用例通过率和数学答案正确性等可自动验证的确定性信号,绕开人工标注的扩展性瓶颈

50%

来源文章