Unverified50% confidenceFactExact time
RLVR的奖励信号质量依赖任务难度分布,任务太易会奖励饱和梯度消失,任务太难会奖励稀疏,两者都导致训练停滞
1
Sources
50%
Confidence
Long-term
Relevance
10/9/2026
First Seen
Sources
Related Entities
Related Claims
Unverified当任务成功率趋近于零时,RLVR 因缺乏成功样本而失效,无法提供有效的优化梯度信号79% similarUnverified奖励函数设计中稀疏奖励容易让训练停滞,引入距离缩短等密集奖励信号能加速收敛77% similarUnverified低精度引入的数值扰动会在RL的多轮迭代中通过策略梯度的乘积形式被放大,可能导致训练崩溃或模型性能退化72% similarUnverified训练器与推理引擎之间的数值不一致(train-inference mismatch)是导致RL训练不稳定、策略退化的常见隐患72% similarVerified漂移检测存在权衡:阈值设置过于敏感会导致频繁误报和不必要的重训,设置过于宽松则可能让模型性能在无感知中持续退化71% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/990695API
curl https://kongchang.com/api/v1/knowledge/claims/990695MCP
get_claim(id=990695)