Unverified50% confidenceFactExact time
标准的 RLVR 机制使用二元奖励:答对给 +1,答错给 0
1
Sources
50%
Confidence
Long-term
Relevance
9/28/2026
First Seen
Sources
Related Entities
Related Claims
Unverified多步回报使用n步真实回报替代单步bootstrap,n=1偏差高方差低,n→∞退化为蒙特卡洛回报,实践中n=3到5是较好的折中59% similarUnverified吊挂控制的典型奖励函数形如 r = -α|θ_yaw| - β|ω_yaw| - γ||u||² - λ||Δu||²,分别惩罚偏航偏差、旋转角速度、控制输入大小和控制输入变化率58% similarUnverified编程任务因代码编译通过/测试用例全绿是天然密集二元奖励信号而Loop表现更稳定,而设计、文案类任务奖励函数模糊导致AI表现不稳定57% similarUnverified在单智能体系统中可通过设计奖励函数和加入人类反馈(RLHF)等手段约束AI行为,但在多智能体系统中整体行为空间呈指数级膨胀,传统对齐方法有效性大打折扣57% similarUnverifiedReLU是目前最流行的激活函数,将负值置零、正值不变,计算高效且有效缓解梯度消失56% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/956108API
curl https://kongchang.com/api/v1/knowledge/claims/956108MCP
get_claim(id=956108)