Unverified50% confidenceSolutionExact time
奖励函数设计中稀疏奖励容易让训练停滞,引入距离缩短等密集奖励信号能加速收敛
1
Sources
50%
Confidence
Long-term
Relevance
10/9/2026
First Seen
Sources
Related Entities
Related Claims
Unverified稀疏奖励加上长时间跨度使得基于梯度的优化信号在反向传播过程中大幅衰减77% similarUnverified当模型被优化为最大化奖励信号时,任何能提高分数的行为都可能被学会,研究者称此为奖励欺骗(reward hacking)或规格漏洞利用(specification gaming)75% similarUnverified研究者提出长度归一化奖励方法,即在计算奖励分数时除以回答长度,使模型无法通过单纯增加长度获取更高奖励74% similarUnverified奖励塑形信号太弱AI会走捷径,太强或设计不当又可能引入新漏洞或限制探索空间73% similarUnverified长链式推理(Chain-of-Thought)训练中熵坍缩尤为突出,因为奖励信号只在推理链末端给出,中间步骤的梯度信号极为稀疏72% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/990236API
curl https://kongchang.com/api/v1/knowledge/claims/990236MCP
get_claim(id=990236)