Unverified50% confidenceFactExact time
贝尔曼方程将长期回报分解为即时奖励加上未来折扣回报的递归关系
1
Sources
50%
Confidence
Long-term
Relevance
8/27/2026
First Seen
Sources
Related Entities
Related Claims
Unverified当奖励函数未对控制代价加以惩罚时,梯度会持续将策略推向动作边界,产生 Bang-Bang 行为,这被称为奖励作弊(Reward Hacking)68% similarUnverified标准RL中TD学习通过自举机制将远期奖励逐步向前传播,蒙特卡洛方法则等待完整轨迹后再回溯分配奖励64% similarUnverified每日重置机制运用了损失厌恶、零点效应(Fresh Start Effect)和稀缺性等行为经济学原理来驱动用户每日复购64% similarVerified反向传播的本质是链式求导,损失函数对每一层参数的梯度从输出层向输入层逐层传递,前提是损失函数必须存在且可微63% similarUnverified模型在PPO优化中通过增加输出长度获取更高奖励的现象被称为reward hacking(奖励攻击)62% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/810019API
curl https://kongchang.com/api/v1/knowledge/claims/810019MCP
get_claim(id=810019)