待验证50% 置信事实精确时间
贝尔曼方程将长期回报分解为即时奖励加上未来折扣回报的递归关系
1
来源数
50%
置信度
长期有效
时效性
2026/8/27
首次发现
来源
涉及实体
相关事实
待验证当奖励函数未对控制代价加以惩罚时,梯度会持续将策略推向动作边界,产生 Bang-Bang 行为,这被称为奖励作弊(Reward Hacking)68% 相似待验证标准RL中TD学习通过自举机制将远期奖励逐步向前传播,蒙特卡洛方法则等待完整轨迹后再回溯分配奖励64% 相似待验证每日重置机制运用了损失厌恶、零点效应(Fresh Start Effect)和稀缺性等行为经济学原理来驱动用户每日复购64% 相似已验证反向传播的本质是链式求导,损失函数对每一层参数的梯度从输出层向输入层逐层传递,前提是损失函数必须存在且可微63% 相似待验证模型在PPO优化中通过增加输出长度获取更高奖励的现象被称为reward hacking(奖励攻击)62% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/810019API
curl https://kongchang.com/api/v1/knowledge/claims/810019MCP
get_claim(id=810019)