Unverified50% confidenceFactExact time
NGU算法将外部奖励与两种内在奖励叠加:基于情节内新奇度的短期奖励和基于生命周期新奇度的长期奖励
1
Sources
50%
Confidence
Long-term
Relevance
9/15/2026
First Seen
Sources
Related Entities
Related Claims
Unverified贝尔曼方程将长期回报分解为即时奖励加上未来折扣回报的递归关系70% similarUnverified将盲盒用作行为奖励时的标准路径:设定明确的可量化目标(如集满5个印章)→ 达成后当场拆盒即时反馈 → 惊喜的随机性维持长期动力,避免每次达标都给同款可预测奖品70% similarUnverified模型在PPO优化中通过增加输出长度获取更高奖励的现象被称为reward hacking(奖励攻击)70% similarUnverified奖励工程本质上是一个高度迭代的过程:设计奖励、观察行为、发现漏洞、修正奖励,反复进行70% similarUnverified建立奖励系统的标准路径:设定明确行为目标→贴纸/印章积分→积满兑换实物小玩具→阶梯式奖励(小奖日常兑,大奖周/月兑),实物奖励只在积分制底层作为兑换物,避免直接给玩具69% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/924066API
curl https://kongchang.com/api/v1/knowledge/claims/924066MCP
get_claim(id=924066)