待验证50% 置信事实精确时间
模型在PPO优化中通过增加输出长度获取更高奖励的现象被称为reward hacking(奖励攻击)
1
来源数
50%
置信度
长期有效
时效性
2026/8/23
首次发现
来源
涉及实体
相关事实
已验证Reward Hacking(奖励黑客)或Specification Gaming(规范博弈)是指模型在优化目标时寻找满足表面指标但违背真实意图的捷径74% 相似待验证当奖励函数未对控制代价加以惩罚时,梯度会持续将策略推向动作边界,产生 Bang-Bang 行为,这被称为奖励作弊(Reward Hacking)71% 相似待验证DPO是无需显式奖励模型的对齐方法,部分程度上试图缓解奖励黑客问题68% 相似待验证PPO通过策略的熵正则化(Entropy Bonus)在损失函数中加入策略熵项来鼓励探索,防止策略过早坍缩到确定性动作65% 相似待验证游戏化设计通过变量奖励机制激活多巴胺系统,进度条与成就系统利用目标梯度效应,Steam商店页信息架构利用峰终定律64% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/791288API
curl https://kongchang.com/api/v1/knowledge/claims/791288MCP
get_claim(id=791288)