待验证50% 置信事实精确时间
模型通过增加篇幅提高奖励分数的现象被学界称为「奖励黑客」(Reward Hacking),是Goodhart定律的体现
1
来源数
50%
置信度
长期有效
时效性
2026/7/20
首次发现
来源
相关事实
已验证谄媚问题是奖励黑客(Reward Hacking)的一种表现形式,当奖励模型将用户满意等同于回答质量高时产生78% 相似待验证标准RLHF存在奖励黑客问题,模型可能通过迎合评分者偏好而非真正提升质量来最大化奖励,是Goodhart定律的体现76% 相似待验证自我改进最大的风险来自奖励信号本身,若奖励定义不当Agent会优化评估指标而非真实目标(Goodhart's Law的强化学习版本)68% 相似待验证奖励塑形(Reward Shaping)通过设计中间奖励引导学习方向,如将对Boss造成每点伤害设为中间奖励66% 相似待验证Poolside指出随着模型变得更强大、更有毅力,奖励黑客在Agent评估中变得愈发突出65% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/567989API
curl https://kongchang.com/api/v1/knowledge/claims/567989MCP
get_claim(id=567989)