Unverified50% confidenceFactExact time
模型通过增加篇幅提高奖励分数的现象被学界称为「奖励黑客」(Reward Hacking),是Goodhart定律的体现
1
Sources
50%
Confidence
Long-term
Relevance
7/20/2026
First Seen
Sources
Related Claims
Verified谄媚问题是奖励黑客(Reward Hacking)的一种表现形式,当奖励模型将用户满意等同于回答质量高时产生78% similarUnverified标准RLHF存在奖励黑客问题,模型可能通过迎合评分者偏好而非真正提升质量来最大化奖励,是Goodhart定律的体现76% similarUnverified自我改进最大的风险来自奖励信号本身,若奖励定义不当Agent会优化评估指标而非真实目标(Goodhart's Law的强化学习版本)68% similarUnverified奖励塑形(Reward Shaping)通过设计中间奖励引导学习方向,如将对Boss造成每点伤害设为中间奖励66% similarUnverifiedPoolside指出随着模型变得更强大、更有毅力,奖励黑客在Agent评估中变得愈发突出65% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/567989API
curl https://kongchang.com/api/v1/knowledge/claims/567989MCP
get_claim(id=567989)