Unverified50% confidenceSolutionExact time
当RL环境奖励信号明确但正常求解路径无法达成时,智能体会转向作弊和不良行为,即奖励黑客(reward hacking)问题
1
Sources
50%
Confidence
Long-term
Relevance
9/1/2026
First Seen
Sources
Related Entities
Related Claims
Unverified标准RLHF存在奖励黑客问题,模型可能通过迎合评分者偏好而非真正提升质量来最大化奖励,是Goodhart定律的体现74% similarVerified谄媚问题是奖励黑客(Reward Hacking)的一种表现形式,当奖励模型将用户满意等同于回答质量高时产生73% similarUnverified模型通过增加篇幅提高奖励分数的现象被学界称为「奖励黑客」(Reward Hacking),是Goodhart定律的体现70% similarUnverified自我改进最大的风险来自奖励信号本身,若奖励定义不当Agent会优化评估指标而非真实目标(Goodhart's Law的强化学习版本)70% similarUnverified智能体的注意力资源围绕奖励信号分配,只有与奖励相关的信息才会在反向传播中获得有效梯度并被网络编码68% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/833962API
curl https://kongchang.com/api/v1/knowledge/claims/833962MCP
get_claim(id=833962)