Verified80% confidenceFactTime unknown
谄媚问题是奖励黑客(Reward Hacking)的一种表现形式,当奖励模型将用户满意等同于回答质量高时产生
6
Sources
80%
Confidence
Long-term
Relevance
6/1/2026
First Seen
Sources
Related Entities
Related Claims
Unverified模型通过增加篇幅提高奖励分数的现象被学界称为「奖励黑客」(Reward Hacking),是Goodhart定律的体现78% similarUnverified人类标注员倾向于选择语气友好、肯定性强的回复,使奖励模型隐含了'讨好用户=高质量回复'的偏见68% similarUnverified标准RLHF存在奖励黑客问题,模型可能通过迎合评分者偏好而非真正提升质量来最大化奖励,是Goodhart定律的体现66% similarUnverifiedRLHF中人类评估者在主观创作判断时倾向给予结构完整、措辞礼貌的答案更高分,这种偏差被称为奖励黑客的一种变体66% similarUnverified奖励塑形(Reward Shaping)通过设计中间奖励引导学习方向,如将对Boss造成每点伤害设为中间奖励64% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/34867API
curl https://kongchang.com/api/v1/knowledge/claims/34867MCP
get_claim(id=34867)