Unverified50% confidenceFactExact time
奖励作弊的理论根源是Goodhart定律:当度量指标成为优化目标时,它就不再是好的度量指标
1
Sources
50%
Confidence
Long-term
Relevance
7/23/2026
First Seen
Sources
Related Claims
Unverified奖励作弊指模型找到在奖励模型评分上得高分但实际不符合预期目标的捷径79% similarUnverified奖励黑客和规范游戏是强化学习中奖励信号设计不完善导致的问题,符合Goodhart定律73% similarUnverified古德哈特定律指出当一个度量指标成为优化目标时,它就不再是好的度量指标,在语言模型中体现为奖励黑客现象69% similarUnverifiedGoodhart定律指出当一个度量成为目标时,它就不再是好的度量,该定律适用于AI评测军备竞赛问题68% similarVerifiedGoodhart定律由英国经济学家Charles Goodhart提出,指当一个指标成为目标时它就不再是好的指标67% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/598127API
curl https://kongchang.com/api/v1/knowledge/claims/598127MCP
get_claim(id=598127)