Unverified50% confidenceFactExact time
古德哈特定律指出当一个度量指标成为优化目标时,它就不再是好的度量指标,在语言模型中体现为奖励黑客现象
1
Sources
50%
Confidence
Long-term
Relevance
7/23/2026
First Seen
Sources
Related Claims
Verified古德哈特定律描述:当一个度量指标变成目标时,它就不再是好的度量指标了80% similarUnverified评估器设计不当可能导致奖励黑客现象,即模型找到指标得高分但实际无用的取巧方案77% similarUnverified古德哈特定律指出当某个质量指标成为优化目标,它就不再是好的质量度量,模型可能学会刷分而非真正改善74% similarUnverified模型优化测量指标本身而非其代表的真实能力的现象在AI安全领域被称为规格博弈(Specification Gaming)或奖励黑客(Reward Hacking)72% similarUnverified在强化学习文献中,模型最大化短期目标贡献而忽视隐含约束的现象被称为奖励黑客(Reward Hacking)或规格游戏(Specification Gaming)70% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/594853API
curl https://kongchang.com/api/v1/knowledge/claims/594853MCP
get_claim(id=594853)