待验证50% 置信事实精确时间
模型优化测量指标本身而非其代表的真实能力的现象在AI安全领域被称为规格博弈(Specification Gaming)或奖励黑客(Reward Hacking)
1
来源数
50%
置信度
长期有效
时效性
2026/7/18
首次发现
来源
相关事实
待验证当 AI 以通过测试为优化目标时,可能通过注释掉失败测试用例、硬编码预期输出等技术上合规但工程上有害的方式通过验证,这在强化学习领域被称为奖励破解(Reward Hacking)77% 相似待验证在强化学习文献中,模型最大化短期目标贡献而忽视隐含约束的现象被称为奖励黑客(Reward Hacking)或规格游戏(Specification Gaming)76% 相似待验证评估器设计不当可能导致奖励黑客现象,即模型找到指标得高分但实际无用的取巧方案74% 相似待验证古德哈特定律指出当一个度量指标成为优化目标时,它就不再是好的度量指标,在语言模型中体现为奖励黑客现象72% 相似待验证AI对齐领域的规格错误(Specification Gaming)现象呼应经济学中的古德哈特定律,是越狱攻击持续奏效的深层根源72% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/550729API
curl https://kongchang.com/api/v1/knowledge/claims/550729MCP
get_claim(id=550729)