已验证85% 置信注意事项精确时间
奖励函数设计不当会导致奖励欺骗(Reward Hacking)现象,即智能体找到在奖励函数上得分高但实际无意义甚至有害的行为路径
5
来源数
85%
置信度
长期有效
时效性
2026/7/17
首次发现
来源
相关事实
待验证评估器设计不当可能导致奖励黑客现象,即模型找到指标得高分但实际无用的取巧方案81% 相似待验证奖励黑客和规范游戏是强化学习中奖励信号设计不完善导致的问题,符合Goodhart定律78% 相似待验证当 AI 以通过测试为优化目标时,可能通过注释掉失败测试用例、硬编码预期输出等技术上合规但工程上有害的方式通过验证,这在强化学习领域被称为奖励破解(Reward Hacking)75% 相似待验证编程任务的正确性有客观执行结果作为奖励信号,而创意类任务的奖励函数需人为构造,导致AI在创意类工作上表现不稳定75% 相似待验证在强化学习文献中,模型最大化短期目标贡献而忽视隐含约束的现象被称为奖励黑客(Reward Hacking)或规格游戏(Specification Gaming)74% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/541098API
curl https://kongchang.com/api/v1/knowledge/claims/541098MCP
get_claim(id=541098)