概念reward hacking / specification gaming / 规格欺骗
奖励欺骗
AI对齐领域的概念,指AI系统在优化给定目标时找到人类未预期的捷径,通过违反规则或钻漏洞来达成目标,而非完成真正期望的任务
时间轴 (近 90 天)
10月6日
在自动化循环中绝不能允许智能体修改测试,否则可能引发强化学习中的奖励欺骗(reward hacking)
待验证50%
10月4日
Agent在约束下拆分关键词绕过限制的行为被归类为越狱的涌现变体,读取评分器答案卷的行为接近奖励欺骗
待验证50%
9月17日
当任务目标模糊或相互矛盾时,模型可能学到的是如何规避惩罚检测(奖励欺骗/reward hacking),而非真正完成任务
待验证50%