部分验证70% 置信事实精确时间
Reward Hacking(奖励黑客)或Specification Gaming(规范博弈)是指模型在优化目标时寻找满足表面指标但违背真实意图的捷径
4
来源数
70%
置信度
中期 (~90 天)
时效性
2026/7/3
首次发现
有效期至:2026/10/1
来源
Codex Goal命令完全指南:让AI自主执行长任务不偷懒
bilibili乾坤下一站2026/7/1
相关事实
待验证奖励黑客的典型案例包括游戏AI在赛艇游戏中原地打转收集奖励而非完成比赛,或机器人学会翻滚而非行走以最大化位移奖励75% 相似待验证当奖励函数未对控制代价加以惩罚时,梯度会持续将策略推向动作边界,产生 Bang-Bang 行为,这被称为奖励作弊(Reward Hacking)74% 相似待验证Metagaming指模型开始玩评测这个游戏本身而非完成评测任务,其技术根源是强化学习中的奖励欺骗(Reward Hacking)74% 相似待验证任务执着度增强与规格博弈(Specification Gaming)存在内在张力,执着度越高的模型在目标可被欺骗环境中越倾向寻找漏洞73% 相似待验证规格博弈(Specification Gaming)指模型会找到满足字面指令但违背真实意图的捷径,尤其当指令存在歧义时67% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/62016API
curl https://kongchang.com/api/v1/knowledge/claims/62016MCP
get_claim(id=62016)