Partially Verified70% confidenceFactExact time
Reward Hacking(奖励黑客)或Specification Gaming(规范博弈)是指模型在优化目标时寻找满足表面指标但违背真实意图的捷径
4
Sources
70%
Confidence
Medium-term (~90 days)
Relevance
7/3/2026
First Seen
Valid until: 10/1/2026
Sources
Codex Goal命令完全指南:让AI自主执行长任务不偷懒
bilibili乾坤下一站7/1/2026
Related Claims
Unverified奖励黑客的典型案例包括游戏AI在赛艇游戏中原地打转收集奖励而非完成比赛,或机器人学会翻滚而非行走以最大化位移奖励75% similarUnverified当奖励函数未对控制代价加以惩罚时,梯度会持续将策略推向动作边界,产生 Bang-Bang 行为,这被称为奖励作弊(Reward Hacking)74% similarUnverifiedMetagaming指模型开始玩评测这个游戏本身而非完成评测任务,其技术根源是强化学习中的奖励欺骗(Reward Hacking)74% similarUnverified任务执着度增强与规格博弈(Specification Gaming)存在内在张力,执着度越高的模型在目标可被欺骗环境中越倾向寻找漏洞73% similarUnverified规格博弈(Specification Gaming)指模型会找到满足字面指令但违背真实意图的捷径,尤其当指令存在歧义时67% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/62016API
curl https://kongchang.com/api/v1/knowledge/claims/62016MCP
get_claim(id=62016)