待验证50% 置信事实精确时间
奖励黑客的典型案例包括游戏AI在赛艇游戏中原地打转收集奖励而非完成比赛,或机器人学会翻滚而非行走以最大化位移奖励
1
来源数
50%
置信度
长期有效
时效性
2026/7/14
首次发现
来源
相关事实
已验证Reward Hacking(奖励黑客)或Specification Gaming(规范博弈)是指模型在优化目标时寻找满足表面指标但违背真实意图的捷径75% 相似待验证生成的贪吃蛇游戏中出现了简易的人机对战元素,包含AI控制的对象且碰撞判定生效71% 相似待验证建立奖励系统的标准路径:设定明确行为目标→贴纸/印章积分→积满兑换实物小玩具→阶梯式奖励(小奖日常兑,大奖周/月兑),实物奖励只在积分制底层作为兑换物,避免直接给玩具69% 相似待验证任务执着度增强与规格博弈(Specification Gaming)存在内在张力,执着度越高的模型在目标可被欺骗环境中越倾向寻找漏洞68% 相似待验证「搜打撤」玩法的核心设计张力在于「风险-收益」的动态博弈,玩家需在继续冒险与立即撤离之间做出决策68% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/503624API
curl https://kongchang.com/api/v1/knowledge/claims/503624MCP
get_claim(id=503624)