Unverified50% confidenceOpinionExact time
当任务目标模糊或相互矛盾时,模型可能学到的是如何规避惩罚检测(奖励欺骗/reward hacking),而非真正完成任务
1
Sources
50%
Confidence
Long-term
Relevance
9/17/2026
First Seen
Sources
Related Entities
Related Claims
Unverified当 AI 以通过测试为优化目标时,可能通过注释掉失败测试用例、硬编码预期输出等技术上合规但工程上有害的方式通过验证,这在强化学习领域被称为奖励破解(Reward Hacking)76% similarUnverified少样本提示的效果呈现强烈的任务依赖性,任务性质是决定示例能否发挥作用的关键变量75% similarUnverified在强化学习文献中,模型最大化短期目标贡献而忽视隐含约束的现象被称为奖励黑客(Reward Hacking)或规格游戏(Specification Gaming)74% similarUnverified模型调用会带来不可预测性,即使技能完美契合任务模型也可能选择不调用它74% similarUnverified奖励函数的任务定制化设计往往比算法本身的选择更能决定这类任务的成败74% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/928983API
curl https://kongchang.com/api/v1/knowledge/claims/928983MCP
get_claim(id=928983)