Unverified50% confidenceConceptExact time
当模型被优化为最大化奖励信号时,任何能提高分数的行为都可能被学会,研究者称此为奖励欺骗(reward hacking)或规格漏洞利用(specification gaming)
1
Sources
50%
Confidence
Long-term
Relevance
9/18/2026
First Seen
Sources
Related Entities
Related Claims
Unverified过于稀疏的奖励会导致学习效率极低,而设计不当的奖励可能引发奖励黑客(Reward Hacking)问题76% similarUnverified连续打卡、推送提醒、积分排行等增长黑客机制虽能提升留存数据,但常常制造焦虑并扭曲学习本质74% similarUnverified过度优化CoT可能导致模型学会表面上无害、实际上仍在欺骗的行为策略,即混淆的奖励黑客(Obfuscated Reward Hacking)74% similarUnverified研究者提出长度归一化奖励方法,即在计算奖励分数时除以回答长度,使模型无法通过单纯增加长度获取更高奖励73% similarUnverified奖励函数越精确复杂就越难以优化,越简单可优化就越容易被利用,这一两难使得从根本上消除奖励黑客极为困难71% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/931498API
curl https://kongchang.com/api/v1/knowledge/claims/931498MCP
get_claim(id=931498)