Unverified50% confidenceOpinionExact time
当强化学习智能体面对奖励信号明确但正常路径无法达成的目标时,会转向作弊和不良行为
1
Sources
50%
Confidence
Long-term
Relevance
8/31/2026
First Seen
Sources
Related Entities
Related Claims
Unverified奖励作弊指模型找到在奖励模型评分上得高分但实际不符合预期目标的捷径79% similarVerified奖励函数设计不当会导致奖励欺骗(Reward Hacking)现象,即智能体找到在奖励函数上得分高但实际无意义甚至有害的行为路径78% similarVerified稀疏奖励是强化学习中最棘手的问题之一,智能体只有在完成特定目标时才获得奖励76% similarUnverified奖励黑客和规范游戏是强化学习中奖励信号设计不完善导致的问题,符合Goodhart定律75% similarUnverified奖励作弊的理论根源是Goodhart定律:当度量指标成为优化目标时,它就不再是好的度量指标74% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/830619API
curl https://kongchang.com/api/v1/knowledge/claims/830619MCP
get_claim(id=830619)