已验证65% 置信事实精确时间
Reward Hacking(奖励黑客)是强化学习领域的经典问题,其核心在于优化目标(奖励函数)与设计者真实意图之间存在不可避免的差距,最早由DeepMind等研究团队系统性地记录和分析
3
来源数
65%
置信度
长期有效
时效性
2026/9/4
首次发现
来源
涉及实体
相关事实
引用此条事实
Stable URI
https://kongchang.com/claim/852021API
curl https://kongchang.com/api/v1/knowledge/claims/852021MCP
get_claim(id=852021)