[控场AI]
已验证65% 置信事实精确时间

Reward Hacking(奖励黑客)是强化学习领域的经典问题,其核心在于优化目标(奖励函数)与设计者真实意图之间存在不可避免的差距,最早由DeepMind等研究团队系统性地记录和分析

3
来源数
65%
置信度
长期有效
时效性
2026/9/4
首次发现

来源

涉及实体

相关事实

引用此条事实

Stable URI
https://kongchang.com/claim/852021
API
curl https://kongchang.com/api/v1/knowledge/claims/852021
MCP
get_claim(id=852021)