[KongchangAI]
Verified65% confidenceFactExact time

Reward Hacking(奖励黑客)是强化学习领域的经典问题,其核心在于优化目标(奖励函数)与设计者真实意图之间存在不可避免的差距,最早由DeepMind等研究团队系统性地记录和分析

3
Sources
65%
Confidence
Long-term
Relevance
9/4/2026
First Seen

Sources

Related Entities

Related Claims

Cite This Claim

Stable URI
https://kongchang.com/claim/852021
API
curl https://kongchang.com/api/v1/knowledge/claims/852021
MCP
get_claim(id=852021)