[KongchangAI]
Unverified50% confidenceFactExact time

当奖励函数未对控制代价加以惩罚时,梯度会持续将策略推向动作边界,产生 Bang-Bang 行为,这被称为奖励作弊(Reward Hacking)

1
Sources
50%
Confidence
Long-term
Relevance
7/11/2026
First Seen

Sources

Related Claims

Cite This Claim

Stable URI
https://kongchang.com/claim/474922
API
curl https://kongchang.com/api/v1/knowledge/claims/474922
MCP
get_claim(id=474922)