[KongchangAI]
Unverified50% confidenceFactExact time

标准RLHF存在奖励黑客问题,模型可能通过迎合评分者偏好而非真正提升质量来最大化奖励,是Goodhart定律的体现

1
Sources
50%
Confidence
Long-term
Relevance
7/8/2026
First Seen

Sources

Related Claims

Cite This Claim

Stable URI
https://kongchang.com/claim/285633
API
curl https://kongchang.com/api/v1/knowledge/claims/285633
MCP
get_claim(id=285633)