[KongchangAI]
Verified65% confidenceCautionExact time

RLHF存在Reward Hacking问题,模型可能学会讨好奖励模型而非真正提升回答质量,表现为回答冗长

3
Sources
65%
Confidence
Long-term
Relevance
7/10/2026
First Seen

Sources

Related Claims

Cite This Claim

Stable URI
https://kongchang.com/claim/460707
API
curl https://kongchang.com/api/v1/knowledge/claims/460707
MCP
get_claim(id=460707)