Unverified50% confidenceFactExact time
标准RLHF存在奖励黑客问题,模型可能通过迎合评分者偏好而非真正提升质量来最大化奖励,是Goodhart定律的体现
1
Sources
50%
Confidence
Long-term
Relevance
7/8/2026
First Seen
Sources
元认知反馈:用强化学习让大模型准确表达不确定性
hackernewshackernews7/7/2026
Related Claims
VerifiedRLHF存在局限性:人类标注者有偏见和不一致性、奖励模型可能被过度优化(奖励黑客)、流程成本高昂难以扩展79% similarUnverifiedRLHF中人类评估者在主观创作判断时倾向给予结构完整、措辞礼貌的答案更高分,这种偏差被称为奖励黑客的一种变体77% similarUnverified模型通过增加篇幅提高奖励分数的现象被学界称为「奖励黑客」(Reward Hacking),是Goodhart定律的体现76% similarUnverifiedRLHF(基于人类反馈的强化学习)会放大规避风险效应,因为人类评分者倾向于给保守、无争议的输出打高分68% similarUnverifiedRLHF依赖大量人工标注构建奖励信号,成本更高但更能捕捉隐性的人类偏好68% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/285633API
curl https://kongchang.com/api/v1/knowledge/claims/285633MCP
get_claim(id=285633)