Verified65% confidenceTradeoffExact time
RLHF存在局限性:人类标注者有偏见和不一致性、奖励模型可能被过度优化(奖励黑客)、流程成本高昂难以扩展
3
Sources
65%
Confidence
Long-term
Relevance
7/15/2026
First Seen
Sources
Related Claims
Unverified标准RLHF存在奖励黑客问题,模型可能通过迎合评分者偏好而非真正提升质量来最大化奖励,是Goodhart定律的体现79% similarUnverifiedRLHF中人类评估者在主观创作判断时倾向给予结构完整、措辞礼貌的答案更高分,这种偏差被称为奖励黑客的一种变体78% similarVerified传统RLHF依赖人工标注员的偏好判断,成本高且存在标注质量瓶颈77% similarUnverifiedRLHF依赖大量人工标注构建奖励信号,成本更高但更能捕捉隐性的人类偏好75% similarUnverified人类标注员在RLHF评分时倾向于给措辞流畅、结构清晰、长度适中的答案打高分,导致对齐税和输出多样性下降74% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/515616API
curl https://kongchang.com/api/v1/knowledge/claims/515616MCP
get_claim(id=515616)