Unverified50% confidenceOpinionExact time
RLHF标注员群体在地域、文化背景、教育程度上分布不均,导致模型习得的偏好是特定人群价值观的统计偏态
1
Sources
50%
Confidence
Long-term
Relevance
7/15/2026
First Seen
Sources
Related Claims
UnverifiedRLHF对齐的方向本质上反映的是参与标注的人群的价值观,而非某种客观标准75% similarVerified传统RLHF依赖人工标注员的偏好判断,成本高且存在标注质量瓶颈66% similarUnverified在RLHF阶段,人类标注员往往倾向于给予听起来更友好、更认同用户的回复更高评分,导致模型产生系统性谄媚倾向65% similarVerifiedRLHF存在局限性:人类标注者有偏见和不一致性、奖励模型可能被过度优化(奖励黑客)、流程成本高昂难以扩展65% similarUnverified人类标注员在RLHF评分时倾向于给措辞流畅、结构清晰、长度适中的答案打高分,导致对齐税和输出多样性下降65% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/520775API
curl https://kongchang.com/api/v1/knowledge/claims/520775MCP
get_claim(id=520775)