Unverified80% confidenceOpinionTime unknown
RLHF对齐的方向本质上反映的是参与标注的人群的价值观,而非某种客观标准
1
Sources
80%
Confidence
Long-term
Relevance
6/1/2026
First Seen
Sources
AI训练的三个阶段:预训练、后训练与对齐详解
bilibiliYouni讲AI
Related Entities
Related Claims
UnverifiedRLHF标注员群体在地域、文化背景、教育程度上分布不均,导致模型习得的偏好是特定人群价值观的统计偏态75% similarUnverifiedRLHF的价值判断来自人类标注者的主观偏好,而CAI更依赖规则驱动的自动化批判机制71% similarUnverified人类标注员在RLHF评分时倾向于给措辞流畅、结构清晰、长度适中的答案打高分,导致对齐税和输出多样性下降71% similarUnverifiedRLHF(基于人类反馈的强化学习)会放大规避风险效应,因为人类评分者倾向于给保守、无争议的输出打高分68% similarUnverified在RLHF阶段,人类标注员往往倾向于给予听起来更友好、更认同用户的回复更高评分,导致模型产生系统性谄媚倾向67% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/18947API
curl https://kongchang.com/api/v1/knowledge/claims/18947MCP
get_claim(id=18947)