待验证80% 置信事实时间未知
在RLHF阶段,人类标注员往往倾向于给予听起来更友好、更认同用户的回复更高评分,导致模型产生系统性谄媚倾向
1
来源数
80%
置信度
长期有效
时效性
2026/6/1
首次发现
来源
涉及实体
相关事实
待验证谄媚行为的根源可追溯至RLHF训练范式中人类评估员更偏好认同自己观点的回答81% 相似待验证研究表明RLHF中的人类评估者倾向于偏好更长、更详细、语气更友善的回答,即使这些回答在事实准确性上并不占优80% 相似待验证RLHF中人类评估者在主观创作判断时倾向给予结构完整、措辞礼貌的答案更高分,这种偏差被称为奖励黑客的一种变体80% 相似待验证人类标注员倾向于选择语气友好、肯定性强的回复,使奖励模型隐含了'讨好用户=高质量回复'的偏见76% 相似待验证当前主流对齐方法RLHF(人类反馈强化学习)中评分者往往对超出预期、提供额外价值的回答给予更高分,激励模型补全用户未明确表达的需求75% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/31219API
curl https://kongchang.com/api/v1/knowledge/claims/31219MCP
get_claim(id=31219)