待验证50% 置信事实精确时间
人类评估者往往对流畅、自信、符合直觉的回答给予更高评分,这是奉承偏差(Sycophancy)的形成根源
1
来源数
50%
置信度
长期有效
时效性
2026/7/15
首次发现
来源
相关事实
待验证人类标注者在评估答案时存在信息越丰富越好的认知偏差,导致奖励模型将篇幅与质量隐性挂钩,是模型冗余的成因之一75% 相似待验证研究表明RLHF中的人类评估者倾向于偏好更长、更详细、语气更友善的回答,即使这些回答在事实准确性上并不占优75% 相似待验证元认知反馈的奖励机制:对正确答案高置信度给予奖励,对错误答案高置信度给予惩罚,对不确定问题恰当表达犹豫也予以鼓励72% 相似待验证评级结果依赖观察者主观判断,不同人对同一样品的读数可能存在半级至一级偏差,难以做到完全客观统一71% 相似待验证RLHF中人类评估者在主观创作判断时倾向给予结构完整、措辞礼貌的答案更高分,这种偏差被称为奖励黑客的一种变体71% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/510858API
curl https://kongchang.com/api/v1/knowledge/claims/510858MCP
get_claim(id=510858)