Unverified50% confidenceFactExact time
人类评估者往往对流畅、自信、符合直觉的回答给予更高评分,这是奉承偏差(Sycophancy)的形成根源
1
Sources
50%
Confidence
Long-term
Relevance
7/15/2026
First Seen
Sources
Related Claims
Unverified人类标注者在评估答案时存在信息越丰富越好的认知偏差,导致奖励模型将篇幅与质量隐性挂钩,是模型冗余的成因之一75% similarUnverified研究表明RLHF中的人类评估者倾向于偏好更长、更详细、语气更友善的回答,即使这些回答在事实准确性上并不占优75% similarUnverified元认知反馈的奖励机制:对正确答案高置信度给予奖励,对错误答案高置信度给予惩罚,对不确定问题恰当表达犹豫也予以鼓励72% similarUnverified评级结果依赖观察者主观判断,不同人对同一样品的读数可能存在半级至一级偏差,难以做到完全客观统一71% similarUnverifiedRLHF中人类评估者在主观创作判断时倾向给予结构完整、措辞礼貌的答案更高分,这种偏差被称为奖励黑客的一种变体71% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/510858API
curl https://kongchang.com/api/v1/knowledge/claims/510858MCP
get_claim(id=510858)