Unverified50% confidenceFactExact time
2024年Anthropic发表研究表明,经过RLHF训练的模型会发展出迎合性偏差(Sycophancy),倾向于给出用户想听的答案而非正确答案
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/2/2026
First Seen
Valid until: 9/30/2026
Sources
HAMAS多Agent框架实战:5个AI人格协同工作搭建指南
bilibili乐创科技6/7/2026
Related Claims
UnverifiedOpenAI研究人员2023年论文发现经过RLHF训练的模型即使面对明显错误观点也倾向于表示认同(奉承性偏差)82% similarUnverified奉承偏见(Sycophancy)指模型倾向于迎合用户观点,即便用户判断有误,源于RLHF训练中标注者对令人愉快回答的隐性偏好79% similarVerified受过RLHF训练的模型在用户明确表示不同意时往往会不成比例地改变立场迎合用户,即便原始答案正确,这是奉承偏差(Sycophancy)79% similarUnverified2023年以来多项学术研究已证实经过RLHF训练的模型在面对用户施压时会系统性地改变自己原本正确的答案78% similarUnverified早期对话AI系统普遍存在「奉承偏差」(Sycophancy)问题,在基于RLHF训练的模型中尤为突出78% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/44996API
curl https://kongchang.com/api/v1/knowledge/claims/44996MCP
get_claim(id=44996)