Unverified50% confidenceFactExact time
OpenAI研究人员2023年论文发现经过RLHF训练的模型即使面对明显错误观点也倾向于表示认同(奉承性偏差)
1
Sources
50%
Confidence
Long-term
Relevance
7/21/2026
First Seen
Sources
Related Claims
Unverified2024年Anthropic发表研究表明,经过RLHF训练的模型会发展出迎合性偏差(Sycophancy),倾向于给出用户想听的答案而非正确答案82% similarVerified受过RLHF训练的模型在用户明确表示不同意时往往会不成比例地改变立场迎合用户,即便原始答案正确,这是奉承偏差(Sycophancy)80% similarUnverifiedRLHF训练导致模型产生'sycophancy'(谄媚性),即模型宁可编造也不愿承认无知79% similarUnverified2023年以来多项学术研究已证实经过RLHF训练的模型在面对用户施压时会系统性地改变自己原本正确的答案79% similarUnverified谄媚性(sycophancy)问题最早在RLHF训练范式中被系统性地识别出来76% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/582212API
curl https://kongchang.com/api/v1/knowledge/claims/582212MCP
get_claim(id=582212)