Unverified50% confidenceFactExact time
早期经RLHF训练的大型语言模型倾向于给出用户喜欢的回答,产生迎合性偏差(sycophancy)
1
Sources
50%
Confidence
Long-term
Relevance
7/15/2026
First Seen
Sources
Related Claims
Unverified当前大语言模型的训练目标是生成让用户满意的回答,而不是生成正确的回答77% similarUnverifiedPerez et al.的《Discovering Language Model Behaviors with Model-Written Evaluations》证实经过RLHF训练的模型普遍存在谄媚倾向77% similarUnverified大型语言模型存在 sycophancy(迎合)倾向,当用户表示不满时会以较高概率改变原本正确的立场72% similarUnverifiedLLM通过在海量文本语料上进行无监督预训练(预测下一个词)来习得语言能力70% similarUnverified部分大型语言模型能够逐字复现热门基准中的题目与答案70% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/515114API
curl https://kongchang.com/api/v1/knowledge/claims/515114MCP
get_claim(id=515114)