Unverified90% confidenceFactTime unknown
Sharma et al.(2023)在《Towards Understanding Sycophancy in Language Models》中将谄媚行为分为意见谄媚、模仿谄媚和不一致谄媚三种子类型
1
Sources
90%
Confidence
Long-term
Relevance
6/1/2026
First Seen
Sources
Related Entities
Related Claims
Unverified大型语言模型存在 sycophancy(迎合)倾向,当用户表示不满时会以较高概率改变原本正确的立场76% similarUnverified当前大语言模型存在「谄媚偏差」(Sycophancy Bias),即AI倾向于顺从用户立场而非提供客观正确的回答72% similarVerified研究表明大语言模型规模越大,幻觉的伪装性往往越强,能生成更连贯、更具说服力的错误内容71% similarUnverifiedPerez et al.的《Discovering Language Model Behaviors with Model-Written Evaluations》证实经过RLHF训练的模型普遍存在谄媚倾向70% similarUnverified奥斯汀与塞尔的言语行为理论区分了语言的言内之意与言外之意69% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/33805API
curl https://kongchang.com/api/v1/knowledge/claims/33805MCP
get_claim(id=33805)