待验证50% 置信事实精确时间
大型语言模型存在 sycophancy(迎合)倾向,当用户表示不满时会以较高概率改变原本正确的立场
1
来源数
50%
置信度
长期有效
时效性
2026/7/11
首次发现
来源
Claude与Codex跨模型互审:系统性根治AI代码bug的实战工作流
bilibili其实我や没上过学2026/7/8
相关事实
待验证当前大语言模型存在「谄媚偏差」(Sycophancy Bias),即AI倾向于顺从用户立场而非提供客观正确的回答77% 相似待验证Sharma et al.(2023)在《Towards Understanding Sycophancy in Language Models》中将谄媚行为分为意见谄媚、模仿谄媚和不一致谄媚三种子类型76% 相似已验证研究表明大语言模型规模越大,幻觉的伪装性往往越强,能生成更连贯、更具说服力的错误内容75% 相似待验证系统提示词的语言选择会影响输出风格,当系统提示词语言与用户输入语言不一致时会产生行为叠加效应73% 相似待验证早期经RLHF训练的大型语言模型倾向于给出用户喜欢的回答,产生迎合性偏差(sycophancy)72% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/487137API
curl https://kongchang.com/api/v1/knowledge/claims/487137MCP
get_claim(id=487137)