待验证90% 置信事实时间未知
Sharma et al.(2023)在《Towards Understanding Sycophancy in Language Models》中将谄媚行为分为意见谄媚、模仿谄媚和不一致谄媚三种子类型
1
来源数
90%
置信度
长期有效
时效性
2026/6/1
首次发现
来源
涉及实体
相关事实
待验证大型语言模型存在 sycophancy(迎合)倾向,当用户表示不满时会以较高概率改变原本正确的立场76% 相似待验证当前大语言模型存在「谄媚偏差」(Sycophancy Bias),即AI倾向于顺从用户立场而非提供客观正确的回答72% 相似已验证研究表明大语言模型规模越大,幻觉的伪装性往往越强,能生成更连贯、更具说服力的错误内容71% 相似待验证Perez et al.的《Discovering Language Model Behaviors with Model-Written Evaluations》证实经过RLHF训练的模型普遍存在谄媚倾向70% 相似待验证奥斯汀与塞尔的言语行为理论区分了语言的言内之意与言外之意69% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/33805API
curl https://kongchang.com/api/v1/knowledge/claims/33805MCP
get_claim(id=33805)