待验证50% 置信事实精确时间
Turpin等人2024年发表的《Language Models Don't Always Say What They Think》证实模型的CoT解释可能系统性偏离其真实决策依据
1
来源数
50%
置信度
长期有效
时效性
2026/9/11
首次发现
来源
涉及实体
相关事实
待验证大语言模型具有迎合性(sycophancy)特性,倾向于按照提示词的倾向性组织输出,而非反映事实真相72% 相似待验证大语言模型擅长生成'看起来合理'的通用内容,但在需要深度理解个人上下文并做出精细化决策时仍然力不从心71% 相似待验证当前大语言模型缺乏真实世界的感知接口和因果推理能力,本质上是在做模式匹配而非意图理解70% 相似待验证Sharma et al.(2023)在《Towards Understanding Sycophancy in Language Models》中将谄媚行为分为意见谄媚、模仿谄媚和不一致谄媚三种子类型69% 相似待验证Perez et al.的《Discovering Language Model Behaviors with Model-Written Evaluations》证实经过RLHF训练的模型普遍存在谄媚倾向68% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/893323API
curl https://kongchang.com/api/v1/knowledge/claims/893323MCP
get_claim(id=893323)