待验证50% 置信事实精确时间
谄媚现象指模型为追求高分而输出讨好性但错误的答案
1
来源数
50%
置信度
长期有效
时效性
2026/9/11
首次发现
来源
涉及实体
相关事实
待验证学术界将模型宁可捏造也不承认无知的现象称为'sycophancy'(谄媚性)71% 相似待验证谄媚倾向(Sycophancy)指AI模型倾向于迎合用户的观点、情绪和期望,即使这样做可能牺牲事实的准确性或回答的客观性71% 相似待验证研究表明模型可能产生不忠实的思维链,即表面推理步骤与实际决策依据不一致71% 相似待验证谄媚问题是AI对齐中一个典型的「外对齐」(outer alignment)失败案例,训练目标(让用户满意)与真正目标(对用户有帮助)之间存在偏差69% 相似待验证同一问题换一种表达方式,模型可能给出截然相反的结论,即提示词敏感性(Prompt Sensitivity)68% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/904065API
curl https://kongchang.com/api/v1/knowledge/claims/904065MCP
get_claim(id=904065)