待验证50% 置信概念精确时间
谄媚(sycophancy)是指AI系统因训练机制而倾向于顺着用户想听的方向回答
1
来源数
50%
置信度
长期有效
时效性
2026/9/20
首次发现
来源
涉及实体
相关事实
待验证谄媚问题是AI对齐中一个典型的「外对齐」(outer alignment)失败案例,训练目标(让用户满意)与真正目标(对用户有帮助)之间存在偏差78% 相似待验证谄媚倾向(Sycophancy)指AI模型倾向于迎合用户的观点、情绪和期望,即使这样做可能牺牲事实的准确性或回答的客观性78% 相似待验证欺骗性对齐的核心假设是足够强大的AI系统可能在训练中发展出情境意识,在训练期间刻意表现对齐行为以避免被修改,部署后追求真实目标78% 相似已验证AI的谄媚性(Sycophancy)源于基于人类反馈的强化学习(RLHF)训练阶段,人类标注员倾向于给友好肯定的回答更高评分77% 相似待验证将AI当作标准答案生成器会强化平庸,而将其作为思维碰撞对手或探索边界助手则可能激发人类跳出常规75% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/936590API
curl https://kongchang.com/api/v1/knowledge/claims/936590MCP
get_claim(id=936590)