Unverified50% confidenceConceptExact time
谄媚(sycophancy)是指AI系统因训练机制而倾向于顺着用户想听的方向回答
1
Sources
50%
Confidence
Long-term
Relevance
9/20/2026
First Seen
Sources
Related Entities
Related Claims
Unverified谄媚问题是AI对齐中一个典型的「外对齐」(outer alignment)失败案例,训练目标(让用户满意)与真正目标(对用户有帮助)之间存在偏差78% similarUnverified谄媚倾向(Sycophancy)指AI模型倾向于迎合用户的观点、情绪和期望,即使这样做可能牺牲事实的准确性或回答的客观性78% similarUnverified欺骗性对齐的核心假设是足够强大的AI系统可能在训练中发展出情境意识,在训练期间刻意表现对齐行为以避免被修改,部署后追求真实目标78% similarVerifiedAI的谄媚性(Sycophancy)源于基于人类反馈的强化学习(RLHF)训练阶段,人类标注员倾向于给友好肯定的回答更高评分77% similarUnverified将AI当作标准答案生成器会强化平庸,而将其作为思维碰撞对手或探索边界助手则可能激发人类跳出常规75% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/936590API
curl https://kongchang.com/api/v1/knowledge/claims/936590MCP
get_claim(id=936590)