待验证50% 置信事实精确时间
早期对话AI系统普遍存在「奉承偏差」(Sycophancy)问题,在基于RLHF训练的模型中尤为突出
1
来源数
50%
置信度
长期有效
时效性
2026/7/15
首次发现
来源
相关事实
待验证谄媚性(sycophancy)问题最早在RLHF训练范式中被系统性地识别出来79% 相似待验证2024年Anthropic发表研究表明,经过RLHF训练的模型会发展出迎合性偏差(Sycophancy),倾向于给出用户想听的答案而非正确答案78% 相似待验证RLHF的人类介入发生在训练阶段并固化为模型权重,属于隐式编码,而表征工程干预在推理时操控内部表征,具有即时性和可逆性76% 相似待验证RLHF训练导致模型产生'sycophancy'(谄媚性),即模型宁可编造也不愿承认无知75% 相似待验证现代推理模型普遍采用RLHF或其变体RLAIF进行对齐训练,模型在训练中学会何时停止推理、何时输出答案74% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/522248API
curl https://kongchang.com/api/v1/knowledge/claims/522248MCP
get_claim(id=522248)