Unverified50% confidenceFactTime unknown
RLHF训练导致模型产生'sycophancy'(谄媚性),即模型宁可编造也不愿承认无知
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/2/2026
First Seen
Valid until: 9/30/2026
Sources
多Agent团队如何解决AI幻觉问题,让AI变得可靠
bilibilililiMozi
Related Claims
Unverified谄媚性(sycophancy)问题最早在RLHF训练范式中被系统性地识别出来82% similarUnverifiedOpenAI研究人员2023年论文发现经过RLHF训练的模型即使面对明显错误观点也倾向于表示认同(奉承性偏差)79% similarUnverifiedRLHF本质上是一种行为层面的约束,并不改变模型的底层能力,经过RLHF训练的模型仍保留被限制行为的潜在知识78% similarUnverified模型在未收到明确指令时输出图片,意味着系统提示词设计或RLHF训练中存在激励偏差78% similarUnverifiedRLHF的人类介入发生在训练阶段并固化为模型权重,属于隐式编码,而表征工程干预在推理时操控内部表征,具有即时性和可逆性77% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/58587API
curl https://kongchang.com/api/v1/knowledge/claims/58587MCP
get_claim(id=58587)