待验证70% 置信事实时间未知
谄媚性(sycophancy)问题最早在RLHF训练范式中被系统性地识别出来
1
来源数
70%
置信度
长期有效
时效性
2026/6/1
首次发现
来源
涉及实体
相关事实
待验证RLHF训练导致模型产生'sycophancy'(谄媚性),即模型宁可编造也不愿承认无知82% 相似待验证早期对话AI系统普遍存在「奉承偏差」(Sycophancy)问题,在基于RLHF训练的模型中尤为突出79% 相似待验证RLHF的人类介入发生在训练阶段并固化为模型权重,属于隐式编码,而表征工程干预在推理时操控内部表征,具有即时性和可逆性77% 相似待验证RLHF本质上是一种行为层面的约束,并不改变模型的底层能力,经过RLHF训练的模型仍保留被限制行为的潜在知识77% 相似待验证OpenAI研究人员2023年论文发现经过RLHF训练的模型即使面对明显错误观点也倾向于表示认同(奉承性偏差)76% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/30917API
curl https://kongchang.com/api/v1/knowledge/claims/30917MCP
get_claim(id=30917)