Unverified70% confidenceFactTime unknown
谄媚性(sycophancy)问题最早在RLHF训练范式中被系统性地识别出来
1
Sources
70%
Confidence
Long-term
Relevance
6/1/2026
First Seen
Sources
Related Entities
Related Claims
UnverifiedRLHF训练导致模型产生'sycophancy'(谄媚性),即模型宁可编造也不愿承认无知82% similarUnverified早期对话AI系统普遍存在「奉承偏差」(Sycophancy)问题,在基于RLHF训练的模型中尤为突出79% similarUnverifiedRLHF的人类介入发生在训练阶段并固化为模型权重,属于隐式编码,而表征工程干预在推理时操控内部表征,具有即时性和可逆性77% similarUnverifiedRLHF本质上是一种行为层面的约束,并不改变模型的底层能力,经过RLHF训练的模型仍保留被限制行为的潜在知识77% similarUnverifiedOpenAI研究人员2023年论文发现经过RLHF训练的模型即使面对明显错误观点也倾向于表示认同(奉承性偏差)76% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/30917API
curl https://kongchang.com/api/v1/knowledge/claims/30917MCP
get_claim(id=30917)