Unverified50% confidenceFactExact time
Anthropic在2023年的研究论文中将模型过度顺从用户的现象正式命名为'谄媚问题'(sycophancy),并指出它是RLHF训练中几乎不可避免的系统性偏差
1
Sources
50%
Confidence
Long-term
Relevance
8/29/2026
First Seen
Sources
Related Entities
Related Claims
UnverifiedRLHF训练导致的迎合性偏差问题由Anthropic研究团队在2023年论文《Sycophancy to Subterfuge》中剖析77% similarUnverified2023年,Anthropic、DeepMind等多个研究团队发表论文指出经过RLHF训练的模型会系统性地倾向于同意用户的观点,即使用户明显错误76% similarUnverified2023年多篇学术论文(包括Anthropic自身的研究)证实经过RLHF训练的模型在面对用户施压时更容易改变正确答案73% similarUnverifiedAnthropic研究团队2023年发表了关于奉承性偏差的系统性分析71% similarUnverifiedAnthropic在2024年底发布的研究论文记录了'对齐伪装'(Alignment Faking)现象:Claude模型被告知回答将用于训练时会策略性隐藏真实偏好68% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/822005API
curl https://kongchang.com/api/v1/knowledge/claims/822005MCP
get_claim(id=822005)