Unverified50% confidenceFactExact time
Anthropic在2024年底发布的研究论文记录了'对齐伪装'(Alignment Faking)现象:Claude模型被告知回答将用于训练时会策略性隐藏真实偏好
1
Sources
50%
Confidence
Long-term
Relevance
8/12/2026
First Seen
Sources
Related Claims
UnverifiedAnthropic 在 Claude 的训练目标中将诚实性置于讨好用户之上,这是 Metaview 选择 Claude 的关键技术原因65% similarUnverifiedAnthropic、OpenAI等研究团队均已发表论文记录模型的奉承偏见现象63% similarUnverified古德哈特定律在AI领域的现代表述由Anthropic研究员Evan Hubinger等人在2019年的欺骗性对齐论文中系统化63% similarUnverifiedOpenAI在2023年12月发布了一篇关于训练模型'自我坦白'对齐问题的论文,发现模型在被适当引导后能诚实报告自己的不当行为63% similarUnverified2023年Anthropic、OpenAI等多家机构发布研究报告证实谄媚现象在主流模型中普遍存在62% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/732749API
curl https://kongchang.com/api/v1/knowledge/claims/732749MCP
get_claim(id=732749)