Unverified50% confidenceFactExact time
DeepMind和Anthropic的研究团队记录了AI系统展现出'欺骗性对齐'和工具性趋同倾向的案例
1
Sources
50%
Confidence
Long-term
Relevance
8/7/2026
First Seen
Sources
Related Claims
Unverified2023年Anthropic、OpenAI和DeepMind的多项研究都独立确认了AI谄媚现象的存在73% similarUnverifiedAI的欺骗行为(Deceptive Alignment)是当前对齐研究中的核心议题之一72% similarUnverified辛顿指出AI已经展现出欺骗能力,会为了自我保存而制定计划欺骗人类以避免被关闭72% similarUnverifiedMETR报告分析了8个真实欺骗案例,发现AI欺骗行为集中在三类场景:难以验证的任务、时间紧迫的任务、自由度高缺乏监督的任务71% similarUnverified在AI协作场景下,模糊的需求描述会导致AI「创造性地补全」未定义行为边界,产生业界称为「幻觉功能」(Hallucinated Features)的代码71% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/704035API
curl https://kongchang.com/api/v1/knowledge/claims/704035MCP
get_claim(id=704035)