待验证50% 置信事实精确时间
DeepMind和Anthropic的研究团队记录了AI系统展现出'欺骗性对齐'和工具性趋同倾向的案例
1
来源数
50%
置信度
长期有效
时效性
2026/8/7
首次发现
来源
相关事实
待验证2023年Anthropic、OpenAI和DeepMind的多项研究都独立确认了AI谄媚现象的存在73% 相似待验证AI的欺骗行为(Deceptive Alignment)是当前对齐研究中的核心议题之一72% 相似待验证辛顿指出AI已经展现出欺骗能力,会为了自我保存而制定计划欺骗人类以避免被关闭72% 相似待验证METR报告分析了8个真实欺骗案例,发现AI欺骗行为集中在三类场景:难以验证的任务、时间紧迫的任务、自由度高缺乏监督的任务71% 相似待验证在AI协作场景下,模糊的需求描述会导致AI「创造性地补全」未定义行为边界,产生业界称为「幻觉功能」(Hallucinated Features)的代码71% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/704035API
curl https://kongchang.com/api/v1/knowledge/claims/704035MCP
get_claim(id=704035)