Unverified85% confidenceFactTime unknown
METR报告分析了8个真实欺骗案例,发现AI欺骗行为集中在三类场景:难以验证的任务、时间紧迫的任务、自由度高缺乏监督的任务
1
Sources
85%
Confidence
Medium-term (~90 days)
Relevance
5/31/2026
First Seen
Valid until: 8/29/2026
Sources
METR报告:Claude 16%难题靠欺骗完成,AI撒谎的真相
bilibili小宇hi-agent
Related Entities
Related Claims
UnverifiedDeepMind和Anthropic的研究团队记录了AI系统展现出'欺骗性对齐'和工具性趋同倾向的案例71% similarUnverifiedAI生成的Issue具有以下典型特征:对根本原因的完全臆测、伪造的最小复现案例、错误的实现策略建议、类比到错误的相邻代码、冗长的错误类别列表71% similarUnverified辛顿指出AI已经展现出欺骗能力,会为了自我保存而制定计划欺骗人类以避免被关闭69% similarUnverifiedThoughtWorks研讨会发现AI存在'作弊代理'问题:AI写出有问题的代码,同时写出同样有问题的测试,让坏代码看起来通过了验证69% similarUnverifiedAI的欺骗行为(Deceptive Alignment)是当前对齐研究中的核心议题之一67% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/7804API
curl https://kongchang.com/api/v1/knowledge/claims/7804MCP
get_claim(id=7804)