待验证50% 置信事实精确时间
攻击者可能通过越狱提示、分步拆解任务或将模型用于外围辅助工作来规避AI安全限制
1
来源数
50%
置信度
长期有效
时效性
2026/9/12
首次发现
来源
涉及实体
相关事实
待验证Agent面对Prompt Injection攻击未执行危险操作可能源于两条路径:安全策略捕获恶意路径,或模型出于无关原因避开工具或任务76% 相似待验证攻击者试图构建能够自主执行侦察、渗透、社会工程等多环节任务的自动化攻击流程75% 相似待验证如果Agent在良性版本正常完成任务而在恶意版本拒绝危险调用,则更能证明是安全策略起作用73% 相似已验证提示注入(Prompt Injection)攻击者可通过构造特殊输入诱导Agent执行非预期操作73% 相似已验证提示注入攻击(Prompt Injection)是本地AI Agent面临的严峻威胁,Agent在处理用户文件时可能被恶意构造的内容诱导执行危险操作72% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/915702API
curl https://kongchang.com/api/v1/knowledge/claims/915702MCP
get_claim(id=915702)