Prompt Injection
AI安全攻击手法,利用大模型无法区分「数据」与「指令」的架构性缺陷,通过构造特定输入绕过模型安全限制,类似传统SQL注入攻击
核心事实
时间轴 (近 90 天)
MCP的安全风险之一是提示注入攻击(Prompt Injection),恶意数据源可能在返回内容中嵌入指令诱导模型执行未经授权的操作
沙箱化不能从根本上消除Prompt注入,但通过限制网络出站和文件访问范围可显著降低注入成功后的危害
将任务指令与粘贴素材明确分离有助于防范提示词注入(Prompt Injection)攻击
mcpgawk设计上确保Agent无法自行绕过关卡批准自己的变更,专门针对提示注入攻击场景
实时可见的桌面画面不能完全防止提示注入攻击,但让用户有机会在操作中发现异常并中断
提示注入攻击的核心逻辑是攻击者无需突破权限边界,只需在智能体读取的文件、网页或邮件中埋入指令即可劫持其行为
工程实践中应对AI读取的外部内容进行输入过滤,并对高危操作强制触发人工确认流程
CLM引入新的prompt injection攻击面:注入的恶意指令可持久化到上下文文件并跨多轮存活,甚至主动阻止自己被删除,论文作者将其列为未解决隐患
Prompt注入防御应采用分层策略:指令来源边界标注、能力门控(Capability Gating)、有副作用工具执行前的输出监控分类器
慢速泄漏攻击可将少量信息分散到多条看似合法的Slack消息中跨会话发送,单条可通过分类器,是未完全解决的开放问题
还有 40 条时间轴事件
全部知识事实 (20)
Prompt注入(Prompt Injection)是针对大语言模型应用的安全威胁,攻击者通过在输入中嵌入恶意指令试图覆盖系统原有行为约束
90%已验证提示注入攻击(Prompt Injection)是本地AI Agent面临的严峻威胁,Agent在处理用户文件时可能被恶意构造的内容诱导执行危险操作
90%已验证Prompt注入(Prompt Injection)是一种针对AI应用的安全攻击方式,类似于传统Web开发中的SQL注入
85%已验证AI Agent 相比传统脚本具有不可预测性,存在幻觉、误解上下文、遭受 prompt 注入攻击等固有风险
80%已验证间接提示注入攻击通过在正常业务数据中植入隐藏指令,诱导Agent执行未经授权的操作,属于语义层面而非代码层面的安全风险
80%已验证提示注入(Prompt Injection)攻击者可通过构造特殊输入诱导Agent执行非预期操作
80%已验证OWASP已将Prompt注入列为LLM应用十大安全风险之首
80%已验证AI系统引入了全新的安全风险维度,包括模型幻觉导致的错误决策、提示注入攻击(Prompt Injection)、训练数据投毒、以及AI代理权限滥用等
80%已验证提示注入是一种针对大语言模型的攻击手法,攻击者通过在模型输入数据中嵌入恶意指令劫持模型的正常行为
75%已验证提示注入(Prompt Injection)本质上是大模型无法区分数据与指令的架构性缺陷,与传统SQL注入中数据库引擎混淆数据与SQL指令类似
75%已验证权限与数据访问范围决定了漏洞的危害等级
70%已验证间接提示注入(indirect prompt injection)是一种攻击向量,攻击者在智能体可能读取的网页、文档或邮件中嵌入恶意指令,诱导智能体执行超出原始任务范围的操作
70%已验证间接提示词注入指攻击指令藏在Agent访问的外部网页、文档或API响应中,当Agent检索并注入上下文时恶意指令随之激活
70%已验证大语言模型在设计上难以严格区分系统指令与用户数据,这是其架构层面的根本性缺陷
70%已验证提示词注入攻击(Prompt Injection)可通过精心构造的用户输入诱导模型忽略系统提示词的约束
70%已验证Prompt注入安全威胁类别最早由安全研究员Simon Willison在2022年系统性提出
70%已验证AI代理操控计算机面临的安全风险包括提示注入攻击、权限升级和不可逆操作等问题
70%已验证间接注入是指攻击者将恶意指令藏在模型会读取的外部内容中(如网页正文、邮件正文或文档内容)
65%已验证提示词注入通过在智能体处理的外部内容中嵌入伪装成指令的文本,诱导智能体偏离原始任务意图
65%已验证提示注入(Prompt Injection)指屏幕上出现的文字或界面元素可能包含恶意指令,诱导AI执行非预期或危险操作
65%