概念Prompt Injection / 提示词注入
Prompt注入
针对LLM应用的安全攻击方式,攻击者通过在Agent处理的外部内容中嵌入恶意指令,诱导Agent忽略原始系统提示并执行未授权操作,在多Agent系统中危害尤为严重
时间轴 (近 90 天)
9月11日
Agent可能因幻觉(Hallucination)或Prompt注入攻击执行远超预期的破坏性操作
待验证50%
8月27日
即使prompt注入成功改变了模型行为,若容器层面锁死了网络、文件系统和API访问,模型也无法执行危险操作
待验证50%