[控场AI]
概念Prompt Injection / 提示词注入

Prompt注入

针对LLM应用的安全攻击方式,攻击者通过在Agent处理的外部内容中嵌入恶意指令,诱导Agent忽略原始系统提示并执行未授权操作,在多Agent系统中危害尤为严重

时间轴 (近 90 天)

9月11日

Agent可能因幻觉(Hallucination)或Prompt注入攻击执行远超预期的破坏性操作

待验证50%
8月27日

即使prompt注入成功改变了模型行为,若容器层面锁死了网络、文件系统和API访问,模型也无法执行危险操作

待验证50%

全部知识事实 (2)

来源文章