概念Task-in-Prompt攻击 / 任务嵌入提示词攻击
TIP攻击
一种针对大语言模型的越狱攻击方法,通过将有害目标伪装成看似无害的多步骤任务,利用模型自身推理链条诱导输出违规内容,已在ACL 2025正式发表
时间轴 (近 90 天)
9月11日
此次GPT-6越狱攻击采用了改进版的TIP(Task-in-Prompt)攻击方法,结合了四种未公开的技术手段
已过期50%
9月11日
TIP攻击方法已在ACL 2025会议论文中正式发表
待验证50%
9月11日
TIP攻击的核心思路是将有害目标伪装成看似无害的技术性任务,诱导模型输出本应被安全机制拦截的内容
待验证50%
9月11日
针对GPT-6,原始的最小化TIP攻击已经完全失效,必须大幅改造才能绕过新的安全防护
已过期50%