GPT-6上线不到24小时即被越狱:TIP攻击如何突破AI安全防线

GPT-6发布不到24小时即被改进版TIP攻击越狱,AI安全攻防博弈持续升级。
OpenAI最新发布的GPT-6 Astra模型在上线不到24小时内,被安全研究人员利用改进版TIP(任务嵌入提示词)攻击成功越狱。TIP攻击通过将有害目标伪装为合法技术任务来绕过安全机制,已在ACL 2025正式发表。相比GPT-5仅用1小时即被破解,GPT-6的24小时破解时间说明OpenAI安全防护在加强,但仍无法抵御进化的攻击手段。研究人员采取了负责任的漏洞披露方式,将细节私下提交给OpenAI。这一事件揭示了AI安全的本质困境:模型能力越强被利用空间越大,发布前测试无法覆盖所有场景,未来防护需从架构层面入手。
GPT-6安全防线在24小时内被突破
据安全研究人员报告,OpenAI最新发布的GPT-6 Astra模型在上线后不到24小时内就被成功越狱(jailbreak)。这次攻击采用了改进版的TIP(Task-in-Prompt,任务嵌入提示词)攻击方法,结合了四种未公开的技术手段。
值得关注的是,同一位研究人员在GPT-5发布时仅用一小时就完成了破解,而这次GPT-6的破解时间延长到了24小时——这说明OpenAI的安全防护确实在加强,但仍未能抵挡住持续进化的攻击手段。

TIP攻击是什么?隐藏在合法任务中的越狱威胁
TIP攻击是一种利用大语言模型推理和指令遵循能力的新型攻击方式,该方法已在ACL 2025会议论文中正式发表。
其核心思路是将有害目标伪装成看似无害的任务。例如,攻击者可能要求模型解密密码、执行Python代码或完成其他技术性操作。在这些表面合法的任务外壳下,模型实际上被诱导输出了本应被安全机制拦截的内容。
针对GPT-6,研究人员指出原始的最小化TIP攻击已经完全失效,必须进行大幅改造才能绕过新的安全防护。这表明OpenAI在GPT-6中强化了对已知攻击模式的防御,但攻击者通过组合多种技术仍然找到了突破口。
ACL(Association for Computational Linguistics,计算语言学协会)是自然语言处理领域的顶级学术会议,TIP攻击方法能够在ACL 2025上正式发表,说明该攻击已经过严格的同行评审,具备较高的学术可信度和技术影响力。TIP攻击与此前流行的提示注入(Prompt Injection)攻击有本质区别:提示注入通常通过在输入中插入隐藏指令来劫持模型行为,而TIP则利用模型自身的推理链条,将有害意图编码在看似正当的多步骤任务流程中。例如,攻击者可能要求模型'对以下Base64编码的文本进行解码并按格式输出',表面上是一个合法的数据处理请求,但解码后的内容实际上会触发模型生成违规输出。这种攻击之所以难以防御,是因为模型在执行每一个单独步骤时都是在遵循合法指令,安全机制很难在不影响正常功能的情况下识别出整个任务链条的恶意意图。
负责任的漏洞披露:安全研究的正确打开方式
与一些黑客选择公开漏洞不同,这位研究人员采取了负责任的披露方式,已将破解细节私下提交给OpenAI,而非公开发布完整的攻击方法。
这种做法符合安全研究领域的最佳实践:
- 帮助厂商及时修复:OpenAI可以在漏洞被大规模利用前进行修补
- 避免恶意利用:防止攻击方法被不法分子滥用
- 推动行业安全标准:建立AI安全研究的良性协作模式
该研究人员在GPT-5发布时也采取了同样的做法,在发现漏洞后迅速与OpenAI沟通,形成了持续性的安全测试合作。
负责任的漏洞披露(Responsible Disclosure)是信息安全领域沿用数十年的行业规范,最早在软件和网络安全中广泛实践。其标准流程通常包括:研究人员发现漏洞后私下通知厂商,给予一定的修复窗口期(通常为90天),厂商完成修补后研究人员才公开技术细节。在AI安全领域,这一机制正变得尤为重要——与传统软件漏洞不同,大语言模型的越狱方法一旦公开,可以被任何人零门槛复制使用,且模型厂商无法像发布软件补丁那样快速修复,往往需要重新训练或调整对齐策略,修复周期更长。OpenAI、Anthropic、Google等主要AI公司均设有漏洞赏金计划(Bug Bounty Program),鼓励安全研究人员通过官方渠道提交发现。
AI安全攻防:一场永无止境的猫鼠游戏
从GPT-5到GPT-6,破解时间从1小时延长到24小时,这既是安全能力提升的信号,也暴露出AI安全防护的本质困境——攻防对抗永无止境。
每当模型开发者修补已知漏洞,攻击者就会开发新的绕过技术。TIP攻击的成功说明,单纯依靠内容过滤和规则拦截远远不够,攻击者可以通过精心设计的任务结构来利用模型的核心能力——推理和指令执行——反过来突破安全限制。
这次事件带来的启示很清晰:
- 模型能力越强,安全风险越大:GPT-6作为旗舰模型,更强的推理能力也意味着更大的被利用空间
- 发布前测试无法覆盖所有场景:即使经过严格的红队测试,实战中仍会暴露新的攻击面
- 防护需要从架构层面入手:未来的AI安全研究需要更加关注模型架构层面的防护机制,而不仅仅是后置的内容审核
AI安全不是一个可以一劳永逸解决的问题,而是需要持续投入、持续对抗的长期战场。
文中提到的"红队测试"(Red Teaming)是AI安全评估的核心手段之一,指由专业安全人员模拟攻击者的角色,系统性地尝试突破模型的安全限制。OpenAI、Anthropic等公司在模型发布前通常会进行数月的红队测试,邀请外部安全专家参与。然而,红队测试本质上是一种有限时间、有限人力下的对抗性评估,无法穷尽所有可能的攻击组合。GPT-6上线24小时即被突破的事实表明,真实世界中成千上万研究人员的并行测试能力远超任何内部红队的覆盖范围。目前业界正在探索的应对方向包括:基于形式化验证的安全保证、多层级的安全架构设计(如将安全监控模块与主推理模块分离)、以及利用AI模型本身来检测和防御越狱攻击的"以AI对抗AI"策略。
相关推荐

MCP网关授权难题:身份验证、权限控制与审计全解析
深入解析MCP网关构建中最棘手的授权难题,涵盖Agent身份验证、按工具细粒度权限控制、用户同意机制与全链路审计四大核心要素,助力团队安全部署AI Agent基础设施。
Clawfight.ai:MCP协议驱动AI智能体对战游戏深度解析
Clawfight.ai:MCP协议驱动AI智能体对战游戏深度解析
深入解析Clawfight.ai如何利用MCP模型上下文协议构建AI智能体自主对战游戏,涵盖技术架构、智能体决策循环、MCP协议应用场景及agentic游戏AI的价值与挑战。

如何找到最优模型规模:数据、成本与性能的多维权衡
深入解析影响大模型最优规模的关键因素,包括数据量与参数量匹配、MoE稀疏架构、推理成本约束等,帮助实践者在性能与成本之间找到最佳平衡点,告别盲目堆参数的粗放思维。