[控场AI]
· 5 分钟阅读· 2,778 字

GLM-5.3能自主发起漏洞攻击?Anthropic红队揭示AI网络能力扩散

GLM-5.3能自主发起漏洞攻击?Anthropic红队揭示AI网络能力扩散

Anthropic红队评估显示GLM-5.3已能自主完成二进制漏洞利用,开源模型正跨越网络攻击能力的关键安全门槛。

Anthropic前沿红队发布的评估报告揭示了一个重要的能力跃迁节点:开源大模型GLM-5.3在二进制漏洞利用基准测试中,已能在4%的场景下自主完成控制流劫持,而Anthropic自家的Claude Mythos Preview为6%。更关键的是,上一代模型(Claude Opus 4.6和GLM-5.2)的同类成功率均为零,说明从「完全无法完成」到「具备实际能力」的跨越发生在一代迭代之间。这一发现的核心警示不在于成功率高低,而在于:当同等量级的敏感攻击能力出现在可自由下载的开源模型中,传统依赖API管控和使用政策的安全防线将近乎完全失效,AI安全治理面临根本性的范式挑战。

Anthropic的前沿红队(Frontier Red Team)近日发布了一份关于GLM-5.3模型网络攻击能力的评估报告,指出开源领域的大模型正在跨越一个关键的安全门槛:具备自主完成二进制漏洞利用的能力。这一发现值得整个AI安全社区高度关注。

关键数据:一个被跨越的门槛

根据Anthropic红队从内部二进制漏洞利用基准(Binary Exploitation benchmark)中随机抽取的100项任务测试,GLM-5.3在4%的试验中成功开发出完整的控制流劫持(control flow hijack),而Anthropic自家的Claude Mythos Preview则达到了6%。

单看这两个数字,GLM-5.3的表现略逊于Claude Mythos Preview。但真正值得警惕的不是谁高谁低,而是趋势本身。红队特别强调:早期的模型,如Claude Opus 4.6和GLM-5.2,在这些任务中的成功率为零。也就是说,从上一代到这一代,模型的能力从「完全无法完成」跃升到「能够在一定比例的场景下自主完成」。

控制流劫持是二进制漏洞利用中的核心技术之一,攻击者通过它可以改变程序的正常执行路径,进而执行任意代码。能够自主开发出这类攻击手段,意味着模型已经掌握了相当高阶的攻防技能,而非停留在理论描述层面。

控制流劫持(Control Flow Hijacking)是二进制安全领域的核心攻击技术,其原理是通过覆盖程序内存中的函数返回地址、函数指针或虚函数表指针等控制数据,迫使CPU跳转到攻击者指定的代码位置执行。经典的实现手段包括栈溢出覆盖返回地址(ret2libc、ROP链)、堆溢出篡改函数指针等。为抵御此类攻击,现代操作系统和编译器引入了多层防御机制:地址空间随机化(ASLR)使每次运行时内存布局不可预测,栈保护金丝雀(Stack Canary)在返回地址旁放置随机值以检测篡改,不可执行内存(NX/DEP)阻止直接在数据区注入shellcode。能够自主开发出绕过上述防御的漏洞利用,意味着模型具备了分析二进制文件、识别内存安全漏洞、并构造精确内存布局的综合工程能力,这在传统上需要数年实战经验积累。

为何4%的成功率也值得警惕

有人可能会认为4%的成功率并不高,实际威胁有限。但从安全研究的视角看,这种线性思维忽略了自动化带来的规模效应。

漏洞利用开发在传统上是高度依赖专业人力的工作,一名熟练的安全研究员开发一个可用的漏洞利用可能需要数天甚至数周。而AI模型的优势在于可以并行、廉价、大规模地尝试。即便单次成功率只有4%,只要能够以极低成本进行成千上万次尝试,实际可产出的有效攻击数量就相当可观。

更重要的是能力门槛的下降。当这类能力被开源模型所具备时,原本需要深厚专业背景才能进行的攻击行为,可能被更广泛的群体所触及。这正是Anthropic在报告标题中所强调的核心议题——「先进网络能力的扩散」(the spread of advanced cyber capabilities)。

这种担忧在学术界被称为「低成功率高危害」(low probability, high impact)问题,在AI安全评估中有一个更具体的量化框架支撑。安全研究者通常使用「uplift」(能力提升)概念来衡量AI工具对攻击者的实质帮助:即便一个模型不能独立完成完整攻击链,只要它能显著压缩某个关键步骤的时间或所需专业知识,就构成有意义的威胁放大。与此对应的是「攻击面扩展」视角——传统渗透测试需要组建专业团队耗费数周,而AI辅助的自动化扫描与利用开发可以在数小时内并行处理数千个目标,攻击的边际成本趋近于零。这也是为什么安全评估机构在设定能力危险阈值时,往往不以单次成功率为唯一标准,而是综合考虑自动化可行性、所需人力门槛的下降幅度以及受影响目标的规模。

开源与闭源的能力差距在收窄

GLM系列是来自中国的开源大模型代表之一。此次评估中,GLM-5.3在一项高度敏感的攻击性任务上,仅以2个百分点之差逼近Anthropic的前沿模型Claude Mythos Preview,这本身就是一个值得深思的信号。

这意味着,在网络安全这一敏感能力维度上,开源模型与顶尖闭源模型之间的差距正在快速缩小。以往人们普遍认为最尖端的能力集中在少数几家实验室手中,可以通过内部管控、使用政策和API层面的防护来限制滥用。但当同等量级的能力出现在可自由下载、本地部署的开源权重模型上时,传统的管控手段几乎失效——没有人能够限制一个已经发布权重的模型被如何使用。

这为AI治理提出了一个尖锐的问题:当危险能力随开源生态自然扩散时,安全防线究竟应该建立在哪里?

GLM(General Language Model)系列由清华大学KEG实验室与智谱AI联合开发,从GLM-130B起以开放权重的形式发布,允许研究者和开发者在本地部署和微调。「开源权重」与「开源代码」在安全语境下含义不同:前者意味着模型参数文件可被任意下载,无需通过任何厂商的API或内容审核层即可直接运行,因此传统的API级安全护栏(如对话过滤、请求审计)完全失效。相比之下,闭源模型即便能力更强,其使用始终受到厂商基础设施的约束。这一区别催生了AI安全领域的「双重用途开放模型」(dual-use open-weight model)治理议题:在促进学术透明、降低研究门槛的同时,如何防止高风险能力在无监管状态下被规模化滥用,目前国际社会尚未形成共识性的监管框架。

对AI安全治理的启示

Anthropic红队的这份评估,本质上是在为整个行业提供一个「早期预警」。它没有渲染恐慌,而是用具体的基准数据说明能力演进的真实节奏。

从这份报告可以提炼出几点现实意义。模型能力的跃迁往往是非线性的,从零到有的跨越可能在一代更新之间完成,因此持续的红队评估和基准测试不可或缺。开源模型的安全评估应当被纳入常态化的行业实践,而不仅仅是闭源厂商的内部事务。面对能力扩散,单纯依赖模型层面的对齐和拒答可能不够,还需要在部署环境、软件供应链和防御性AI等多个层面构建纵深防御。

值得肯定的是,Anthropic愿意公开对包括竞争对手在内的多个模型进行网络攻击能力的横向评估,这种透明度对建立行业共识和推动协同治理具有积极意义。

结语

这条来自Anthropic前沿红队的评估结论提醒我们,大模型的能力边界正在快速外扩,网络攻防这类双刃剑式的能力已经开始进入主流模型的能力版图。4%与6%之间的微小差距背后,是一个从「不可能」到「可能」的质变节点。如何在鼓励开源创新与防范能力滥用之间取得平衡,将是未来AI安全治理绕不开的核心课题。

分享:

相关推荐