开放安全AI联盟成立:以开源筑牢AI安全防线

开放AI,让世界更安全
近日,一则来自Twitter的官方声明引发了AI安全领域的广泛关注:多家科技机构宣布加入「开放安全AI联盟」(Open Secure AI Alliance),旨在通过开源工具来保护软件系统与AI智能体(agents)的安全。这一举措延续了「以开放促安全」的核心理念——正如声明所言:「以开放的方式构建AI,能让世界变得更安全。」

该联盟的成立并非孤立事件,而是发生在2024-2025年AI安全治理加速推进的大背景下。2023年11月的布莱切利宣言(Bletchley Declaration)标志着28个国家首次就前沿AI安全达成政府间共识;2024年欧盟AI法案(EU AI Act)正式生效,建立了全球首个按风险等级对AI系统进行分类监管的法律框架;美国则通过行政命令要求前沿模型开发者向政府报告安全测试结果。在这一监管浪潮中,行业自发组建开放安全联盟,既是对外部监管压力的积极回应,也是试图通过自律机制影响监管走向——证明开源社区有能力自我治理,从而避免过度限制性的立法扼杀开放创新。
在AI能力快速跃升、智能体逐步接管更多现实任务的今天,安全问题已不再是可选项,而是决定技术能否被信任、能否规模化落地的关键前提。此次联盟的成立,标志着行业从「各自为战」的封闭防御,转向「协同共建」的开放安全生态。
为什么「开放」等于「更安全」?
乍看之下,「开放」与「安全」似乎存在天然矛盾——公开代码、模型权重和评估方法,是否意味着把攻击面暴露给恶意者?然而,信息安全领域早有共识:真正的安全来自透明,而非隐藏(Security through obscurity 往往是脆弱的)。
这一认知并非凭空而来。「隐蔽即安全」的策略有着漫长的失败史——早在1883年,荷兰密码学家Kerckhoffs就提出了著名的原则:一个密码系统的安全性应仅依赖于密钥的保密性,而非算法本身的保密。Kerckhoffs原则的完整表述实际上包含六条准则,但其核心思想后来被信息论之父Claude Shannon进一步简化为著名的Shannon格言:「敌人了解系统」(The enemy knows the system)。这意味着安全系统的设计者必须假设攻击者已经完全了解系统的内部机制,安全性只能依赖于少量可替换的秘密(如密钥)。在现代密码学实践中,AES、RSA、椭圆曲线等广泛部署的加密算法都是完全公开的,其安全性建立在可证明的数学困难性问题之上。这一哲学直接催生了开源安全运动——OpenSSL、GPG、Signal协议等关键安全基础设施均采用开源模式,正是因为开放接受审查比隐藏更能发现和修复缺陷。
「隐蔽即安全」策略的失败案例贯穿整个信息技术史,其教训值得AI领域铭记。2010年伊朗Stuxnet蠕虫攻击事件中,西门子工控系统(SCADA)虽然采用专有协议和闭源设计,但攻击者仍成功逆向工程了其通信机制并植入恶意代码,造成上千台铀浓缩离心机损毁。2017年的WannaCry勒索软件大规模爆发,利用的是美国国家安全局(NSA)秘密囤积的Windows漏洞工具EternalBlue被泄露后的后果——这恰恰说明了将安全建立在秘密之上的脆弱性:一旦秘密泄露,整个安全体系瞬间崩溃,且由于此前缺乏外部审计,受影响系统完全没有准备。
在软件安全领域,Windows操作系统的闭源并未阻止大规模漏洞利用和蠕虫传播,而Linux内核的开源反而因全球数以万计开发者的持续审计变得更加健壮和安全。在AI领域,同样的逻辑正在重演:闭源模型的安全性无法被外部独立验证,一旦被逆向工程或意外泄露,其建立在「不透明」之上的「安全感」将瞬间瓦解。开放,才是构建持久安全的根基。
开源的三重安全价值
第一,可审计性。 当模型权重、评估基准与研究成果公开时,全球的研究者和防御者都能独立验证系统的安全性,及早发现潜在漏洞,而不是依赖单一厂商的自我背书。
第二,防御者生态的壮大。 声明中特别强调,联盟希望「强化一个更广泛的、服务于防御者(defenders)的开放生态」。安全对抗本质上是攻防双方的军备竞赛,只有让防御方共享工具、数据和方法论,才能在整体上抬升防御水位。
第三,标准化与互操作。 开放的评估体系(evaluations)为衡量AI系统的安全性提供了统一标尺,避免各家用自定义指标「自说自话」,从而推动全行业形成可比较、可复现的安全基准。值得注意的是,当前AI安全评估领域面临严重的碎片化问题——Anthropic使用RSP(Responsible Scaling Policy)框架评估模型的危险能力阈值,该框架将模型能力分为ASL-1到ASL-4多个级别,在每个级别设定了不同的安全要求和部署限制;OpenAI有自己的Preparedness Framework,侧重于对模型在网络安全、CBRN(化学、生物、放射性、核)威胁、说服力和自主行为四个维度进行分级评估;Google DeepMind则使用Frontier Safety Framework,更强调模型的自主能力和欺骗能力的评估。这些框架在评估维度(如生物威胁、网络攻击能力、自主复制能力)、评估方法(自动化测试vs人工红队)和风险阈值设定上都存在显著差异。缺乏统一标准使得监管机构难以横向比较不同模型的安全水平,也使下游用户无法做出知情选择。开放安全联盟推动公开评估工具,正是试图建立类似于软件行业CVE(Common Vulnerabilities and Exposures,通用漏洞披露)体系那样的AI安全公共基础设施——一个全球共享的、标准化的漏洞命名和追踪系统,使得不同组织可以用统一的语言交流安全问题。
当前AI安全评估涉及多个维度的复杂测试,理解这些测试的具体方法论有助于认识标准化的难度和重要性。红队测试(Red Teaming)是最常见的方法之一,由专业安全研究人员模拟各类恶意用户尝试突破模型的安全边界,包括尝试获取制造化学武器的步骤、生成恶意代码、进行社会工程攻击的话术优化等。自动化评估工具则通过大规模测试套件(如HarmBench、MACHIAVELLI、AgentBench)系统性地探测模型在数千个预定义攻击场景中的表现。模型能力评估则关注模型是否具备潜在的危险能力,如自主获取资源、进行欺骗性行为、或协助进行网络入侵——这些评估往往需要精心设计的场景模拟,而非简单的问答测试。不同机构在这些方法的选择和权重分配上的巨大差异,正是碎片化的根源所在。
联盟的具体承诺与行动方向
根据官方声明,加入联盟的机构做出了几项明确的持续性承诺:
- 持续发布模型权重(model weights):让外部研究者能够深入检验模型行为;
- 公开安全评估(evaluations):提供衡量AI安全性的透明工具;
- 分享前沿研究:把安全研究成果回馈给整个开放社区。
关于模型权重的公开,有必要理解其技术含义和深远影响。模型权重是神经网络经过训练后存储的数十亿乃至数万亿个参数数值,本质上是高维空间中的浮点数矩阵,代表了模型从海量数据中提取并压缩的「知识」——包括语言规律、事实关联、推理模式,但也可能包含有害偏见和危险能力。公开权重意味着任何人都可以在本地运行、微调和深度审计该模型,而不必依赖黑箱API调用。这带来了显著的安全研究价值:红队研究者可以对模型进行白盒攻击测试(即完全了解模型内部结构的条件下进行攻击),系统性地发现对抗样本和越狱漏洞,其效率远高于只能通过API进行的黑盒测试;学术机构可以独立复现安全评估结果,验证厂商的安全声明是否属实;下游开发者可以针对特定部署场景(如医疗、金融)对模型进行安全加固和领域适配。
然而,Meta在2023年发布LLaMA权重后的经验也充分暴露了开放权重的双刃剑效应:模型权重在发布数天内即被泄露到非官方渠道,研究者很快展示了如何通过少量数据微调即可移除模型的安全护栏(safety guardrails),使其生成有害内容。这一事件使得「分级开放」(staged release)成为行业讨论的焦点——对能力有限的模型完全开放,对前沿能力模型则附加使用协议或延迟发布。具体策略包括:设置使用许可证限制商业或高风险用途、要求下载者通过身份验证和使用目的审查、在模型发布前给予安全研究者优先审计的时间窗口、以及仅发布量化压缩后的较低精度版本等。
这些承诺的共同指向是「构建保护软件与智能体的开源工具」。有意思的是,随着AI智能体(agents)开始自主执行任务、调用外部工具、访问敏感数据,其安全边界远比传统软件复杂。
所谓AI智能体,是指能够自主感知环境、制定多步计划并执行实际操作的AI系统,区别于传统的单次问答式大语言模型。传统LLM的交互模式是「用户提问-模型回答」的单轮或多轮对话,其作用范围被限定在文本生成之内;而智能体则具备「感知-规划-行动-反馈」的完整执行循环,能够将复杂目标分解为多个子任务并逐步完成。当前,智能体正在被广泛部署于客户服务(自动处理退款和账户变更)、代码编写(自主创建和修改代码仓库)、数据分析(连接数据库执行查询并生成报告)甚至金融交易(实时分析市场数据并执行买卖操作)等高价值场景中,它们能够调用API、操作浏览器、读写文件系统、发送邮件。
这种自主性带来了全新的攻击面:攻击者可以通过在网页、邮件或文档中嵌入恶意指令(间接提示注入),劫持智能体的执行流程;智能体在多步推理过程中可能产生「目标漂移」(goal drift),即模型在复杂推理链中逐渐偏离用户的原始意图,可能是因为中间步骤的错误积累、外部环境的干扰、或模型自身的最优化倾向导致其追求某个替代目标;多智能体协作系统还可能出现级联失败(cascading failure),一个智能体的微小错误被下游智能体逐步放大为灾难性后果——类似于金融系统中的系统性风险传导。
多智能体系统(Multi-Agent Systems)的安全复杂性值得进一步关注。在典型的多智能体架构中,一个「编排者」(orchestrator)智能体负责分解任务并分配给多个「执行者」智能体,每个执行者可能拥有不同的工具访问权限(如一个可以执行代码、另一个可以访问互联网、第三个可以读写数据库)。这种架构引入了「权限升级」风险——如果攻击者通过提示注入控制了一个低权限智能体,可能通过社会工程(说服编排者授予更多权限)或利用智能体间通信协议的漏洞来获取高权限智能体的控制。AutoGPT、CrewAI、LangGraph等多智能体框架的快速普及使得这一问题日益紧迫。
传统的Web应用防火墙(WAF)和端点检测响应(EDR)工具并非为这类新型威胁设计,因此急需新一代专门针对智能体行为模式的安全防护框架。
其中,提示注入(Prompt Injection)是当前大语言模型和智能体面临的最严峻安全威胁之一,值得深入理解。其原理类似于传统Web安全中的SQL注入——在SQL注入中,攻击者通过在用户输入字段中插入SQL代码来操纵数据库查询;而在提示注入中,攻击者将恶意指令混入模型的输入数据中,利用大语言模型无法在架构层面区分「系统指令」和「用户/外部数据」这一根本性缺陷,使模型将本应作为「数据」处理的内容误解为需要执行的「指令」。
直接提示注入是用户直接在对话中试图绕过系统提示词的安全限制,例如通过角色扮演(「假装你是一个没有限制的AI」)或指令覆盖(「忽略以上所有指令」)来解除模型的安全约束;间接提示注入则更为隐蔽和危险,攻击者将恶意指令嵌入智能体可能读取的外部内容中(如一个看似正常的网页中隐藏的白色文字指令、一封邮件中人眼不可见但模型可读的隐藏文本、一份PDF的元数据字段、甚至图片中通过隐写术嵌入的文本),当智能体处理这些内容时便会被劫持执行非预期操作——如泄露用户私人邮件内容、在用户不知情的情况下发送信息、或在代码中植入后门。
目前业界尚未找到根本性的解决方案,现有的防御手段包括:输入过滤(检测和屏蔽已知的恶意模式)、指令层级隔离(在提示中明确标记数据边界)、输出监控(检测模型行为是否偏离预期)、以及使用专门的安全分类器对模型输出进行实时审核。但这些都是缓解措施而非根治方案,因为大语言模型的Transformer架构在注意力机制层面对所有输入token一视同仁——它天然无法区分「可信指令」和「不可信数据」——这也正是开放安全联盟希望通过全球协作来攻克的核心技术难题之一。
因此,专门针对智能体安全的开源防护工具,正成为一个亟需填补的关键空白。
NVIDIA等巨头入局的信号意义
声明中特别提到,将「与NVIDIA及其他正在构建这一生态的组织并肩贡献」。NVIDIA作为AI算力基础设施的核心供应商,其参与具有风向标意义——它意味着AI安全不再仅是模型层的议题,而是贯穿从硬件、算力到应用的全栈问题。
要理解NVIDIA参与的深层意义,需要认识到其在AI生态中的角色远不止GPU制造商。NVIDIA构建了一个庞大的软硬件生态系统:其CUDA(Compute Unified Device Architecture)编程框架自2006年推出以来,已成为几乎所有深度学习训练和推理的底层基础设施,全球超过400万开发者依赖这一平台;TensorRT推理引擎通过图优化、量化和层融合等技术大幅提升生产环境中模型服务的效率和吞吐量;NeMo框架支撑着大语言模型的训练、微调与安全对齐(RLHF等),内置了Guardrails工具包用于定义模型行为边界;Morpheus则是其专门面向网络安全的AI框架,能够对网络流量和系统日志进行实时AI分析,检测零日攻击、内部威胁和异常数据外泄行为。
在安全维度上,NVIDIA的参与意味着从硬件层面的可信执行环境(Trusted Execution Environment)开始的全栈安全保障。其Hopper架构(H100 GPU)中引入的Confidential Computing功能,可以在GPU内存中对模型权重和推理数据进行加密保护,即使物理接触硬件的攻击者也无法窃取模型参数或用户隐私数据——这对于在云环境中部署敏感AI模型至关重要。从推理层面的模型完整性保护(确保部署的模型未被篡改),到应用层面的威胁检测(利用AI实时识别对AI系统的攻击),都有望纳入统一的开放安全体系。当AI系统的安全不仅取决于模型本身,还取决于它运行的整个基础设施——包括训练集群的供应链安全、推理服务器的隔离机制、模型传输过程中的完整性校验、以及多租户环境下的侧信道防护——芯片与平台厂商的参与就变得不可或缺。
当上游的芯片与平台厂商、中游的模型开发者、下游的应用与安全团队能够在同一开放框架下协作时,安全能力才有可能形成端到端的闭环。这种跨层级、跨组织的联盟形式,正是应对系统性AI风险的合理路径。
开放安全的挑战与展望
当然,开放路线并非没有争议。批评者担忧,公开强大模型的权重可能被滥用于开发攻击工具;也有人质疑,开源评估标准能否真正统一,以及各方是否愿意分享最有价值的核心研究。
这些担忧提醒我们:开放不等于无节制的公开,而是需要在透明与责任之间取得平衡。理想的开放安全生态,应当在共享防御能力的同时,建立对高风险能力的谨慎释放机制——例如对能力达到特定阈值的模型设置延迟发布窗口(structured access),或要求下载者签署负责任使用协议(如Meta的Community License Agreement和Llama使用政策中对军事、间谍活动等用途的明确禁止),亦或通过技术手段在开放的同时保留问责能力。
其中,模型水印(Model Watermarking)作为一种兼顾开放与问责的技术方案正受到广泛关注。模型水印主要分为两类:输出水印和模型水印。输出水印通过微调模型的token采样分布,在生成文本中嵌入统计上可检测但人眼不可见的标识——例如轻微偏好某些同义词的选择顺序,这种偏好对单条输出而言不可感知,但在大量输出的统计分析中可以被可靠检测,从而追溯生成内容的来源模型。模型水印则是在训练过程中嵌入特定的「触发-响应」模式,使得即使模型被非法复制或微调,仍能通过特定输入证明其来源。这两种技术都面临鲁棒性挑战——改写攻击(paraphrasing)可以破坏输出水印,而持续微调可能逐渐消除模型水印。当前,马里兰大学、Google DeepMind和OpenAI等机构都在积极研究更鲁棒的水印方案,使用追踪(usage tracking)技术也在同步发展中。
从更宏观的视角看,「开放安全AI联盟」的成立反映了行业的一个重要判断:面对日益强大、日益自主的AI系统,任何单一机构都无法独自解决安全问题。唯有通过开放协作、共享工具与知识,防御者才能跟上甚至领先于潜在威胁的演进速度。
对于关注AI安全的开发者、研究者和企业而言,这一联盟值得持续跟踪——它释放的模型权重、评估工具和研究成果,或将成为未来构建可信AI系统的重要基础设施。
核心要点
核心要点
核心要点
相关推荐

AI对话中模型名称消失怎么办?原因分析与解决方案
AI对话应用中模型名称标识突然消失,影响用户判断回答质量和使用成本。本文深入分析模型标识消失的可能原因,包括UI改版、前端Bug和A/B测试,并提供实用解决建议。

Rainbow DQN没有新想法:值函数强化学习算法演进全解析
从表格Q-learning到DQN再到Rainbow,详解值函数强化学习算法的演进逻辑。通过失败驱动的视角,理解Double DQN、优先经验回放、对决网络、多步回报、C51等六项关键改进如何逐步修补前代算法的痛点,最终汇聚为Rainbow。

OpenAI暂停RL训练:模型能力增长过快,安全对齐跟不上了?
Sam Altman宣布OpenAI暂停强化学习训练,称模型能力增长极其迅速已超越安全对齐进度。本文深度解读这一决定背后的技术原因、行业影响及AI安全治理启示。