黄仁勋推特首推力挺AI开源,背后藏着英伟达的生态焦虑

一封公开信引发的思考
7月24日,英伟达CEO黄仁勋开通了推特账号,而他发布的第一篇帖文颇具深意——转发了一封由诸多企业联合签署的公开信,核心诉求只有一个:呼吁前沿AI技术的开源化。
这封公开信表面上传达了三个要点,但真正值得玩味的其实是两条半。第一条:AI开源是好的;第二条:美国应当积极参与开源,才能形成属于美国的、具有竞争力的AI生态;剩下那半条虽非主旨却写得相当具体——公开信明确表示,模型蒸馏是AI领域的传统老手艺,不应当被禁止或制裁。
所谓模型蒸馏(Knowledge Distillation),是Geoffrey Hinton等人在2015年提出的一种模型压缩技术。其核心思想是用一个大型的"教师模型"来指导训练一个小型的"学生模型",让学生模型学习教师模型输出的概率分布(即"软标签"),而非仅仅学习原始数据的硬标签。通过这种方式,小模型可以继承大模型的大部分能力,同时大幅降低计算和存储成本。在大模型时代,蒸馏技术已成为将前沿模型能力"下沉"到可部署规模的核心手段。公开信之所以特别提及蒸馏不应被禁止,背景是此前有声音认为,用先进闭源模型的输出来训练开源模型构成了一种"知识窃取",而签署者们显然认为这是行业通行做法,不应受到法律或政策限制。
第一条其实没什么好拆解的。说"AI开源是好的",跟说"我希望世界和平"基本上是一个意思。开源这件事,就算不是绝对的政治正确,至少也是90%的政治正确。但问题在于——如果你是OpenAI或者Anthropic,费尽心力做出来的模型,凭什么要开源?这就引出了真正值得深挖的第二点。

开源模型的三大不可替代优势
相比OpenAI、Anthropic"购买API、按量调用"的封闭模式,开源AI模型对企业和个人用户有着难以替代的独特价值。
在当前AI服务市场中,存在两种截然不同的使用范式。API调用模式以OpenAI和Anthropic为代表,用户通过网络接口发送请求,按调用次数或token数量付费,无需自建基础设施,但数据必须经过第三方服务器处理。本地部署模式则依赖开源模型,企业将模型权重下载到自有服务器或私有云上运行,拥有完全的数据控制权和服务可用性保障。两种模式各有优劣:API模式门槛低、维护成本小,适合中小企业快速接入;本地部署模式前期投入大,需要GPU集群和运维团队,但长期来看在合规性、定制化和边际成本方面优势显著。随着开源模型能力不断逼近闭源模型,越来越多的企业开始向本地部署模式迁移。
这些优势可以概括为三个关键词:隐私、稳定、性价比。
隐私:敏感数据不该发给第三方
对于想要使用AI的企业来说,涉及隐私的数据、有知识产权的内容,显然不适合通过API全部发送给OpenAI这样的第三方。把核心机密交给外部供应商处理,本身就是一种不可忽视的安全风险。尤其是在医疗、金融、法律等高度受监管的行业,数据合规要求往往明确禁止将敏感信息传输至第三方服务器,这使得本地部署开源模型成为这些行业拥抱AI的几乎唯一可行路径。
稳定性:不要把身家押在别人的服务器上
如果企业的日常运转高度依赖某个AI供应商,那么当供应商出问题时,造成的灾难往往是毁灭性的。一个真实案例:此前美国一家农业科学公司因为Anthropic的Claude服务宕机,导致这家几百人的公司因高强度依赖而随之瘫痪了一整天。
当你把AI供应商当作基础设施、把身家性命都押在其上时,你最好祈祷他们的服务能稳定一点。

性价比:微调后的小模型也能打赢大模型
企业或个人的日常工作往往只集中在几类任务、局限于某个特定领域。近年来有大量研究都在做同一件事:针对个别任务,对小规模模型做定向微调。结果往往令人惊讶——经过微调的小模型,在目标任务上可以比肩甚至超越最先进的闭源大模型。
这背后的技术支撑来自参数高效微调(PEFT)的突破性进展。其中最具代表性的是LoRA(Low-Rank Adaptation)技术,它通过在模型权重矩阵中注入低秩分解矩阵,仅训练极少量新增参数(通常不到原模型的1%)即可达到接近全参数微调的效果。在此基础上演化出的QLoRA,进一步将模型量化到4比特精度后再施加LoRA,使得在单张消费级显卡上微调数十亿参数的模型成为可能。这些技术极大降低了企业使用开源模型的门槛,让"小而精"的定制化模型在特定场景中以极低成本击败通用大模型。
综合这三点,对于真正需要用AI的企业和个人而言,把先进的开源模型部署到自己的算力节点上、再配合定制化微调,永远是一个极具吸引力的选择,甚至是不得不做的选择。

英伟达的真实焦虑:CUDA生态之争
开源模型的需求,会自然衍生出一整条产业链:计算集群的搭建与维护、模型训练与推理流程的搭建与维护——换句话说,就是"卖卡"和"卖技术"。这些都是不小的生意。
那么问题来了:这笔生意,现在正肉眼可见地被谁拿走?
顶级开源模型正来自东方
看看当下这些知名的开源AI模型——从DeepSeek到通义千问,再到GLM系列和Kimi K系列,几乎全部来自中国。而大家都知道的是,由于种种禁令,英伟达被禁止将高性能计算卡出售给这个市场。
目前的现实是:国内其实并不缺卡,缺的是成熟的生态。在中国,英伟达的CUDA生态确实成熟好用,有英伟达的卡,那就顺手用了;但如果没有,那就只能自己动手,把与GPU相关的整套生态从零搭建起来。
这里有必要解释一下CUDA生态为何如此关键。CUDA(Compute Unified Device Architecture)是英伟达于2006年推出的并行计算平台和编程模型,允许开发者使用C/C++等语言直接调用GPU进行通用计算。经过近20年的积累,CUDA已经形成了一个极其庞大的生态系统:PyTorch、TensorFlow等主流深度学习框架默认以CUDA为底层加速后端;cuDNN、cuBLAS、TensorRT等一系列高度优化的加速库覆盖了从训练到推理的全流程;全球数以百万计的AI开发者和研究人员在CUDA上积累了大量代码资产和使用习惯。这种软件生态的"锁定效应",使得即便其他芯片在硬件性能上接近英伟达,用户迁移的成本依然极高。

假如AI生态从非CUDA土壤中长出
真正让英伟达寝食难安的假设是:如果哪天从硬件到软件技术,国内一整套AI生态彻底成熟了,而最先进的开源模型恰恰是从"非CUDA生态、非英伟达显卡"的土壤中生长出来的——那么,那些有需求部署开源AI的企业和个人,在采购硬件与技术时,究竟会怎么选?
这并非杞人忧天。自2022年以来,美国商务部先后出台多轮对华芯片出口管制政策,限制英伟达向中国出售A100、H100等高性能AI训练卡。英伟达虽然推出了针对中国市场的"阉割版"芯片,但其性能已大打折扣,且后续版本也面临进一步限制。在此背景下,中国本土AI芯片企业正在加速发展:华为的昇腾(Ascend)系列芯片配合自研的CANN计算框架和MindSpore深度学习框架,正在构建独立于CUDA的完整生态;寒武纪、海光、燧原等企业也在各自赛道上推进。目前国产芯片在单卡性能和软件成熟度上与英伟达仍有差距,但差距正在缩小。更关键的是,当越来越多的顶级开源模型在非CUDA环境中完成训练和验证后,这些模型天然就会对非英伟达硬件更加友好,形成正向循环。
答案大家都看得到。CUDA生态也许正是英伟达最深的护城河,也是它最脆弱的软肋。
结语:护城河还是新战场
也许,英伟达正是感受到了这种潜在的生态迁移风险,才提前发出了这封力挺开源AI模型的倡议书;也许并非如此,只是巧合。但无论动机为何,这封公开信背后所折射出的"生态之争"逻辑,都值得每一个关注AI产业的人深思。
开源对整个行业固然是好事,但对英伟达而言,开源生态的归属——究竟是长在CUDA之上,还是长在别人的土壤里——才是决定其未来霸权能否延续的关键变量。
正如黄仁勋自己所说的:计算卡不是核武器,它没有那么危险,可能也没有那么深奥。但围绕这些卡片所构建的生态,却是一场远比想象中更深、更长的战争。
相关推荐

Agent智能体开发入门:从概念到实战的完整指南
深入解析AI Agent智能体的核心架构与开发实战,涵盖自动化营销、智能客服、投资分析三大落地场景,以及单智能体与多智能体协作机制,帮助初学者快速掌握Agent开发思维与实践路径。

Codex五分钟建站真相揭秘:不是AI做网站,是AI帮你抄网站
揭秘短视频平台上火爆的Codex五分钟建站内容真相:博主们并非用AI原创网站,而是复制共享提示词或直接扒别人网站。了解AI编程工具的真实能力边界,别被焦虑营销带节奏。

提示词工程入门指南:从单次指令到系统化方法论
提示词工程零基础入门教程,详解提示词的四大作用、提示词与提示词工程的核心区别、六步系统化流程,以及必须了解的技术与落地局限性,帮你真正发挥AI的全部潜力。