[控场AI]
· 4 分钟阅读· 2,386 字

DeepSeek开源昇腾全套组件:国产AI算力补齐软件短板

DeepSeek开源昇腾全套组件:国产AI算力补齐软件短板

DeepSeek开源昇腾全套AI工具链,与英伟达CUDA接口对齐,国产算力软件短板迈出关键一步。

9月30日,DeepSeek宣布开源面向华为昇腾的全套AI基础设施组件,涵盖算子编程语言、矩阵运算、多卡通信和长文本处理,且接口与英伟达平台版本一一对应。这意味着原本运行在英伟达服务器上的代码,只需切换后端即可迁移至昇腾平台,无需大规模重写程序。与此同时,DeepSeek还与华为联合深度调优了昇腾950大规模集群方案,重点针对多卡训练与大模型推理两大核心场景。这一举措的核心价值在于补齐了国产算力长期以来的"软件短板"——硬件性能之外,软件工具链的易用性才是阻碍昇腾规模化落地的隐形门槛。尽管如此,CUDA近二十年积累的生态壁垒无法一步填平,生态建设仍是一场需要持续投入的长期战役。

DeepSeek开源昇腾组件,一次看似低调的关键动作

9月30日,DeepSeek广告宣布开源面向华为昇腾的全套AI基础设施组件。更关键的是,这批工具与英伟达平台的版本做到了一一对应。对普通用户而言,这件事技术味道很重,短期内感受不到直接变化;但放在国产AI产业链的语境下,它是一块实实在在的拼图。

长期以来,外界理解AI芯片时往往只盯着硬件性能,忽略了背后同样关键的软件工具链。英伟达之所以在AI算力市场占据统治地位,不仅因为芯片算得快,更在于CUDA这套成熟到近乎“默认标准”的软件生态。工具好用、文档齐全、社区庞大,开发者几乎不需要思考底层适配——这才是真正的护城河。

软件工具链同样关键

开源的是什么?为什么说它补的是“软件短板”

过去,想让大模型跑在昇腾芯片上,开发者往往要大量改写代码做适配,成本很高。用一个形象的比喻:同样一套软件,换个硬件就得“重新施工”。这种迁移成本,恰恰是国产算力一直难以规模化落地的隐形门槛。

这次DeepSeek开源的组件覆盖面相当完整,包括:

  • 算子编程语言:底层计算的构建模块
  • 矩阵运算:大模型训练推理的核心操作
  • 多卡通信:大规模集群协同的关键
  • 长文本处理:面向当下长上下文需求的优化

最大的亮点不在于“多”,而在于接口保持一致。企业开发者原本跑在英伟达服务器上的代码,只需简单切换后端,就能迁移到昇腾平台,不必大规模重写程序。这意味着迁移的工作量被大幅压缩,昇腾第一次在软件易用性上向CUDA生态靠拢了一大步。

处理等全套的组件

与华为联合调优,瞄准大规模集群

除了开源工具链,DeepSeek还与华为联合优化了昇腾950大规模集群方案,在多卡训练和大模型推理两个最吃算力的环节做了深度调优。

这一点的意义在于:单颗芯片的性能只是起点,真正决定大模型能否落地的,是成百上千张卡协同工作时的效率。多卡通信、集群调度、显存管理等工程细节,往往是“纸面算力”与“实际可用算力”之间的鸿沟。软硬件联合优化,正是在填平这条鸿沟。

多卡通信是大规模AI训练中最容易被忽视、却往往最决定实际性能的瓶颈之一。当数百乃至数千张芯片协同训练同一个大模型时,每张卡都只持有模型和数据的一部分,卡与卡之间需要频繁交换梯度和参数。这一过程若通信带宽不足或协议效率低下,芯片算得再快也会大量时间浪费在"等待"上。英伟达专为此设计了NVLink高速互联和NCCL通信库,形成软硬件配套的完整方案。昇腾此次的联合调优,正是在补齐这一层面的能力——让集群在实际工作负载下,真实可用的算力尽量接近理论峰值,而不仅仅停留在规格表的数字上。

对普通人意味着什么

对普通老百姓来说,我们不会直接去用这些底层代码,但间接影响是实实在在的。

软件生态完善之后,国产算力芯片能被更多企业采用。未来国内的大模型训练、AI服务,就会有更多国产硬件可以选择,不再单一依赖国外算力。企业的算力选择变多,意味着议价空间和供应链安全都得到改善,长期也有利于AI服务成本的下降——这些成本最终会反映到我们日常使用的各类AI产品上。

对普通老百姓来说

补齐短板≠全面赶超,生态是一场持久战

需要清醒看待的是,这并不意味着立刻就能完全替代英伟达生态。生态建设是一个漫长的过程:硬件性能的持续提升、各类模型的完整适配、社区的培育与工具的打磨,都还需要时间。

这次开源补齐的是软件短板中的关键一步,而不是实现了全面赶超。CUDA积累多年的生态壁垒,不会因为一次开源就被填平。但方向是正确的——硬件造出来之后,软件工具必须跟上,国产算力才能真正把硬件实力发挥出来。

生态建设是一个漫长的过程

CUDA生态自2006年发布以来,已积累近二十年的开发者社区、第三方库(如cuDNN、cuBLAS)、调试分析工具和大量经过生产验证的代码资产。目前全球绝大多数主流AI框架(PyTorch、TensorFlow等)的默认后端均为CUDA,学术界几乎所有公开发布的模型代码也默认在CUDA环境下运行。这意味着昇腾即使在接口兼容性上实现对齐,仍面临长尾适配问题:大量依赖特定CUDA行为细节的代码、尚未移植的专用库、以及开发者几十年积累的使用习惯,都需要时间逐步迁移。软件生态的护城河,本质上是由无数细节和习惯叠加而成的网络效应,这是此次开源迈出重要一步后仍需正视的现实。

结语

这是一件对国产AI产业链利好的事。它不会马上改变普通人的日常使用体验,却是整条产业链中很重要的一块拼图。当硬件、软件、工具链逐步补齐,国产大模型的发展才有了更坚实的底座。从CUDA一家独大,到国产算力开始建立自己的软件生态,这一步虽小,却指向了一个更值得期待的长期趋势。

背景补充

所谓"算子"(Operator),是深度学习框架中执行具体数学运算的最小功能单元,例如卷积、矩阵乘法、激活函数等。每一种硬件架构(如英伟达GPU、华为昇腾NPU)都有自己的指令集和内存访问方式,算子必须专门为对应硬件编写才能高效执行。这也是为什么同一个模型换了芯片就得"重新施工"——不是模型本身变了,而是底层算子需要针对新硬件重新实现和调优。此次开源的算子编程语言和相关组件,相当于为昇腾平台提供了一套与CUDA对等的"底层建筑材料",让开发者不必从零开始,大幅降低了适配新硬件的技术门槛。

分享:

相关推荐