DeepSeek开源六大组件:为国产算力铺下地基

DeepSeek开源六大昇腾平台生产级组件,首次实质性补齐国产算力软件生态短板。
2024年9月30日,DeepSeek一次性开源了面向华为昇腾平台的六大基础设施组件(TileLang、DeepGEMM、DeepEP、FlashMLA、TileKernels、DeepSelect),与此前英伟达平台的开源组件一一对应,且均已在DeepSeek V4训练中经过生产级验证。文章指出,卡住国产算力的从来不是芯片硬件,而是以CUDA为核心的软件生态迁移成本。其中最关键的TileLang将手写CUDA"手动挡"式的执行计划编写,简化为类似写SQL的"自动挡"开发体验,大幅降低迁移门槛。这次开源对行业的冲击涵盖三个层面:实质性补齐国产算力软件短板、拓宽中小AI公司算力选型自由度、开启AI底层语言"战国时代"。对不做模型训练的应用层工程师而言,机会在于私有化部署与AI工程化落地的"最后一公里"。
一次比发模型更重要的开源
在国庆节前的9月30日上午10点01分,DeepSeek广告做了一件没怎么上热搜、却可能比发布新模型更重要的事——它一次性开源了面向华为昇腾平台的六大基础设施组件:TileLang、DeepGEMM、DeepEP、FlashMLA、TileKernels、DeepSelect。
翻译成人话,就是DeepSeek把自己训练大模型用的"锅碗瓢盆",在国产芯片上也做了一整套,然后免费开源给全行业用。
这件事之所以值得单独拿出来讲,是因为这是第一次有一家中国头部大模型公司,把在国产芯片上跑通生产级训练的完整底层软件栈全部开源。这不是一份PPT,也不是一个Demo,而是DeepSeek V4训练中真刀真枪用过的东西。它把"国产算力能不能训练顶级大模型"这个问号,改成了句号。

卡住国产算力的从来不是芯片
要理解这次开源的分量,得先搞清楚一个常被误解的问题:卡住国产算力的,从来不是芯片本身,而是软件生态。
AI模型训练本质上是海量数据的计算,跑在算力芯片(GPU)上。目前用得最多的是英伟达GPU。但芯片是硬件,硬件自己不会干活,得有软件告诉它怎么算,这套"告诉它怎么算"的东西就是基础软件组件。
英伟达最牛的地方不只是先进的芯片,而是它早在2006年就推出了CUDA,并围绕CUDA用近20年时间,把Tensor RT、各类配套库、教程、工具、社区全部建立起来。结果就是全世界的AI开发者只要用英伟达,就必须写CUDA。换一家芯片,等于让一个写了10年Java的人突然改用汇编重写全部业务代码——迁移成本高到让人望而却步。
国产GPU这几年硬件参数并不输英伟达,但生态差一大截几乎是行业共识。DeepSeek这次要补的,正是这块软件短板。
值得补充的是,英伟达CUDA生态的护城河不仅体现在工具链上,更体现在人才积累与代码资产上。全球大量AI研究论文的复现代码、开源框架(如PyTorch、TensorFlow)的底层算子,都默认以CUDA为实现语言。这意味着即使某款国产芯片的理论算力与英伟达相当,开发者在迁移时面对的是一个"代码负债"问题——不仅要重写算子,还要重新验证数值精度、重新调优性能,中间任何一环出错都会导致训练结果不可复现。华为昇腾早年推出的AscendC编程框架已是重要一步,但缺乏像DeepSeek这样经过顶级模型生产验证的上层软件栈配合,落地门槛依然很高。
六大组件分别对应什么
这六个组件和DeepSeek此前面向英伟达平台的开源组件一一对应——以前英伟达有一份,现在昇腾也有了一份。
逐一拆解
- TileLang:对应英伟达的CUDA,用简单的写法写出能跑满硬件性能的算子。
- DeepGEMM:对应cuBLAS,管的是AI里最核心的矩阵乘法怎么算得最快。
- DeepEP:对应NCCL,管的是几百张卡之间怎么通信不"堵车"。
- FlashMLA:对应FlashAttention,让超长文本处理更省更快。
- TileKernels:对应CUTLASS,负责数据搬进搬出的常规处理。
- DeepSelect:对应DALI这类数据管线,负责从海量数据里快速挑出要用的部分。
要特别记住的一点是:TileLang不是纸上谈兵。引用DeepSeek官方原话,它已经承载了DeepSeek V4系列模型训练中大部分算子的实现。换句话说,这是经过生产级验证的东西。
从手动挡到自动挡:TileLang为什么关键
对没写过算子的同学来说,理解TileLang只需要一句话:CUDA相当于手动挡,TileLang相当于自动挡。
如果你写过数据库,这个比喻最好懂。写SQL时你只写SELECT ... FROM ... JOIN ... WHERE,不用管数据库先扫哪张表、走不走索引、用不用哈希连接,这些交给查询优化器。而写CUDA时,相当于你手写执行计划,每一步都得自己安排,写错一处就慢一半,甚至结果直接错。TileLang干的事,就是让你重新回到"写SQL"这一层。

GPU的分层执行模型
在GPU内部,CUDA的并行执行模型是分层的,从大到小依次是Grid、Block、Thread。可以把它想象成一个超市:Thread是最基础的单个理货员,每人只负责手头一件小事(比如扫描一个商品);Block是几百个理货员组成的工作小组,组员之间可以"交头接耳"(共享内存)互相配合;Grid就是整个超市大厂,由无数工作小组拼成,共同完成海量任务。
这套Grid-Block-Thread的层次结构对应着GPU硬件上真实存在的资源划分。每个Block共享的"内存"在硬件上叫做Shared Memory(共享内存),它比全局显存(VRAM)快十倍以上,但容量极小(通常只有几十KB)。高性能算子的精髓,正是精确地把数据从慢速全局显存搬入快速共享内存、计算完再写回,同时让所有线程尽量"不闲着"。一旦搬运时机或同步位置写错,轻则性能大幅下降,重则算出错误结果。这正是手写CUDA极易出错、调试成本极高的根本原因,也是TileLang自动管理数据搬运与同步的价值所在。
以矩阵乘法为例
为加速矩阵乘法,通常会用到"分块"技术——把大矩阵拆成很多小方块,一块块搬进GPU高速缓存计算。
在**传统CUDA(手动挡)**里,程序员要手动控制线程怎么走、数据怎么搬、什么时候同步。你得自己定义共享内存里的小方块,循环遍历大矩阵,一个点一个点搬数据,还要小心翼翼地手写同步指令。指针计算密密麻麻,一步算错满盘皆输;同步指令漏掉或写错位置,就会遭遇数据竞争,算出来全是乱码且极难排查。
而在**TileLang(自动挡)**里,矩阵和小方块成了基本对象。你只需要告诉它"我想怎么切块",剩下的搬运和同步它自动搞定——没有复杂的指针下标计算,用类似Python切片的语法就能操作数据。更关键的是没有手动同步这一步:TileLang知道你在做分块计算,编译成机器码时会自动把同步指令插到最完美的位置。代码量大幅减少,逻辑非常清晰。

CUDA像手动挡老卡车,离合换挡全靠手动,技术不好容易熄火(死机)或算错;TileLang像自动挡新能源车,你设定好目的地(切块大小),一脚油门下去自动驾驶。迁移成本因此从"重写一遍"压向"改几行"。
对行业的三重冲击
跳出DeepSeek本身,这次开源对整个行业至少有三个层面的冲击。
冲击一:国产算力的软件短板被实质性补上。 昇腾在大模型训练这个最硬核的场景里,第一次拥有了对标CUDA生态的生产级软件栈,这会显著加快其他国产芯片厂商跟进的节奏。
冲击二:中小AI公司的算力选型自由度大幅提升。 以前创业公司做AI基本只有一条路——融资买英伟达烧钱。现在多了一个真实可选项:昇腾加上DeepSeek开源栈。哪怕只用来做推理集群或垂直模型微调,成本结构都会明显变化。
冲击三:AI底层语言的"战国时代"开启。 TileLang、Triton、Mojo、AscendC、CUDA,未来几年AI底层语言赛道会非常热闹。能写高性能算子、懂国产芯片调优的工程师本就极少,需求一旦起来,这波人才会迎来新行情。
从更宏观的视角看,这次开源也具有地缘政治层面的意义。自2022年起美国对华实施先进GPU出口管制,英伟达A100、H100等高端芯片无法合规进入中国市场,国内AI企业不得不转向昇腾、寒武纪等国产算力。然而"有芯片、缺软件"的困境一直是国产算力推广的主要阻碍——客户买了硬件却跑不起来主流模型,形成大量闲置。DeepSeek此次开源,相当于为整个国产算力生态提供了一份"通用适配器",有望激活已部署但利用率不足的算力资源,这对国家算力基础设施的投资回报率有实质性改善意义。
不训练模型的人,机会在最后一公里
大多数读者是做互联网或企业级应用的Java、Go、前端工程师,平时不训练模型,模型层的红利吃不到。但"让AI在企业里真正跑起来"的红利,依然可以分享。

短期(3到6个月):技术栈不会因此改变,但可以花半天把TileLang仓库下载下来看看,有条件跑一遍,提前建立认知储备。
中期(6到18个月):AI成本会显著下降,你能接的单子变多。过去在系统里加智能摘要、智能问答、文档理解,走的通常是调用OpenAI、文心、通义的API按Token付费、数据出内网。未来的选型路径会变成:私有化部署一个开源大模型,跑在国产算力集群上(昇腾 + DeepSeek开源栈)。
长期(1到3年):技能储备方向要重新校准。别只押注CUDA,TileLang这种跨硬件的语言值得投入;关注昇腾、寒武纪、摩尔线程等国产算力生态;更重要的是——AI工程化能力比模型训练能力更稀缺。对绝大多数企业团队来说,"会用"比"会训"更重要,业务理解加上AI落地能力,才是最值钱的组合。
国产算力进企业内网的"最后一公里",让AI在企业系统里真正可用的那部分,正是应用层工程师的主场。
结语
这次开源的不是模型,而是"让人能用起来的那一层"——六个生产级组件,与英伟达平台上的开源组件一一对应。卡住国产算力的从来不是芯片,而是迁移成本;TileLang把"手写执行计划"退回到"写SQL",把迁移成本从重写一遍压向改几行。对不训练模型的工程师来说,机会不在写算子,而在最后一公里。
相关推荐

用n8n搭建WhatsApp智能线索自动化:AI分级让商机不再流失
拆解一个基于n8n的WhatsApp线索自动化工作流:用AI把客户消息分为hot/warm/cold四级,自动应答并评分,仅在高价值线索出现时通知老板,帮助中小企业高效管理商机、节省人力。

Arabagent.ai:面向中东市场的托管式N8N自动化方案
Arabagent.ai 面向中东市场提供托管式 N8N 自动化服务,含私有工作空间、无限工作流执行、AI 自愈架构及阿拉伯语双语支持,兼顾开源可控性与 SaaS 便捷。

用 n8n 打造 Gmail→Google Sheets 自动化 CRM 实战教程
手把手教你用 n8n 搭建 Gmail 到 Google Sheets 的 AI 自动化 CRM:收到邮件自动触发,由 OpenAI 读取理解内容并提炼任务信息写入待办表格,含触发器、AI 智能体、提示词与 Sheets 工具的完整配置步骤。