DeepSpeed不止ZeRO:张量、序列与专家并行的易用化演进

DeepSpeed已补齐张量、序列、专家并行能力,并以ZeRO式易用性对齐SOTA训练框架。
长期被视为"ZeRO框架"的DeepSpeed,近期完成了三大并行能力的补齐:高度优化的张量并行、面向长上下文的序列并行,以及支持MoE架构的专家并行。这次更新的核心价值不在于并行技术本身(业界已有诸多实现),而在于DeepSpeed将这些高级能力包装到了与ZeRO相同的低门槛使用体验中,让工程师无需在"易用"与"强大"之间取舍。PyCon North America的分享者Masahiro表示将以实测基准数据佐证DeepSpeed在训练MoE等最新模型时可与其他SOTA框架相匹敌。这一进展折射出大模型训练框架竞争正从单点特性转向综合体验的行业趋势。
DeepSpeed的刻板印象该更新了
提到DeepSpeed,很多工程师的第一反应是ZeRO(Zero Redundancy Optimizer)——那套通过切分优化器状态、梯度和参数来降低显存占用的技术。它确实让DeepSpeed在易用性上建立了口碑,但也让一部分人形成了误解:似乎这个框架只擅长ZeRO,在真正的大规模并行训练上拼不过其他主流框架。
来自PyCon North America的分享者Masahiro直接指出了这个认知偏差。在他的预告中有一句很直接的话:"你以为DeepSpeed只擅长ZeRO和易用性,训练能力不行?事实并非如此。"

这句看似挑衅的开场,实际上点出了社区中长期存在的一个盲区。ZeRO固然经典,但它只是DeepSpeed能力版图的一部分,而非全部。

三类并行能力的补齐
现代大模型训练早已不是单一维度的切分游戏。要高效训练动辄千亿参数的模型,通常需要组合多种并行策略。原始分享中提到了DeepSpeed近期在以下几个方向的更新:
张量并行(Tensor Parallelism)
张量并行把单个层内的矩阵运算切分到多张GPU上并行计算。它是训练超大模型绕不开的手段,尤其当单层参数本身就超过单卡显存时。分享者特别强调了"高度优化的张量并行"(原文中因语音识别出现"Xcode parallel"的转写错误,实际应指tensor parallel)这一改进点。

张量并行的典型实现是Megatron-LM率先提出的列/行切分方案:以Transformer的自注意力层为例,Query、Key、Value投影矩阵按列切分分布到多卡,输出投影矩阵则按行切分,两端各插入一次All-Reduce通信以合并结果。这种方式将单层的计算与显存都分摊到N张卡上,但每个前向/反向传播步骤都需要显式同步,因此通信带宽是瓶颈所在——张量并行通常只在同一节点内的NVLink互联卡之间使用,跨节点部署会因InfiniBand带宽不足而严重拖慢训练吞吐。
序列并行(Sequence Parallelism)
随着上下文窗口不断拉长,激活值的显存开销急剧上升。序列并行通过沿序列维度切分计算,有效缓解长序列场景下的显存压力。这对训练支持长上下文的模型尤为关键。
序列并行通常与张量并行配合使用,由Megatron-LM在2022年的论文中正式提出。其核心动机是:张量并行虽然切分了权重,但LayerNorm、Dropout等算子的激活值仍在每张卡上完整保存,随着序列长度增大这部分显存开销不可忽视。序列并行将这些算子的输入沿序列维度切分,使得激活值的显存也随并行度线性降低。对于上下文长度达到32K乃至更长的模型,激活值往往是显存的主要消耗者,序列并行因此成为长上下文训练中不可或缺的手段,与激活重计算(Activation Checkpointing)共同构成显存管理的组合拳。
专家并行(Expert Parallelism)
这是面向MoE(Mixture of Experts,混合专家)架构的核心能力。MoE模型通过稀疏激活在扩大参数规模的同时控制计算成本,而专家并行负责把不同专家分布到不同设备上。分享者明确提到,有了这些更新,"DeepSpeed如今在训练最新的MoE模型上也能与其他最先进的框架相匹敌"。

MoE架构的核心思想是用"稀疏激活"换取参数规模的廉价扩展:每个Token经由一个可学习的路由器(Router)被动态分配给少数几个专家(Expert FFN),而非流经所有参数。以GPT-MoE为例,若总专家数为64而每个Token只激活Top-2,则实际计算量与同等规模的Dense模型相比可降低约97%。专家并行在此基础上将不同专家放置到不同设备,路由决策产生后需要通过All-to-All通信把Token发送到对应设备,再将结果汇聚回来。这类跨设备的稀疏通信模式使得专家并行的工程实现远比数据并行复杂,负载均衡损失(Load Balancing Loss)也是训练稳定性的重要调参项。
关键在于"ZeRO级别的易用性"
原标题中有一个值得玩味的措辞:with ZeRO-Level Usability(具备ZeRO级别的易用性)。这才是这次分享真正想传递的价值主张。
张量并行、序列并行、专家并行这些技术本身并不新鲜,许多框架都提供了相应实现。但它们往往伴随着复杂的配置、繁琐的代码改造,以及陡峭的学习曲线。DeepSpeed此次的核心卖点,是把这些高级并行能力做到了ZeRO那样"开箱即用"的体验门槛。
换句话说,工程师不必在"易用"和"强大"之间二选一。既能享受接近SOTA框架的训练性能,又能保持相对平缓的上手成本——这种组合对中小型团队和研究者的吸引力摆在眼前的事实。
以基准测试说话
分享者提到他"实际跑通了一些基准测试"(worked through how to run some benchmarks),并将在PyCon North America的现场演讲中展示。这意味着这不只是功能列表的罗列,而是会给出可对比的性能数据。
对于考虑技术选型的团队来说,这类基准数据往往比宣传话术更有参考价值。能否在相同硬件条件下匹配主流框架的吞吐与显存效率,才是决定是否迁移的关键依据。
对从业者的启示
这则预告虽短,却折射出大模型训练基础设施领域的一个趋势:框架之间的竞争正在从单点能力转向综合体验。
早期各框架以某个独特特性作为差异化卖点,如今则越来越多地走向功能对齐——都要支持多维并行、都要适配MoE、都要兼顾长上下文。在能力趋同的背景下,易用性、文档质量、生态兼容性反而成为决定开发者去留的分水岭。
DeepSpeed选择在保持易用性优势的同时补齐并行能力短板,正是对这一竞争格局的回应。对于长期把DeepSpeed等同于ZeRO的工程师而言,是时候重新评估它在训练能力上的真实位置了。
注:本文基于一则会议预告整理,具体的基准测试数据与实现细节有待分享者在正式演讲中披露。文中部分术语已根据上下文对原始语音转写的识别误差进行了修正。
相关推荐

Rysh Forge 实测:一份 OpenAPI 规范自动生成 Claude 可调用的 Agent 工具
Rysh Forge 用一条命令把 OpenAPI 规范自动转换成 Claude 可调用的 Agent 工具,同时生成 MCP server、Python SDK 和文档,并对写操作强制人工确认,实现全链路可观测。本文解析其工作流与价值。

OpenAI Agents SDK 实战:如何实现 Human-in-the-Loop 人工审批
基于 OpenAI Agents SDK 实现 Human-in-the-Loop 人工审批机制的完整教程:从 needs_approval 暂停工具调用、捕获 interruptions 中断,到 approve/reject 决策与 RunState 状态序列化恢复,让 AI Agent 在执行高风险操作前先征得人类同意。

MaRN开源:用低维参数映射训练神经网络的PyTorch库
开源PyTorch库MaRN通过低维参数映射训练神经网络,MNIST CNN参数压缩57.7倍仍保持91.8%准确率。本文解析其基准测试、功能构成与适用场景。