[控场AI]
概念Pipeline Parallelism

流水线并行

多设备推理的核心切分策略之一,按模型的不同层将计算分配到不同设备,数据在各GPU间依次流转,实现跨设备协同推理

核心事实

时间轴 (近 90 天)

10月2日

方案将Transformer按层拆分,Mac负责每个256-token批次的第1–40层,算完后将激活值通过USB-C流式传给手机,手机用自己的GPU跑第41–64层,实现流水线并行

待验证50%
9月29日

微控制器集群中最常见的分布策略是流水线并行(Pipeline Parallelism),将Transformer模型按层切分

待验证50%
9月29日

流水线并行的代价是每处理一个token都要经历完整的端到端等待,推理延迟随节点数线性叠加

待验证50%
9月22日

拓扑感知调度实践中,张量并行组的 GPU 应优先放置在同一节点内,流水线阶段可跨节点但应尽量同机架,数据并行副本则可灵活分布

待验证50%
9月16日

流水线并行按模型层做纵向切分,通信量远小于张量并行,但存在流水线气泡问题导致GPU空闲

待验证50%
9月16日

该部署采用TP2 PP4并行方案:显卡两两一组做张量并行共四组,组间做流水线并行

待验证50%
9月12日

多GPU推理的并行化策略包括张量并行(将单个数学运算拆分到多块GPU)、流水线并行(将不同神经网络层分配给不同GPU)和数据并行(复制整个模型处理多批数据)

待验证50%
9月10日

本次测试大概率采用流水线并行方式部署多GPU,模型前半部分层在第一张卡后半部分层在第二张卡

待验证50%
9月10日

张量并行(TP)将单个Transformer层权重矩阵切分到不同GPU,每层前向传播需要All-Reduce通信;流水线并行(PP)将模型按层切分,通信量小但存在气泡导致利用率下降

待验证50%

全部知识事实 (11)

已验证

现代大模型训练通常同时采用数据并行、流水线并行、张量并行和专家并行等多种并行策略组合,即3D或4D并行架构

80%
待验证

块调度建议将张量并行(TP)限制在NVLink带宽最高的GPU子集内(同一个最小块),数据并行(DP)跨块分布,流水线并行(PP)沿拓扑层次展开

85%
待验证

方案将Transformer按层拆分,Mac负责每个256-token批次的第1–40层,算完后将激活值通过USB-C流式传给手机,手机用自己的GPU跑第41–64层,实现流水线并行

50%
待验证

流水线并行的代价是每处理一个token都要经历完整的端到端等待,推理延迟随节点数线性叠加

50%
待验证

微控制器集群中最常见的分布策略是流水线并行(Pipeline Parallelism),将Transformer模型按层切分

50%
待验证

拓扑感知调度实践中,张量并行组的 GPU 应优先放置在同一节点内,流水线阶段可跨节点但应尽量同机架,数据并行副本则可灵活分布

50%
待验证

该部署采用TP2 PP4并行方案:显卡两两一组做张量并行共四组,组间做流水线并行

50%
待验证

流水线并行按模型层做纵向切分,通信量远小于张量并行,但存在流水线气泡问题导致GPU空闲

50%
待验证

多GPU推理的并行化策略包括张量并行(将单个数学运算拆分到多块GPU)、流水线并行(将不同神经网络层分配给不同GPU)和数据并行(复制整个模型处理多批数据)

50%
待验证

本次测试大概率采用流水线并行方式部署多GPU,模型前半部分层在第一张卡后半部分层在第二张卡

50%
待验证

张量并行(TP)将单个Transformer层权重矩阵切分到不同GPU,每层前向传播需要All-Reduce通信;流水线并行(PP)将模型按层切分,通信量小但存在气泡导致利用率下降

50%

来源文章