多设备推理的核心切分策略之一,将单层模型的张量计算切分到多张GPU上并行执行,实现层内并行加速
大模型每生成一个Token需要在GPU上执行大量矩阵乘法运算,这是Transformer架构注意力机制的核心计算步骤