ConceptTensor Parallelism
张量并行
多设备推理的核心切分策略之一,将单层模型的张量计算切分到多张GPU上并行执行,实现层内并行加速
Timeline (last 90 days)
Jul 20
大模型每生成一个Token需要在GPU上执行大量矩阵乘法运算,这是Transformer架构注意力机制的核心计算步骤
Unverified50%
多设备推理的核心切分策略之一,将单层模型的张量计算切分到多张GPU上并行执行,实现层内并行加速
大模型每生成一个Token需要在GPU上执行大量矩阵乘法运算,这是Transformer架构注意力机制的核心计算步骤