[KongchangAI]
ConceptTensor Parallelism

张量并行

多设备推理的核心切分策略之一,将单层模型的张量计算切分到多张GPU上并行执行,实现层内并行加速

Timeline (last 90 days)

Jul 20

大模型每生成一个Token需要在GPU上执行大量矩阵乘法运算,这是Transformer架构注意力机制的核心计算步骤

Unverified50%

All Facts (1)

Source Articles