Unverified50% confidenceFactExact time
张量并行(Tensor Parallelism)是将单个模型层的权重矩阵切分到多块 GPU 上并行计算,适用于模型参数超出单卡显存的场景
1
Sources
50%
Confidence
Long-term
Relevance
8/21/2026
First Seen
Sources
Related Claims
UnverifiedNVIDIA提出了非均匀张量并行(Nonuniform Tensor Parallelism)技术,用于在GPU故障时最大化LLM训练的有效产出(Goodput)73% similarUnverifiedAITER GEMM 和 FlyDSL FusedMoE 内核同时支持 Tensor Parallelism(TP)和 Data Parallelism + Expert Parallelism(DP+EP)两种并行策略71% similarUnverifiedNVIDIA的非均匀张量并行实现引入了不平衡矩阵乘法核(Unbalanced GEMM Kernel),允许不同GPU在同一层执行不同列数的矩阵乘法68% similarUnverifiedTensor Core高效运行要求矩阵维度对齐至16或8的倍数68% similarUnverifiedA mid-range GPU can achieve tens to hundreds of times the matrix computation throughput of a CPU68% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/781305API
curl https://kongchang.com/api/v1/knowledge/claims/781305MCP
get_claim(id=781305)