待验证50% 置信事实精确时间
张量并行(Tensor Parallelism)是将单个模型层的权重矩阵切分到多块 GPU 上并行计算,适用于模型参数超出单卡显存的场景
1
来源数
50%
置信度
长期有效
时效性
2026/8/21
首次发现
来源
相关事实
待验证NVIDIA提出了非均匀张量并行(Nonuniform Tensor Parallelism)技术,用于在GPU故障时最大化LLM训练的有效产出(Goodput)73% 相似待验证AITER GEMM 和 FlyDSL FusedMoE 内核同时支持 Tensor Parallelism(TP)和 Data Parallelism + Expert Parallelism(DP+EP)两种并行策略71% 相似待验证NVIDIA的非均匀张量并行实现引入了不平衡矩阵乘法核(Unbalanced GEMM Kernel),允许不同GPU在同一层执行不同列数的矩阵乘法68% 相似待验证Tensor Core高效运行要求矩阵维度对齐至16或8的倍数68% 相似待验证A mid-range GPU can achieve tens to hundreds of times the matrix computation throughput of a CPU68% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/781305API
curl https://kongchang.com/api/v1/knowledge/claims/781305MCP
get_claim(id=781305)