待验证50% 置信事实精确时间
NVIDIA的非均匀张量并行实现引入了不平衡矩阵乘法核(Unbalanced GEMM Kernel),允许不同GPU在同一层执行不同列数的矩阵乘法
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/7
首次发现
有效期至:2026/10/5
来源
非均匀张量并行:NVIDIA提升LLM训练Goodput的容错新方案
rss2026/7/6
相关事实
待验证NVIDIA提出了非均匀张量并行(Nonuniform Tensor Parallelism)技术,用于在GPU故障时最大化LLM训练的有效产出(Goodput)71% 相似已验证NVIDIA从Volta架构开始引入Tensor Core,这是一种专门用于矩阵乘加运算的硬件单元69% 相似待验证张量并行(Tensor Parallelism)是将单个模型层的权重矩阵切分到多块 GPU 上并行计算,适用于模型参数超出单卡显存的场景68% 相似待验证NVIDIA GPU采用SIMT架构,warp内部32个线程通过shuffle指令交换数据并累加,warp内执行同步但不同warp、不同SM之间的调度顺序由硬件动态决定68% 相似待验证NVIDIA在2020年后推出A100、H100系列GPU,其张量核心的矩阵乘法加速设计契合Transformer workload68% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/206978API
curl https://kongchang.com/api/v1/knowledge/claims/206978MCP
get_claim(id=206978)