Unverified50% confidenceFactExact time
NVIDIA的非均匀张量并行实现引入了不平衡矩阵乘法核(Unbalanced GEMM Kernel),允许不同GPU在同一层执行不同列数的矩阵乘法
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/7/2026
First Seen
Valid until: 10/5/2026
Sources
非均匀张量并行:NVIDIA提升LLM训练Goodput的容错新方案
rss7/6/2026
Related Claims
UnverifiedNVIDIA提出了非均匀张量并行(Nonuniform Tensor Parallelism)技术,用于在GPU故障时最大化LLM训练的有效产出(Goodput)71% similarVerifiedNVIDIA从Volta架构开始引入Tensor Core,这是一种专门用于矩阵乘加运算的硬件单元69% similarUnverified张量并行(Tensor Parallelism)是将单个模型层的权重矩阵切分到多块 GPU 上并行计算,适用于模型参数超出单卡显存的场景68% similarUnverifiedNVIDIA GPU采用SIMT架构,warp内部32个线程通过shuffle指令交换数据并累加,warp内执行同步但不同warp、不同SM之间的调度顺序由硬件动态决定68% similarUnverifiedNVIDIA在2020年后推出A100、H100系列GPU,其张量核心的矩阵乘法加速设计契合Transformer workload68% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/206978API
curl https://kongchang.com/api/v1/knowledge/claims/206978MCP
get_claim(id=206978)