Unverified50% confidenceTradeoffExact time
在8块GPU的张量并行组中若1块故障,剩余7块各额外承担约14.3%负载,整体吞吐量降至约87.5%,仍优于触发检查点回滚的Goodput损失
1
Sources
50%
Confidence
Long-term
Relevance
7/7/2026
First Seen
Sources
非均匀张量并行:NVIDIA提升LLM训练Goodput的容错新方案
rss7/6/2026
Related Claims
Unverified一个拥有10,000块GPU的训练集群,假设单块GPU年故障率为3%,平均每天约有一块GPU出现问题71% similarUnverified测试中4块GPU中只有1块的利用率达到约10%-13%,其余几乎处于空闲状态,而CPU使用率高达50%左右69% similarUnverified当AI集群规模扩展到数万张GPU时,整体效率可能暴跌到40%以下,超过一半的算力被消耗在数据传输和等待过程中68% similarUnverified自回归解码阶段GPU算力利用率往往不足10%,属于内存密集型操作66% similarUnverified相较于用GPU执行AI推理,NPU的功耗通常只有前者的1/5到1/1065% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/206979API
curl https://kongchang.com/api/v1/knowledge/claims/206979MCP
get_claim(id=206979)