待验证85% 置信事实精确时间
AITER GEMM 和 FlyDSL FusedMoE 内核同时支持 Tensor Parallelism(TP)和 Data Parallelism + Expert Parallelism(DP+EP)两种并行策略
1
来源数
85%
置信度
中期 (~90 天)
时效性
2026/5/28
首次发现
有效期至:2026/8/26
来源
AMD MI355X击败B200:DeepSeek-R1推理TCO低5%的全栈优化解析
twitterlmsysorg2026/5/28
涉及实体
相关事实
待验证张量并行(Tensor Parallelism)是将单个模型层的权重矩阵切分到多块 GPU 上并行计算,适用于模型参数超出单卡显存的场景71% 相似待验证GGUF 现已支持张量并行(Tensor Parallelism),可带来约 +30% 的推理吞吐提升65% 相似待验证NVIDIA提出了非均匀张量并行(Nonuniform Tensor Parallelism)技术,用于在GPU故障时最大化LLM训练的有效产出(Goodput)63% 相似待验证TensorFlow Lite、ONNX Runtime等推理框架可与底层驱动和硬件加速器(NPU/DSP)协同优化62% 相似待验证Tensor并行是大模型推理中应对单卡显存不足的核心策略,由Megatron-LM团队系统化提出61% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/621API
curl https://kongchang.com/api/v1/knowledge/claims/621MCP
get_claim(id=621)