待验证50% 置信事实精确时间
张量并行将单层的权重矩阵横向切分到多个GPU上,通过AllReduce通信汇总结果,延迟较低但对GPU间互联带宽(如NVLink)要求极高
1
来源数
50%
置信度
长期有效
时效性
2026/9/21
首次发现
来源
涉及实体
相关事实
待验证块调度建议将张量并行(TP)限制在NVLink带宽最高的GPU子集内(同一个最小块),数据并行(DP)跨块分布,流水线并行(PP)沿拓扑层次展开76% 相似待验证NVLink的核心目标是突破传统PCIe总线在带宽上的限制,让多个GPU之间以极高速率直接通信75% 相似待验证Ring-AllReduce算法的通信量与GPU数量无关,每个节点发送和接收的数据总量固定为数据大小的2(N-1)/N倍,理论上是带宽最优的AllReduce实现73% 相似待验证将所有请求路由到同一个服务商可命中温热缓存,若请求被负载均衡到不同GPU节点则缓存命中率会大幅下降,因各节点的KV Cache相互独立69% 相似待验证MoE架构中每个Token需通过All-to-All通讯路由到对应专家GPU,随集群规模增大通讯开销呈近似平方级增长69% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/939691API
curl https://kongchang.com/api/v1/knowledge/claims/939691MCP
get_claim(id=939691)