NVLink
NVLink是NVIDIA开发的一种高速芯片间互联技术,用于实现多块GPU之间或GPU与CPU之间的高带宽、低延迟直接通信。相较于传统PCIe总线,NVLink提供更高的数据传输带宽和更低的延迟,支持多GPU协同工作时的高效数据共享与通信,广泛应用于高性能计算、深度学习训练及数据中心等场景。
核心事实
时间轴 (近 90 天)
张量并行通常只在同一节点内的NVLink互联卡之间使用,跨节点部署会因InfiniBand带宽不足而严重拖慢训练吞吐
专业AI服务器通过NVLink实现GPU直连,带宽可达数百GB/s
AMD的硬件互联技术为xGMI/Infinity Fabric,NVIDIA的为NVLink
当多块GPU通过NVLink或InfiniBand互联时,互联带宽往往成为端到端推理吞吐的硬性上限,而非GPU算力本身
NVIDIA 版 DeepEP 走 NCCL,卡内用 NVLink,跨节点用 RDMA,内核用 CUDA 编写
英伟达专为多卡训练设计了NVLink高速互联和NCCL通信库,形成软硬件配套的完整方案
UB(统一总线)是昇腾平台特有的片间高速互联技术,与英伟达NVLink定位类似但实现路径不同
传统GPU服务器需要通过NVLink、InfiniBand等高速互联协议在数百至数千颗芯片间传输数据,这会消耗大量带宽并引入延迟和额外功耗
NVIDIA的NVLink、GPU驱动及数据中心管理软件栈(如DCGM)为功率闭环控制提供基础设施支撑
该主机使用两块二手AORUS RTX 3090 XTREME WATERFORCE显卡并通过NVLink连接
还有 24 条时间轴事件
全部知识事实 (20)
NVLink 4.0的双向带宽可达900GB/s,而跨节点InfiniBand HDR仅约50GB/s,差距近20倍
80%已验证在H100 NVLink架构中,单台服务器内8块GPU可通过NVSwitch全互联,总带宽达900GB/s,相比PCIe 5.0的64GB/s有数量级提升
75%已验证NVIDIA最新的NVLink 5.0可提供每GPU 1.8TB/s的双向带宽
75%已验证NVLink 4.0(用于H100)单向带宽可达900 GB/s
70%已验证实测中Qwen3 27B在未开启NVLink的4张魔改2080Ti上生成速度约为40多token/秒
65%已验证英伟达主导的高端训练集群依赖InfiniBand高速网络(带宽可达800Gb/s)和NVLink/NVSwitch实现GPU直连
65%已验证NVLink 4.0的双向带宽高达900GB/s,而传统PCIe总线带宽约为64GB/s
65%待验证NVLink技术自2016年Pascal架构起推出,旨在突破PCIe总线的带宽限制
95%待验证Hopper架构的第四代NVLink提供900GB/s的带宽
90%待验证NCCL通信库已经针对NVLink拓扑做了深度优化
90%待验证传统DGX集群中,8块GPU组成一个节点,节点内走NVLink,节点间走InfiniBand
90%待验证大语言模型训练背后需要精密的数据中心电源分配单元、液冷或风冷散热系统、高速互联网络(NVLink、InfiniBand)以及UPS不间断电源保障
90%待验证块调度建议将张量并行(TP)限制在NVLink带宽最高的GPU子集内(同一个最小块),数据并行(DP)跨块分布,流水线并行(PP)沿拓扑层次展开
85%待验证GB200 NVL72的72块GPU可以按照NVLink拓扑结构划分为不同粒度的块,包括9个8-GPU块、4个18-GPU块、2个36-GPU块或1个72-GPU块
85%待验证在大规模训练集群中,节点内通信(NVLink)与节点间通信(InfiniBand或RoCE)的性能差异可达一个数量级
80%待验证NVLink的核心目标是突破传统PCIe总线在带宽上的限制,让多个GPU之间以极高速率直接通信
70%待验证GB200 NVL72将NVLink互联从单节点内部扩展到了整个机架级别,机架内任意两块GPU之间都能通过NVLink直接通信
70%待验证NVLink第五代(搭载于Blackwell架构)单链路双向带宽可达1.8TB/s
70%待验证Blackwell架构将NVLink带宽提升至每GPU 1.8TB/s
70%待验证训练需要高带宽互联的GPU集群(如NVLink互联的A100/H100),推理更看重单卡内存带宽、批处理吞吐量与低延迟
60%