[控场AI]
产品

H100

核心事实

时间轴 (近 90 天)

9月18日

顶级AI实验室和科技巨头对H100、H200等高端GPU的需求远超台积电与英伟达的供应产能

待验证50%
9月17日

B300 是 NVIDIA Blackwell 架构的服务器级加速卡,相较于上一代 H100/H800 其显存容量、内存带宽和 FP8 计算吞吐均有显著提升

待验证50%
9月16日

英伟达数据中心加速器产品线以每1-2年迭代一代的速度推进,从A100到H100,再到H200和Blackwell架构

待验证50%
9月16日

英伟达H100/H200、AMD MI300X均集成了HBM

待验证50%
9月15日

在单张 H100 上 warm 状态下,标准版(32B,4步)生成并解码 22 帧 540p 视频耗时 843 毫秒

待验证50%
9月14日

UkisAI 的方法论借鉴了 Meta 的一篇论文,并使用 8×H100 集群在编码、语言、视觉、智能体等分布外领域生成推理轨迹

待验证50%
9月12日

AMD的MI300X在内存带宽上超越H100,并通过ROCm平台提供了一定程度的CUDA兼容层

待验证50%
9月12日

在Hyperstack竞价H100 PCIe 80GB上每段视频耗时67秒,稳态每段0.038美元,会话每段0.13美元

待验证50%
9月12日

在文生视频int8量化任务中,消费级RTX 4090的每段稳态成本比数据中心级H100便宜近三倍

待验证50%
9月12日

在这个int8工作负载中,两张24GB卡和L40S每步耗时均为3.97秒,而H100 PCIe仅需2.99秒

待验证50%

还有 39 条时间轴事件

全部知识事实 (20)

已验证

大语言模型的预训练过程需要数千块高端GPU并行运算数月,耗资通常在数千万到数亿美元之间

90%
已验证

训练一次GPT-4级别的模型需要数万块A100/H100 GPU协同工作数月

90%
已验证

英伟达H100采用的HBM3内存带宽高达3.35TB/s

85%
已验证

英伟达H100/H200 GPU单卡售价高达3-4万美元

80%
已验证

Blackwell的第二代Transformer Engine新增FP4精度支持,理论上可将Transformer模型的训练吞吐量相比H100提升2-4倍

75%
已验证

NVLink 4.0(用于H100)单向带宽可达900 GB/s

70%
已验证

NVIDIA H100拥有3.35TB/s的HBM3带宽,单卡售价超过25万元人民币

70%
已验证

NVIDIA的MIG技术可在A100/H100等高端GPU上实现硬件级别的资源隔离

70%
已验证

H100这类顶级AI芯片单张售价约3-4万美元

65%
已验证

MI355X配备HBM3e内存,带宽可达数TB/s量级

65%
已验证

70B级别的模型即便经过量化,往往也需要40GB以上显存或多卡配置

65%
已验证

在配备 Tensor Core 的 NVIDIA GPU(如 A100、H100)上,FP16/BF16 矩阵运算的吞吐量可以达到 FP32 的 2-8 倍

65%
已验证

NVIDIA Hopper架构(H100/H200)首次加入FP8 Tensor Core,并引入Transformer Engine自动管理精度转换

65%
待验证

Hopper架构的第四代NVLink提供900GB/s的带宽

90%
部分验证

NVIDIA的H100/A100 GPU占据AI市场约80%份额

75%
待验证

美国商务部自2022年将A100、H100等高端GPU纳入出口管制清单

60%
待验证

Flash Attention 2在A100 GPU上可达到理论峰值FLOPS的72%

60%
待验证

顶级AI实验室和科技巨头对H100、H200等高端GPU的需求远超台积电与英伟达的供应产能

50%
待验证

B300 是 NVIDIA Blackwell 架构的服务器级加速卡,相较于上一代 H100/H800 其显存容量、内存带宽和 FP8 计算吞吐均有显著提升

50%
待验证

英伟达数据中心加速器产品线以每1-2年迭代一代的速度推进,从A100到H100,再到H200和Blackwell架构

50%

来源文章