H100
核心事实
时间轴 (近 90 天)
顶级AI实验室和科技巨头对H100、H200等高端GPU的需求远超台积电与英伟达的供应产能
B300 是 NVIDIA Blackwell 架构的服务器级加速卡,相较于上一代 H100/H800 其显存容量、内存带宽和 FP8 计算吞吐均有显著提升
英伟达数据中心加速器产品线以每1-2年迭代一代的速度推进,从A100到H100,再到H200和Blackwell架构
英伟达H100/H200、AMD MI300X均集成了HBM
在单张 H100 上 warm 状态下,标准版(32B,4步)生成并解码 22 帧 540p 视频耗时 843 毫秒
UkisAI 的方法论借鉴了 Meta 的一篇论文,并使用 8×H100 集群在编码、语言、视觉、智能体等分布外领域生成推理轨迹
AMD的MI300X在内存带宽上超越H100,并通过ROCm平台提供了一定程度的CUDA兼容层
在Hyperstack竞价H100 PCIe 80GB上每段视频耗时67秒,稳态每段0.038美元,会话每段0.13美元
在文生视频int8量化任务中,消费级RTX 4090的每段稳态成本比数据中心级H100便宜近三倍
在这个int8工作负载中,两张24GB卡和L40S每步耗时均为3.97秒,而H100 PCIe仅需2.99秒
还有 39 条时间轴事件
全部知识事实 (20)
大语言模型的预训练过程需要数千块高端GPU并行运算数月,耗资通常在数千万到数亿美元之间
90%已验证训练一次GPT-4级别的模型需要数万块A100/H100 GPU协同工作数月
90%已验证英伟达H100采用的HBM3内存带宽高达3.35TB/s
85%已验证英伟达H100/H200 GPU单卡售价高达3-4万美元
80%已验证Blackwell的第二代Transformer Engine新增FP4精度支持,理论上可将Transformer模型的训练吞吐量相比H100提升2-4倍
75%已验证NVLink 4.0(用于H100)单向带宽可达900 GB/s
70%已验证NVIDIA H100拥有3.35TB/s的HBM3带宽,单卡售价超过25万元人民币
70%已验证NVIDIA的MIG技术可在A100/H100等高端GPU上实现硬件级别的资源隔离
70%已验证H100这类顶级AI芯片单张售价约3-4万美元
65%已验证MI355X配备HBM3e内存,带宽可达数TB/s量级
65%已验证70B级别的模型即便经过量化,往往也需要40GB以上显存或多卡配置
65%已验证在配备 Tensor Core 的 NVIDIA GPU(如 A100、H100)上,FP16/BF16 矩阵运算的吞吐量可以达到 FP32 的 2-8 倍
65%已验证NVIDIA Hopper架构(H100/H200)首次加入FP8 Tensor Core,并引入Transformer Engine自动管理精度转换
65%待验证Hopper架构的第四代NVLink提供900GB/s的带宽
90%部分验证NVIDIA的H100/A100 GPU占据AI市场约80%份额
75%待验证美国商务部自2022年将A100、H100等高端GPU纳入出口管制清单
60%待验证Flash Attention 2在A100 GPU上可达到理论峰值FLOPS的72%
60%待验证顶级AI实验室和科技巨头对H100、H200等高端GPU的需求远超台积电与英伟达的供应产能
50%待验证B300 是 NVIDIA Blackwell 架构的服务器级加速卡,相较于上一代 H100/H800 其显存容量、内存带宽和 FP8 计算吞吐均有显著提升
50%待验证英伟达数据中心加速器产品线以每1-2年迭代一代的速度推进,从A100到H100,再到H200和Blackwell架构
50%