H100
Core Facts
Timeline (last 90 days)
DreamDojo使用256块H100 GPU进行训练
H100单卡租用成本约2-3美元/小时
NVIDIA 的产能和分销资源在 AI 热潮下优先倾斜给了 H100、H200 等高端型号
70B级模型往往需要多卡或云端A100/H100才能流畅推理
英伟达高端GPU(如H100、A100、消费级4090)拥有数千个CUDA核心,配合大显存带宽,可在显存容量允许前提下同时为多个推理请求服务
一块现代数据中心GPU(如H100)通常拥有数十到逾百个SM
甲骨文在英伟达H100/H200 GPU集群的大规模采购和裸金属实例供给上投入巨大
Grace Blackwell是英伟达面向AI训练与推理的最新一代芯片平台,相较于上一代H100在能效和互联带宽上均有显著提升
一家美股上市公司CEO涉嫌走私超过3亿美元英伟达芯片,将A100、H100等GPU从东南亚转运至中国,FBI指控其使用虚假身份购买芯片,2024年单年获利超1.76亿美元,最高面临20年刑期
MiMo Pro是1万亿参数、20亿激活参数的MoE模型,4-bit量化运行约需500GB显存即约8张H100
40 more timeline events
All Facts (20)
英伟达H100采用的HBM3内存带宽高达3.35TB/s
90%VerifiedxAI建设了名为Colossus的超级计算集群,据报道配备了超过10万块NVIDIA H100 GPU
90%Verified大语言模型的预训练过程需要数千块高端GPU并行运算数月,耗资通常在数千万到数亿美元之间
90%Verified训练一次GPT-4级别的模型需要数万块A100/H100 GPU协同工作数月
90%Verified英伟达H100/H200 GPU单卡售价高达3-4万美元
90%Verified英伟达H100/H200系列GPU在AI训练和推理市场占据超过80%的份额
90%Verified美国自2022年起对中国实施先进半导体出口管制,限制高端AI训练芯片如NVIDIA A100/H100及其后续产品的出口
85%VerifiedCerebras最新一代WSE-3芯片面积达到约46,225平方毫米,集成了4万亿个晶体管和90万个AI优化核心,是英伟达H100 GPU面积的50倍以上
80%VerifiedNVIDIA的MIG技术可在A100/H100等高端GPU上实现硬件级别的资源隔离
80%VerifiedBlackwell架构核心创新包括第二代Transformer引擎(支持FP4精度)、NVLink Switch系统(支持576块GPU互联)、20 petaFLOPS的FP4算力和192GB HBM3e显存(带宽达8TB/s)
80%VerifiedBlackwell的第二代Transformer Engine新增FP4精度支持,理论上可将Transformer模型的训练吞吐量相比H100提升2-4倍
75%VerifiedH100这类顶级AI芯片单张售价约3-4万美元
75%Verified美国对华限制高端GPU出口,包括英伟达A100、H100等
75%VerifiedHBM是英伟达A100、H100、H200等AI训练芯片的核心组成部分
75%Verified70B级别的模型即便经过量化,往往也需要40GB以上显存或多卡配置
75%Verified主流NVMe SSD的顺序读取速度可达3500-7000MB/s
75%Verified支持128K上下文的70B参数模型的KV Cache满负荷时可能需要数百GB显存,超过单张H100的80GB显存容量
70%VerifiedNVLink 4.0(用于H100)单向带宽可达900 GB/s
70%VerifiedMeta训练Llama 3.1 405B使用了超过16,000块H100 GPU,训练耗时数月,成本可能超过1亿美元
65%Verified英伟达H100单张售价约3万至4万美元,训练GPT-4量级模型估计需要数千张H100并行运算数月
65%