Blackwell
Blackwell是NVIDIA推出的一代GPU微架构,面向高性能计算、人工智能训练与推理等应用场景。该架构在前代架构基础上提升了计算吞吐量与能效比,支持大规模并行计算任务,并针对大型语言模型等AI工作负载进行了专项优化。Blackwell架构被应用于NVIDIA旗下多款面向数据中心和专业计算领域的GPU产品线。
Core Facts
Timeline (last 90 days)
RTX 5090是NVIDIA Blackwell架构下的消费级旗舰显卡
Yoga Pro 9N搭载RTX Spark平台,组合最高20核心CPU与Blackwell架构的RTX显卡
FlashAttention-4在NVIDIA Blackwell架构上暴露了注意力机制内部特殊函数单元的不平衡问题
RTX 5090搭载Blackwell架构GPU,具备极高的FP8/FP16浮点算力,理论上可用于大规模AI模型训练与推理
英伟达的Hopper/Blackwell架构在硬件层面引入了机密计算(Confidential Computing)能力,支持在可信执行环境(TEE)中运行工作负载
英伟达的高端GPU包括H100、H200以及Blackwell系列
Flash Attention 4(FA4)专为NVIDIA Hopper/Blackwell架构设计,其核心改进包括利用TMA进行异步数据搬运、producer-consumer warp分离的流水线化、以及FP8低精度路径优化
从上一代GPU迁移到Blackwell不是重新编译就能获得性能,内核的分块策略、流水线安排、寄存器分配都需要重新调优
原文的工作将JFA移植并优化到Blackwell平台,目标是逼近SOTA级别的FA4性能
头部AI实验室通过take-or-pay长期合同提前锁定算力,反映其判断高端GPU(如NVIDIA H100/H200/Blackwell系列)将长期供不应求
40 more timeline events
All Facts (20)
NVFP4是NVIDIA推出的4位浮点(FP4)量化格式,专为Blackwell架构GPU的硬件加速能力设计
90%Verified英伟达H100/H200系列GPU在AI训练和推理市场占据超过80%的份额
90%VerifiedRTX 5090拥有32GB显存
80%VerifiedBlackwell架构核心创新包括第二代Transformer引擎(支持FP4精度)、NVLink Switch系统(支持576块GPU互联)、20 petaFLOPS的FP4算力和192GB HBM3e显存(带宽达8TB/s)
80%VerifiedBlackwell的第二代Transformer Engine新增FP4精度支持,理论上可将Transformer模型的训练吞吐量相比H100提升2-4倍
75%VerifiedNVIDIA 在 Blackwell 架构(SM 100/103,如 B100、B200 系列)中为 NVFP4 设计了专用 Tensor Core 指令 mma.kind::mxf4,并采用每 16 个元素为一组的 FP8 缩放因子机制
75%VerifiedNVIDIA Blackwell 架构于2024年发布,是继 Hopper(H100)之后的新一代数据中心 GPU 架构
75%VerifiedNVIDIA Blackwell架构(GB200/B200系列)在硬件层面引入了原生FP4张量核心
75%VerifiedBlackwell(B100/B200系列)于2024年发布,采用台积电4NP工艺制造,单颗GPU集成2080亿个晶体管
75%VerifiedNVIDIA RTX 5090基于Blackwell架构,配备32GB GDDR7显存,理论FP16算力超过100 TFLOPS
70%VerifiedRTX 5070属于NVIDIA Blackwell架构的消费级显卡产品线,拥有约12GB显存
65%VerifiedRTX 5090基于NVIDIA的Blackwell架构
65%VerifiedRTX 5090 基于 NVIDIA 的 Blackwell 架构
65%VerifiedGB300 是 NVIDIA Blackwell Ultra 系列旗舰数据中心芯片,集成 HBM3e 内存,单卡容量达288GB
65%UnverifiedBlackwell架构以美国数学家、统计学家David Blackwell命名
95%UnverifiedGB200中的'G'代表Grace CPU,'B'代表Blackwell GPU
95%Unverified2024年GTC上发布了Blackwell架构GPU和NIM(NVIDIA Inference Microservices)等产品
90%Unverified每颗Blackwell GPU拥有高达192GB HBM3e显存
90%Unverified同一组编译选项在 Ampere、Hopper、Blackwell 等不同 GPU 架构上的表现可能截然不同
90%UnverifiedBlackwell架构的第五代RT Core将光线追踪性能提升约2倍,Tensor Core支持FP4精度运算使AI推理吞吐量翻倍
85%