待验证50% 置信事实时间未知
NVIDIA Blackwell架构(B200/GB200)支持FP4计算,理论上将Tensor Core吞吐量再次翻倍
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/2
首次发现
有效期至:2026/9/30
来源
微软Tutel:MoE模型加速库深度解析,支持FP4/FP8低精度计算
githubmicrosoft
相关事实
待验证NVIDIA Blackwell架构(GB200/B200系列)在硬件层面引入了原生FP4张量核心81% 相似待验证NVIDIA 在 Blackwell 架构(SM 100/103,如 B100、B200 系列)中为 NVFP4 设计了专用 Tensor Core 指令 mma.kind::mxf4,并采用每 16 个元素为一组的 FP8 缩放因子机制81% 相似已验证在配备 Tensor Core 的 NVIDIA GPU(如 A100、H100)上,FP16/BF16 矩阵运算的吞吐量可以达到 FP32 的 2-8 倍80% 相似待验证NVIDIA的Blackwell架构(B100/B200)在硬件层面原生支持MXFP4格式的矩阵运算,吞吐量相比FP8可提升近一倍79% 相似待验证FP32到FP16的转换在现代GPU的Tensor Core上可实现2-4倍的吞吐量提升79% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/61136API
curl https://kongchang.com/api/v1/knowledge/claims/61136MCP
get_claim(id=61136)