待验证50% 置信基准精确时间
Blackwell架构FP4矩阵乘法理论峰值算力相比FP16提升可达8倍
1
来源数
50%
置信度
长期有效
时效性
2026/7/7
首次发现
来源
NVFP4量化实战:NVIDIA模型优化器压缩大模型指南
rss2026/6/26
相关事实
待验证Blackwell的FP4格式仅有4位(1位符号、2位指数、1位尾数),采用每128个FP4元素共享一个FP8精度缩放因子的块浮点表示69% 相似待验证FP8存在两种变体:E4M3(4位指数+3位尾数)精度更高适合前向推理,E5M2(5位指数+2位尾数)动态范围更大适合梯度计算63% 相似待验证BF16相比FP16拥有与FP32相同的8位指数位宽,因此动态范围更大,已成为当前主流大模型训练精度选择60% 相似待验证FP16的最大值约为65504,动态范围小于BF16,容易出现溢出问题60% 相似待验证RTX 3060的INT4 Tensor Core理论峰值算力约为101 TOPS,而FP16仅约12.7 TFLOPS,差距达8倍以上60% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/185216API
curl https://kongchang.com/api/v1/knowledge/claims/185216MCP
get_claim(id=185216)