Unverified50% confidenceBenchmarkExact time
Blackwell架构FP4矩阵乘法理论峰值算力相比FP16提升可达8倍
1
Sources
50%
Confidence
Long-term
Relevance
7/7/2026
First Seen
Sources
NVFP4量化实战:NVIDIA模型优化器压缩大模型指南
rss6/26/2026
Related Claims
UnverifiedBlackwell的FP4格式仅有4位(1位符号、2位指数、1位尾数),采用每128个FP4元素共享一个FP8精度缩放因子的块浮点表示69% similarUnverifiedFP8存在两种变体:E4M3(4位指数+3位尾数)精度更高适合前向推理,E5M2(5位指数+2位尾数)动态范围更大适合梯度计算63% similarUnverifiedBF16相比FP16拥有与FP32相同的8位指数位宽,因此动态范围更大,已成为当前主流大模型训练精度选择60% similarUnverifiedFP16的最大值约为65504,动态范围小于BF16,容易出现溢出问题60% similarUnverifiedRTX 3060的INT4 Tensor Core理论峰值算力约为101 TOPS,而FP16仅约12.7 TFLOPS,差距达8倍以上60% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/185216API
curl https://kongchang.com/api/v1/knowledge/claims/185216MCP
get_claim(id=185216)