待验证85% 置信事实时间未知
FP32到FP16的转换在现代GPU的Tensor Core上可实现2-4倍的吞吐量提升
1
来源数
85%
置信度
长期有效
时效性
2026/6/1
首次发现
来源
涉及实体
相关事实
已验证在配备 Tensor Core 的 NVIDIA GPU(如 A100、H100)上,FP16/BF16 矩阵运算的吞吐量可以达到 FP32 的 2-8 倍84% 相似待验证NVIDIA Blackwell架构(B200/GB200)支持FP4计算,理论上将Tensor Core吞吐量再次翻倍79% 相似待验证NVIDIA H100 GPU原生支持FP8格式,其吞吐量相较FP16提升约2倍76% 相似待验证TensorRT支持FP32/FP16/INT8/FP8多种精度校准74% 相似待验证V100的Tensor Core在FP16精度下峰值算力可达125 TFLOPS,是前代Pascal架构的5倍以上73% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/21235API
curl https://kongchang.com/api/v1/knowledge/claims/21235MCP
get_claim(id=21235)