已验证65% 置信事实时间未知
在配备 Tensor Core 的 NVIDIA GPU(如 A100、H100)上,FP16/BF16 矩阵运算的吞吐量可以达到 FP32 的 2-8 倍
3
来源数
65%
置信度
中期 (~90 天)
时效性
2026/7/2
首次发现
有效期至:2026/9/30
来源
Hugging Face Transformers:16万Star开源AI框架深度解析
githubhuggingface
相关事实
待验证NVIDIA H100 GPU原生支持FP8格式,其吞吐量相较FP16提升约2倍84% 相似待验证FP32到FP16的转换在现代GPU的Tensor Core上可实现2-4倍的吞吐量提升84% 相似待验证NVIDIA Blackwell架构(B200/GB200)支持FP4计算,理论上将Tensor Core吞吐量再次翻倍80% 相似待验证NVIDIA 在 Blackwell 架构(SM 100/103,如 B100、B200 系列)中为 NVFP4 设计了专用 Tensor Core 指令 mma.kind::mxf4,并采用每 16 个元素为一组的 FP8 缩放因子机制80% 相似已验证NVIDIA A100拥有6912个CUDA核心和432个Tensor Core,理论峰值算力达到312 TFLOPS(BF16)79% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/61143API
curl https://kongchang.com/api/v1/knowledge/claims/61143MCP
get_claim(id=61143)