Unverified60% confidenceFactExact time
原生 FP8 硬件加速最早在 NVIDIA Hopper 架构(H100,2022年)的第四代 Tensor Core 中实现,峰值算力达 3958 TFLOPS
2
Sources
60%
Confidence
Long-term
Relevance
7/22/2026
First Seen
Sources
Related Claims
UnverifiedNVIDIA从Hopper架构(H100)开始原生支持FP8计算80% similarUnverifiedV100的Tensor Core在FP16精度下峰值算力可达125 TFLOPS,是前代Pascal架构的5倍以上77% similarVerifiedNVIDIA A100拥有6912个CUDA核心和432个Tensor Core,理论峰值算力达到312 TFLOPS(BF16)76% similarUnverifiedH100的第四代Tensor Core原生支持FP8,峰值算力达3958 TFLOPS,是FP16的两倍74% similarUnverified针对 NVIDIA Ampere(A100)架构手工调优的 kernel 在 Hopper(H100)上未必仍是最优,因为新架构引入了 Tensor Memory Accelerator(TMA)等新型内存访问指令74% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/586474API
curl https://kongchang.com/api/v1/knowledge/claims/586474MCP
get_claim(id=586474)