待验证50% 置信事实精确时间
Blackwell通过硬件级别对MX块级缩放的原生支持,使缩放因子可以与矩阵乘运算融合执行,这是FA4 MX8性能数字无法直接迁移到Hopper的根本原因
1
来源数
50%
置信度
长期有效
时效性
2026/9/16
首次发现
来源
涉及实体
相关事实
待验证Blackwell架构引入第五代张量核心,原生支持FP4×FP4矩阵乘加运算,累加器使用FP32或FP16精度68% 相似待验证NVIDIA的Blackwell架构(B100/B200)在硬件层面原生支持MXFP4格式的矩阵运算,吞吐量相比FP8可提升近一倍66% 相似待验证GPTQ 基于 OBQ 框架,逐层量化权重并利用 Hessian 矩阵的逆补偿量化误差,在 4-bit 甚至 3-bit 下仍能保持模型质量65% 相似待验证Blackwell是NVIDIA继Hopper和Ada Lovelace之后的新一代微架构,引入第五代Tensor Core以提升FP4/FP6推理效率64% 相似已验证NVIDIA 在 Blackwell 架构(SM 100/103,如 B100、B200 系列)中为 NVFP4 设计了专用 Tensor Core 指令 mma.kind::mxf4,并采用每 16 个元素为一组的 FP8 缩放因子机制64% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/927334API
curl https://kongchang.com/api/v1/knowledge/claims/927334MCP
get_claim(id=927334)