MXFP8
微缩放(Microscaling)浮点格式的8位变体,由OCP Microscaling Formats规范定义,AMD、英特尔、NVIDIA、微软等公司联合推动的行业标准,通过块内共享缩放因子实现细粒度量化,分E4M3和E5M2两种变体
核心事实
时间轴 (近 90 天)
v0.30.0 简化了 KDA、AttnRes 与 MLA 相关的执行流程,并为部分模型加入 MXFP8 KV 缓存与异步 Engram 机制
MXFP8属于微缩放浮点格式家族,其核心思想是在一小块数据内共享一个缩放因子
低精度FlashAttention-4(FA4 MX8)在FlashAttention-4基础上将前向与反向传播全面迁移到MXFP8微缩放低精度格式
MXFP8有两种变体:E4M3(4位指数、3位尾数)和E5M2(5位指数、2位尾数)
块级缩放相比张量级缩放能更细粒度适应张量内部数值分布差异,在梯度路径中数值稳定性更优
MXFP4已获得NVIDIA Blackwell架构GPU的硬件原生支持
MXFP4格式将一组元素(通常32个)共享一个8-bit缩放因子,每个元素用4-bit微型浮点数表示(1位符号+2位指数+1位尾数)
MXFP4(Microscaling Float Point 4-bit)是由Microsoft、NVIDIA、AMD等公司联合推动的OCP MX标准的一部分
全部知识事实 (8)
MXFP4格式将一组元素(通常32个)共享一个8-bit缩放因子,每个元素用4-bit微型浮点数表示(1位符号+2位指数+1位尾数)
65%已验证MXFP4(Microscaling Float Point 4-bit)是由Microsoft、NVIDIA、AMD等公司联合推动的OCP MX标准的一部分
65%待验证v0.30.0 简化了 KDA、AttnRes 与 MLA 相关的执行流程,并为部分模型加入 MXFP8 KV 缓存与异步 Engram 机制
50%待验证低精度FlashAttention-4(FA4 MX8)在FlashAttention-4基础上将前向与反向传播全面迁移到MXFP8微缩放低精度格式
50%待验证MXFP8属于微缩放浮点格式家族,其核心思想是在一小块数据内共享一个缩放因子
50%待验证MXFP8有两种变体:E4M3(4位指数、3位尾数)和E5M2(5位指数、2位尾数)
50%待验证块级缩放相比张量级缩放能更细粒度适应张量内部数值分布差异,在梯度路径中数值稳定性更优
50%待验证MXFP4已获得NVIDIA Blackwell架构GPU的硬件原生支持
50%