[控场AI]
概念Microscaling FP4 / MX Float 4

MXFP4

由OCP(Open Compute Project)定义的微缩放浮点量化格式,每个参数压缩至4比特,通过组内共享缩放因子在低比特下保持数值精度,用于大模型推理降本增效

时间轴 (近 90 天)

9月24日

在 DeepSeek R1 670B(MXFP4 精度)测试中,Jalapeño 每瓦吞吐约 1.7 倍(19,641 对 GB300 的 11,781),端到端延迟从 5.99 秒降到 1.65 秒

待验证60%
9月17日

MXFP4属于MX(Microscaling)系列标准,是分组浮点量化规范,每组权重共享一个缩放因子

待验证50%
9月17日

本次优化围绕vLLM推理框架与MXFP4/NVFP4量化路径展开,编写或调整了专用计算内核

待验证50%

全部知识事实 (3)

来源文章