NVFP4
NVFP4是NVIDIA针对Blackwell架构推出的一种4位浮点(FP4)数值量化格式,属于低精度数值表示标准。该格式专为深度学习推理和训练场景设计,通过降低数值位宽来减少内存占用和计算开销,同时相较于传统整数量化格式在数值表达范围和精度损失控制上具有一定优势,主要用于大规模神经网络模型的高效部署与加速计算。
核心事实
时间轴 (近 90 天)
Cosmos提供40亿到640亿参数三种规格,全多模态、可商用、可定制,其Super NanoEdge版本针对NVFP4和推测解码做了优化
该竞赛编程模型基于Nemotron-3-Ultra-550B-A55B微调而来,并采用NVFP4的低精度量化格式
根据英伟达官方测试,Qwen3 27B在Jetson上的最优解码组合是NVFP4量化叠加投机解码
NVFP4通常配合细粒度缩放因子(per-group scaling)和激活感知量化(AWQ/GPTQ)使用以抵消量化误差
NVFP4与INT4的区别在于它保留了浮点数的动态范围表达能力,对权重分布非均匀的大模型更友好
Primitive在Hugging Face上提供了mixed NVFP4与FP8的Flash Next模型页,配套Docker镜像和模型,推理引擎为vLLM
NVFP4是一种4位浮点量化格式,用于在保持模型精度的同时降低显存占用和提升推理吞吐
NVFP4本是NVIDIA私有格式,AMD在MI355上支持该格式意味着在硬件层面增加了对该数值格式的原生计算支持
vLLM发布了v0.30.1rc0预发布版本,为AMD MI355加速卡引入dense NVFP4内核与MoRI内核镜像支持(PR #58281)
单张AMD Radeon R9700运行Qwen3 27B NVFP4量化模型时,经优化后性能在各项指标上翻倍
还有 22 条时间轴事件
全部知识事实 (20)
NVFP4是NVIDIA推出的4位浮点(FP4)量化格式,专为Blackwell架构GPU的硬件加速能力设计
90%已验证NVIDIA 在 Blackwell 架构(SM 100/103,如 B100、B200 系列)中为 NVFP4 设计了专用 Tensor Core 指令 mma.kind::mxf4,并采用每 16 个元素为一组的 FP8 缩放因子机制
75%已验证在RTX 5070(12GB显存)配置下,本地Qwen3 9B模型的输出速度达到约70-76 token/秒
70%已验证NVFP4是NVIDIA推出的4位浮点格式(FP4),采用浮点表示(包含符号位、指数位和尾数位)以非均匀方式覆盖数值空间
65%已验证Unsloth团队发布了基于Dynamic v3量化方案的全新Qwen3.8-27B GGUF模型,在保持相同模型体积的前提下实现额外10%的top-1%精度提升
85%待验证NVFP4量化需要50系列NVIDIA显卡才能使用
85%待验证在非50系显卡上使用NVFP4会退化为软件模拟,导致显存占用大、精度差,无任何优势
85%待验证NVFP4量化在Blackwell架构上相比FP16吞吐量提升约40-50%
80%待验证Cosmos提供40亿到640亿参数三种规格,全多模态、可商用、可定制,其Super NanoEdge版本针对NVFP4和推测解码做了优化
50%待验证该竞赛编程模型基于Nemotron-3-Ultra-550B-A55B微调而来,并采用NVFP4的低精度量化格式
50%待验证根据英伟达官方测试,Qwen3 27B在Jetson上的最优解码组合是NVFP4量化叠加投机解码
50%待验证NVFP4与INT4的区别在于它保留了浮点数的动态范围表达能力,对权重分布非均匀的大模型更友好
50%待验证NVFP4通常配合细粒度缩放因子(per-group scaling)和激活感知量化(AWQ/GPTQ)使用以抵消量化误差
50%待验证Primitive在Hugging Face上提供了mixed NVFP4与FP8的Flash Next模型页,配套Docker镜像和模型,推理引擎为vLLM
50%待验证NVFP4本是NVIDIA私有格式,AMD在MI355上支持该格式意味着在硬件层面增加了对该数值格式的原生计算支持
50%待验证NVFP4是一种4位浮点量化格式,用于在保持模型精度的同时降低显存占用和提升推理吞吐
50%待验证单张AMD Radeon R9700运行Qwen3 27B NVFP4量化模型时,经优化后性能在各项指标上翻倍
50%待验证测试基于Unsloth发布的Qwen3 27B NVFP4量化版本进行
50%待验证vLLM面向多卡工作站和企业服务器,运行性能远超LM Studio和Ollama,原生支持NVFP4等数据格式
50%待验证官方跑分显示 Qwen3.6 27B 稠密模型采用 NVFP4 量化时,单并发可达 202 token/s,双并发 400 token/s,8 并发冲到 1147 token/s
50%