[控场AI]
概念

NVFP4

NVFP4是NVIDIA针对Blackwell架构推出的一种4位浮点(FP4)数值量化格式,属于低精度数值表示标准。该格式专为深度学习推理和训练场景设计,通过降低数值位宽来减少内存占用和计算开销,同时相较于传统整数量化格式在数值表达范围和精度损失控制上具有一定优势,主要用于大规模神经网络模型的高效部署与加速计算。

核心事实

时间轴 (近 90 天)

10月4日

Cosmos提供40亿到640亿参数三种规格,全多模态、可商用、可定制,其Super NanoEdge版本针对NVFP4和推测解码做了优化

待验证50%
9月29日

该竞赛编程模型基于Nemotron-3-Ultra-550B-A55B微调而来,并采用NVFP4的低精度量化格式

待验证50%
9月29日

根据英伟达官方测试,Qwen3 27B在Jetson上的最优解码组合是NVFP4量化叠加投机解码

待验证50%
9月29日

NVFP4通常配合细粒度缩放因子(per-group scaling)和激活感知量化(AWQ/GPTQ)使用以抵消量化误差

待验证50%
9月29日

NVFP4与INT4的区别在于它保留了浮点数的动态范围表达能力,对权重分布非均匀的大模型更友好

待验证50%
9月28日

Primitive在Hugging Face上提供了mixed NVFP4与FP8的Flash Next模型页,配套Docker镜像和模型,推理引擎为vLLM

待验证50%
9月23日

NVFP4是一种4位浮点量化格式,用于在保持模型精度的同时降低显存占用和提升推理吞吐

待验证50%
9月23日

NVFP4本是NVIDIA私有格式,AMD在MI355上支持该格式意味着在硬件层面增加了对该数值格式的原生计算支持

待验证50%
9月23日

vLLM发布了v0.30.1rc0预发布版本,为AMD MI355加速卡引入dense NVFP4内核与MoRI内核镜像支持(PR #58281)

待验证50%
9月17日

单张AMD Radeon R9700运行Qwen3 27B NVFP4量化模型时,经优化后性能在各项指标上翻倍

待验证50%

还有 22 条时间轴事件

全部知识事实 (20)

已验证

NVFP4是NVIDIA推出的4位浮点(FP4)量化格式,专为Blackwell架构GPU的硬件加速能力设计

90%
已验证

NVIDIA 在 Blackwell 架构(SM 100/103,如 B100、B200 系列)中为 NVFP4 设计了专用 Tensor Core 指令 mma.kind::mxf4,并采用每 16 个元素为一组的 FP8 缩放因子机制

75%
已验证

在RTX 5070(12GB显存)配置下,本地Qwen3 9B模型的输出速度达到约70-76 token/秒

70%
已验证

NVFP4是NVIDIA推出的4位浮点格式(FP4),采用浮点表示(包含符号位、指数位和尾数位)以非均匀方式覆盖数值空间

65%
已验证

Unsloth团队发布了基于Dynamic v3量化方案的全新Qwen3.8-27B GGUF模型,在保持相同模型体积的前提下实现额外10%的top-1%精度提升

85%
待验证

NVFP4量化需要50系列NVIDIA显卡才能使用

85%
待验证

在非50系显卡上使用NVFP4会退化为软件模拟,导致显存占用大、精度差,无任何优势

85%
待验证

NVFP4量化在Blackwell架构上相比FP16吞吐量提升约40-50%

80%
待验证

Cosmos提供40亿到640亿参数三种规格,全多模态、可商用、可定制,其Super NanoEdge版本针对NVFP4和推测解码做了优化

50%
待验证

该竞赛编程模型基于Nemotron-3-Ultra-550B-A55B微调而来,并采用NVFP4的低精度量化格式

50%
待验证

根据英伟达官方测试,Qwen3 27B在Jetson上的最优解码组合是NVFP4量化叠加投机解码

50%
待验证

NVFP4与INT4的区别在于它保留了浮点数的动态范围表达能力,对权重分布非均匀的大模型更友好

50%
待验证

NVFP4通常配合细粒度缩放因子(per-group scaling)和激活感知量化(AWQ/GPTQ)使用以抵消量化误差

50%
待验证

Primitive在Hugging Face上提供了mixed NVFP4与FP8的Flash Next模型页,配套Docker镜像和模型,推理引擎为vLLM

50%
待验证

NVFP4本是NVIDIA私有格式,AMD在MI355上支持该格式意味着在硬件层面增加了对该数值格式的原生计算支持

50%
待验证

NVFP4是一种4位浮点量化格式,用于在保持模型精度的同时降低显存占用和提升推理吞吐

50%
待验证

单张AMD Radeon R9700运行Qwen3 27B NVFP4量化模型时,经优化后性能在各项指标上翻倍

50%
待验证

测试基于Unsloth发布的Qwen3 27B NVFP4量化版本进行

50%
待验证

vLLM面向多卡工作站和企业服务器,运行性能远超LM Studio和Ollama,原生支持NVFP4等数据格式

50%
待验证

官方跑分显示 Qwen3.6 27B 稠密模型采用 NVFP4 量化时,单并发可达 202 token/s,双并发 400 token/s,8 并发冲到 1147 token/s

50%

来源文章