已验证65% 置信事实精确时间
MXFP4通过在小块数据(通常为32个元素)内共享一个缩放因子的方式,在4-bit低精度下缓解数值溢出和精度退化问题,相比FP16理论上可减少约4倍显存占用和带宽需求
3
来源数
65%
置信度
长期有效
时效性
2026/7/17
首次发现
来源
相关事实
待验证MXFP4格式将一组元素(通常32个)共享一个8-bit缩放因子,每个元素用4-bit微型浮点数表示(1位符号+2位指数+1位尾数)79% 相似已验证量化技术通过将模型权重从FP32/FP16压缩为INT8/INT4等低精度格式,可将模型体积缩减50%-75%71% 相似已验证量化技术将FP32(32位)权重降至INT4(4位),理论压缩比达8倍,但会引入精度损失70% 相似待验证以Q4_0格式为例,每32个FP32权重被打包为一个量化块,包含一个缩放因子和32个4bit整数,平均每参数约占4.5bit,内存占用缩减至原来的约1/870% 相似待验证70B模型在INT4精度下可压缩至约35GB67% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/544941API
curl https://kongchang.com/api/v1/knowledge/claims/544941MCP
get_claim(id=544941)