待验证55% 置信事实时间未知
SVDQuant将权重矩阵分解为高精度(16-bit)的低秩分支和4-bit量化的残差分支
1
来源数
55%
置信度
长期有效
时效性
2026/6/1
首次发现
来源
SVDQuant:4-bit量化让扩散模型在消费级GPU上高效运行
githubnunchaku-ai
涉及实体
相关事实
待验证SVD将任意m×n矩阵A分解为U·Σ·V^T,图像压缩通过只保留前k个最大奇异值实现最优低秩逼近(Eckart-Young定理)80% 相似待验证量化技术通过将 32 位或 16 位浮点权重压缩为 4 位或 8 位整数表示,以牺牲少量精度换取内存与速度改善66% 相似待验证相比BF16,FP8能将模型权重和计算数据量减半,理论上可将矩阵乘法内存带宽需求降低50%,并在支持FP8 Tensor Core的GPU上获得2倍以上计算吞吐量提升66% 相似待验证GGUF格式支持4-bit、8-bit等多种精度级别,可将70亿参数模型的内存占用从约14GB(FP16)压缩至约4GB(Q4_K_M量化),推理精度损失通常在1-3%以内65% 相似待验证TensorRT的层融合优化中,以Conv-BN-ReLU组合为例,融合后内存访问量可减少60%以上65% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/28969API
curl https://kongchang.com/api/v1/knowledge/claims/28969MCP
get_claim(id=28969)