Unverified55% confidenceFactTime unknown
SVDQuant将权重矩阵分解为高精度(16-bit)的低秩分支和4-bit量化的残差分支
1
Sources
55%
Confidence
Long-term
Relevance
6/1/2026
First Seen
Sources
SVDQuant:4-bit量化让扩散模型在消费级GPU上高效运行
githubnunchaku-ai
Related Entities
Related Claims
UnverifiedSVD将任意m×n矩阵A分解为U·Σ·V^T,图像压缩通过只保留前k个最大奇异值实现最优低秩逼近(Eckart-Young定理)80% similarUnverified量化技术通过将 32 位或 16 位浮点权重压缩为 4 位或 8 位整数表示,以牺牲少量精度换取内存与速度改善66% similarUnverified相比BF16,FP8能将模型权重和计算数据量减半,理论上可将矩阵乘法内存带宽需求降低50%,并在支持FP8 Tensor Core的GPU上获得2倍以上计算吞吐量提升66% similarUnverifiedGGUF格式支持4-bit、8-bit等多种精度级别,可将70亿参数模型的内存占用从约14GB(FP16)压缩至约4GB(Q4_K_M量化),推理精度损失通常在1-3%以内65% similarUnverifiedTensorRT的层融合优化中,以Conv-BN-ReLU组合为例,融合后内存访问量可减少60%以上65% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/28969API
curl https://kongchang.com/api/v1/knowledge/claims/28969MCP
get_claim(id=28969)