AWQ
激活感知权重量化技术,通过分析激活值分布保护关键权重,在相同比特数下实现更低精度损失的模型量化方案
Core Facts
Timeline (last 90 days)
AWQ 和 GPTQ 是目前 Serverless 部署场景下最常用的两种量化格式,vLLM、TGI 等主流推理框架均已原生支持
在企业和服务端场景,经过校准的INT4(W4A16)格式如AWQ、GPTQ和AutoRound通过vLLM或SGLang部署到独立加速器时是行业标准
INT4量化方案包括GPTQ、AWQ,适合对成本极度敏感、可容忍轻微质量下降的场景
主流量化方案在4位量化精度下通常只造成1-3%的性能损失,但2位量化时性能退化显著加剧
AWQ由MIT韩松团队提出,通过保护重要权重通道并对其他通道进行更激进的压缩来保持精度
现代量化技术如GPTQ、AWQ能在保持95%以上性能的同时实现显著压缩
量化技术(如GGUF、GPTQ、AWQ)使得70B参数的模型可以在消费级GPU上运行
GPTQ和AWQ是两种主流量化算法,通过校准数据集最小化量化误差
GGUF由llama.cpp项目推动,专门优化了CPU推理场景;AWQ通过识别重要通道进行非均匀量化
GPTQ 和 AWQ 都属于训练后量化(Post-Training Quantization),无需重新训练模型,只需少量校准数据
35 more timeline events
All Facts (20)
GPTQ和AWQ量化格式主要用于GPU推理
80%VerifiedAWQ(2023)发现权重中约1%的显著通道对模型输出影响最大,通过等价缩放保护这些通道
75%VerifiedAWQ 识别并保护对激活值影响最大的权重,在相同压缩率下通常比 GPTQ 取得更优的精度表现
70%VerifiedAWQ(Activation-aware Weight Quantization)技术通过观察模型推理时的激活值,找出关键权重通道做特殊保护,其余权重压缩到4bit精度
70%Verified常见的模型量化方法包括GPTQ、AWQ和GGUF等格式
70%Verified现代量化方案如GPTQ、AWQ引入逐层校准和误差补偿机制,将困惑度损失控制在1–2%以内
65%Verified叠加K-quant、GPTQ、AWQ等技巧可将量化平稳延伸到4-bit,但推进到2-bit或1-bit时性能会灾难性崩塌
65%Verified4-bit量化在损失约1-3%准确率的前提下,将模型体积缩减至原来的1/8
65%VerifiedGPTQ、AWQ等后训练量化算法可将模型压缩至4位INT4,使70B参数模型可在消费级显卡运行,计算量降低75%以上
65%Verified量化技术可将模型体积压缩50%-75%,在损失极小精度前提下降低显存占用
65%Verified4-bit量化将每个参数压缩至0.5字节,理论上将140GB压缩至约35-40GB
65%Verified社区主流量化格式包括GGUF、AWQ和GPTQ,其中GGUF由llama.cpp项目推广并支持CPU推理
65%VerifiedGPTQ 利用二阶梯度信息最小化量化误差,AWQ 识别并保护对激活值影响最大的权重,GGUF 由 llama.cpp 项目引入专为 CPU 推理优化
65%Verified4-bit量化技术(如GPTQ、AWQ、GGUF格式)可以将模型显存需求降低到原来的1/4,但会带来一定精度损失
65%Verified8GB显存建议运行7B模型(Q4量化),16GB显存建议运行7B到14B模型,24GB显存建议运行14B到32B模型,32GB显存建议运行32B到70B模型(Q4量化)
65%Unverified4-bit量化模型的输出质量通常能达到原始模型的95%以上
70%UnverifiedAWQ的核心洞察是只有约1%的显著权重对模型输出影响巨大,对其保护性处理可在极低比特宽度下维持模型质量
60%Unverified量化感知训练(QAT)在训练过程中模拟量化误差反向传播,效果通常优于训练后量化(PTQ)
60%UnverifiedAWQ 和 GPTQ 是目前 Serverless 部署场景下最常用的两种量化格式,vLLM、TGI 等主流推理框架均已原生支持
50%Unverified在企业和服务端场景,经过校准的INT4(W4A16)格式如AWQ、GPTQ和AutoRound通过vLLM或SGLang部署到独立加速器时是行业标准
50%