[KongchangAI]
ConceptActivation-aware Weight Quantization

AWQ

激活感知权重量化技术,通过分析激活值分布保护关键权重,在相同比特数下实现更低精度损失的模型量化方案

Core Facts

Timeline (last 90 days)

Sep 12

AWQ 和 GPTQ 是目前 Serverless 部署场景下最常用的两种量化格式,vLLM、TGI 等主流推理框架均已原生支持

Unverified50%
Sep 11

在企业和服务端场景,经过校准的INT4(W4A16)格式如AWQ、GPTQ和AutoRound通过vLLM或SGLang部署到独立加速器时是行业标准

Unverified50%
Sep 11

INT4量化方案包括GPTQ、AWQ,适合对成本极度敏感、可容忍轻微质量下降的场景

Unverified50%
Sep 10

主流量化方案在4位量化精度下通常只造成1-3%的性能损失,但2位量化时性能退化显著加剧

Unverified50%
Sep 10

AWQ由MIT韩松团队提出,通过保护重要权重通道并对其他通道进行更激进的压缩来保持精度

Unverified50%
Sep 9

现代量化技术如GPTQ、AWQ能在保持95%以上性能的同时实现显著压缩

Unverified50%
Sep 8

量化技术(如GGUF、GPTQ、AWQ)使得70B参数的模型可以在消费级GPU上运行

Unverified50%
Sep 8

GPTQ和AWQ是两种主流量化算法,通过校准数据集最小化量化误差

Unverified50%
Sep 6

GGUF由llama.cpp项目推动,专门优化了CPU推理场景;AWQ通过识别重要通道进行非均匀量化

Unverified50%
Sep 6

GPTQ 和 AWQ 都属于训练后量化(Post-Training Quantization),无需重新训练模型,只需少量校准数据

Unverified50%

35 more timeline events

All Facts (20)

Verified

GPTQ和AWQ量化格式主要用于GPU推理

80%
Verified

AWQ(2023)发现权重中约1%的显著通道对模型输出影响最大,通过等价缩放保护这些通道

75%
Verified

AWQ 识别并保护对激活值影响最大的权重,在相同压缩率下通常比 GPTQ 取得更优的精度表现

70%
Verified

AWQ(Activation-aware Weight Quantization)技术通过观察模型推理时的激活值,找出关键权重通道做特殊保护,其余权重压缩到4bit精度

70%
Verified

常见的模型量化方法包括GPTQ、AWQ和GGUF等格式

70%
Verified

现代量化方案如GPTQ、AWQ引入逐层校准和误差补偿机制,将困惑度损失控制在1–2%以内

65%
Verified

叠加K-quant、GPTQ、AWQ等技巧可将量化平稳延伸到4-bit,但推进到2-bit或1-bit时性能会灾难性崩塌

65%
Verified

4-bit量化在损失约1-3%准确率的前提下,将模型体积缩减至原来的1/8

65%
Verified

GPTQ、AWQ等后训练量化算法可将模型压缩至4位INT4,使70B参数模型可在消费级显卡运行,计算量降低75%以上

65%
Verified

量化技术可将模型体积压缩50%-75%,在损失极小精度前提下降低显存占用

65%
Verified

4-bit量化将每个参数压缩至0.5字节,理论上将140GB压缩至约35-40GB

65%
Verified

社区主流量化格式包括GGUF、AWQ和GPTQ,其中GGUF由llama.cpp项目推广并支持CPU推理

65%
Verified

GPTQ 利用二阶梯度信息最小化量化误差,AWQ 识别并保护对激活值影响最大的权重,GGUF 由 llama.cpp 项目引入专为 CPU 推理优化

65%
Verified

4-bit量化技术(如GPTQ、AWQ、GGUF格式)可以将模型显存需求降低到原来的1/4,但会带来一定精度损失

65%
Verified

8GB显存建议运行7B模型(Q4量化),16GB显存建议运行7B到14B模型,24GB显存建议运行14B到32B模型,32GB显存建议运行32B到70B模型(Q4量化)

65%
Unverified

4-bit量化模型的输出质量通常能达到原始模型的95%以上

70%
Unverified

AWQ的核心洞察是只有约1%的显著权重对模型输出影响巨大,对其保护性处理可在极低比特宽度下维持模型质量

60%
Unverified

量化感知训练(QAT)在训练过程中模拟量化误差反向传播,效果通常优于训练后量化(PTQ)

60%
Unverified

AWQ 和 GPTQ 是目前 Serverless 部署场景下最常用的两种量化格式,vLLM、TGI 等主流推理框架均已原生支持

50%
Unverified

在企业和服务端场景,经过校准的INT4(W4A16)格式如AWQ、GPTQ和AutoRound通过vLLM或SGLang部署到独立加速器时是行业标准

50%

Source Articles