AWQ
激活感知权重量化技术,通过分析激活值分布保护关键权重,在相同比特数下实现更低精度损失的模型量化方案
核心事实
时间轴 (近 90 天)
AWQ(Activation-aware Weight Quantization)通过分析激活值分布来保护关键权重
vLLM 线性后端需要处理的输入矩阵可能是 FP16、BF16、INT8 或各种 GPTQ/AWQ 量化格式
RTN、GPTQ、AWQ三种4-bit量化方案压缩率相近,但精度保留能力依次递增
研究测试了RTN、GPTQ、AWQ三种4-bit量化方案,没有任何一个配置因量化而跌出或进入合格区间
NVFP4通常配合细粒度缩放因子(per-group scaling)和激活感知量化(AWQ/GPTQ)使用以抵消量化误差
4-bit量化通常借助GPTQ、AWQ或GGUF等框架实现,通过校正权重分布最小化精度损失
在Red Hat研究中,同group size的GPTQ和AWQ 4-bit方法在HumanEval上分别拿到67和63分
AWQ 和 GPTQ 是目前 Serverless 部署场景下最常用的两种量化格式,vLLM、TGI 等主流推理框架均已原生支持
在企业和服务端场景,经过校准的INT4(W4A16)格式如AWQ、GPTQ和AutoRound通过vLLM或SGLang部署到独立加速器时是行业标准
INT4量化方案包括GPTQ、AWQ,适合对成本极度敏感、可容忍轻微质量下降的场景
还有 40 条时间轴事件
全部知识事实 (20)
常见的模型量化方法包括GPTQ、AWQ和GGUF等格式
90%已验证AWQ(2023)发现权重中约1%的显著通道对模型输出影响最大,通过等价缩放保护这些通道
85%已验证GGUF是由llama.cpp项目引入的模型格式标准,支持Q2_K至Q8_0等多种量化级别
80%已验证4-bit量化将每个参数压缩至0.5字节,理论上将140GB压缩至约35-40GB
80%已验证4-bit量化在损失约1-3%准确率的前提下,将模型体积缩减至原来的1/8
80%已验证GPTQ、AWQ等4-bit极端量化方案使70B参数大模型得以在消费级GPU上运行
80%已验证AWQ的核心洞察是只有约1%的显著权重对模型输出影响巨大,对其保护性处理可在极低比特宽度下维持模型质量
75%已验证INT4量化理论上可将模型显存占用压缩至FP16的四分之一,常用工具包括GPTQ、AWQ、GGUF等
75%已验证AWQ 识别并保护对激活值影响最大的权重,在相同压缩率下通常比 GPTQ 取得更优的精度表现
70%已验证AWQ(Activation-aware Weight Quantization)技术通过观察模型推理时的激活值,找出关键权重通道做特殊保护,其余权重压缩到4bit精度
70%已验证常见量化方案包括 GPTQ(需要 GPU)、AWQ 以及 llama.cpp 生态中的 GGUF 格式量化
65%已验证现代量化方案如GPTQ、AWQ引入逐层校准和误差补偿机制,将困惑度损失控制在1–2%以内
65%已验证叠加K-quant、GPTQ、AWQ等技巧可将量化平稳延伸到4-bit,但推进到2-bit或1-bit时性能会灾难性崩塌
65%已验证Ollama默认使用GGUF格式,常见量化格式还包括GPTQ
65%已验证现代量化方案如GPTQ、AWQ及GGUF格式的分组量化,通过逐层校准和异常值保护,可将模型体积缩减75%以上同时保留绝大部分推理能力
65%已验证GPTQ、AWQ等后训练量化算法可将模型压缩至4位INT4,使70B参数模型可在消费级显卡运行,计算量降低75%以上
65%已验证量化技术可将模型体积压缩50%-75%,在损失极小精度前提下降低显存占用
65%已验证社区主流量化格式包括GGUF、AWQ和GPTQ,其中GGUF由llama.cpp项目推广并支持CPU推理
65%已验证GPTQ 利用二阶梯度信息最小化量化误差,AWQ 识别并保护对激活值影响最大的权重,GGUF 由 llama.cpp 项目引入专为 CPU 推理优化
65%已验证模型量化技术(GGUF、GPTQ、AWQ等格式)使得70B参数的模型可以在32GB内存的消费级电脑上运行
65%