[KongchangAI]
Concept

GPTQ

2022年提出的训练后量化方法,采用逐层二阶优化将大模型压缩至INT4精度,是大模型量化领域的重要里程碑技术。

Timeline (last 90 days)

Jun 3

7B参数的量化模型在16GB内存的普通电脑上即可流畅对话

Unverified70%
Jun 1

模型量化技术(GGUF、GPTQ、AWQ等格式)使得70B参数的模型可以在32GB内存的消费级电脑上运行

Verified65%
Jun 1

Transformers框架原生支持bitsandbytes、GPTQ、AWQ等主流量化方案

Unverified90%
Jun 1

Transformers库集成了GPTQ、AWQ、bitsandbytes等量化技术和Flash Attention加速方案

Unverified90%
Jun 1

常见的模型量化方法包括GPTQ、AWQ和GGUF等格式

Partially Verified65%
Jun 1

在LLM领域,GPTQ、AWQ、QuIP等方法已证明4-bit量化的可行性,但无法直接迁移到扩散模型的U-Net或DiT架构上

Unverified85%
Jun 1

4-bit量化技术(如GPTQ、AWQ、GGUF格式)可以将模型显存需求降低到原来的1/4,但会带来一定精度损失

Verified65%
Jun 1

量化技术如GPTQ、AWQ可以在有限硬件资源下运行更大参数的大语言模型

Unverified90%
Jun 1

INT4量化理论上可将模型显存占用压缩至FP16的四分之一,常用工具包括GPTQ、AWQ、GGUF等

Verified70%
Jun 1

主流量化方案包括GPTQ、AWQ和GGUF,开发者可根据实际场景灵活选择来部署Qwen3.6-27B

Unverified90%

2 more timeline events

Source Articles