[KongchangAI]
ConceptIQ3_S量化 / 重要性感知量化

IQ3_S

llama.cpp生态中Astra实验室提出的重要性感知量化方案,使用约3比特存储权重,通过按重要性分配不同精度减少量化误差,性能接近BF16原始精度

Timeline (last 90 days)

Oct 5

IQ3_S是一种非均匀3位整数量化方案,相较于标准Q4量化精度损失更大但体积与显存需求更小

Unverified50%
Oct 5

IQ3_S相较于更早的IQ3_XXS版本综合表现有明显提升

Unverified50%
Oct 5

IQ3_S命名中数字3表示平均每个权重使用约3比特存储,后缀S代表在同等比特数下使用更精细的分组策略

Unverified50%
Oct 5

IQ3_S通过对模型权重按重要性分配不同精度,让关键层保留更高精度,在几乎不增加计算复杂度的前提下提升模型输出质量

Unverified50%
Oct 5

IQ3_S模型体积比IQ3_XXS大了约7GB,生成速度略慢

Unverified50%
Oct 5

作者实测IQ3_S模型运行时占用约50多GB内存,打开生成的HTML并调试时内存占用飙升到62GB

Unverified50%
Oct 5

对内存吃紧的设备而言,盲目使用更大的量化模型可能换来频繁的OOM

Unverified50%
Oct 5

Strata的本次更新带来了双卡优化,并在官方默认配置中加入了IQ3_S量化模型

Unverified50%
Oct 5

IQ3_S的基准表现基本接近BF16原始精度

Unverified50%
Oct 5

IQ3_S公布的基准数据中有两项指标存在异常,可能导致平均分偏高

Unverified50%

6 more timeline events

All Facts (16)

Unverified

IQ3_S是一种非均匀3位整数量化方案,相较于标准Q4量化精度损失更大但体积与显存需求更小

50%
Unverified

IQ3_S相较于更早的IQ3_XXS版本综合表现有明显提升

50%
Unverified

IQ3_S属于重要性感知量化(Importance-aware Quantization)系列方案的一种

50%
Unverified

IQ3_S命名中数字3表示平均每个权重使用约3比特存储,后缀S代表在同等比特数下使用更精细的分组策略

50%
Unverified

IQ3_S通过对模型权重按重要性分配不同精度,让关键层保留更高精度,在几乎不增加计算复杂度的前提下提升模型输出质量

50%
Unverified

IQ3_S模型体积比IQ3_XXS大了约7GB,生成速度略慢

50%
Unverified

作者实测IQ3_S模型运行时占用约50多GB内存,打开生成的HTML并调试时内存占用飙升到62GB

50%
Unverified

对内存吃紧的设备而言,盲目使用更大的量化模型可能换来频繁的OOM

50%
Unverified

IQ3_S的基准表现基本接近BF16原始精度

50%
Unverified

IQ3_S公布的基准数据中有两项指标存在异常,可能导致平均分偏高

50%
Unverified

IQ3_S和IQ3_XXS同属3-bit量化,但IQ3_S保留了更多关键权重精度,在多语言任务尤其非英语场景中通常表现更稳定,代价是文件略大

50%
Unverified

在RTX 5080上以IQ3_S量化跑27B模型,短对话生成速度约每秒48 token

50%
Unverified

文章称IQ3_S档位通常能将准确率保留提升到90%以上、体积约13-15GB,Q4_K_M能保留95%以上准确率、体积约16-18GB

50%
Unverified

IQ2_XXS以约2.06位的平均比特率对权重编码,相比IQ3_S(约3.44位)或Q4_K_M(约4.83位)压缩率更高但信息损失更大

50%
Unverified

IQ2_XXS以约2.06位的平均比特率编码权重,IQ3_S约3.44位,Q4_K_M约4.83位

50%
Unverified

Strata的本次更新带来了双卡优化,并在官方默认配置中加入了IQ3_S量化模型

50%

Source Articles