IQ3_S
llama.cpp生态中Astra实验室提出的重要性感知量化方案,使用约3比特存储权重,通过按重要性分配不同精度减少量化误差,性能接近BF16原始精度
Timeline (last 90 days)
IQ3_S是一种非均匀3位整数量化方案,相较于标准Q4量化精度损失更大但体积与显存需求更小
IQ3_S相较于更早的IQ3_XXS版本综合表现有明显提升
IQ3_S命名中数字3表示平均每个权重使用约3比特存储,后缀S代表在同等比特数下使用更精细的分组策略
IQ3_S通过对模型权重按重要性分配不同精度,让关键层保留更高精度,在几乎不增加计算复杂度的前提下提升模型输出质量
IQ3_S模型体积比IQ3_XXS大了约7GB,生成速度略慢
作者实测IQ3_S模型运行时占用约50多GB内存,打开生成的HTML并调试时内存占用飙升到62GB
对内存吃紧的设备而言,盲目使用更大的量化模型可能换来频繁的OOM
Strata的本次更新带来了双卡优化,并在官方默认配置中加入了IQ3_S量化模型
IQ3_S的基准表现基本接近BF16原始精度
IQ3_S公布的基准数据中有两项指标存在异常,可能导致平均分偏高
6 more timeline events
All Facts (16)
IQ3_S是一种非均匀3位整数量化方案,相较于标准Q4量化精度损失更大但体积与显存需求更小
50%UnverifiedIQ3_S相较于更早的IQ3_XXS版本综合表现有明显提升
50%UnverifiedIQ3_S属于重要性感知量化(Importance-aware Quantization)系列方案的一种
50%UnverifiedIQ3_S命名中数字3表示平均每个权重使用约3比特存储,后缀S代表在同等比特数下使用更精细的分组策略
50%UnverifiedIQ3_S通过对模型权重按重要性分配不同精度,让关键层保留更高精度,在几乎不增加计算复杂度的前提下提升模型输出质量
50%UnverifiedIQ3_S模型体积比IQ3_XXS大了约7GB,生成速度略慢
50%Unverified作者实测IQ3_S模型运行时占用约50多GB内存,打开生成的HTML并调试时内存占用飙升到62GB
50%Unverified对内存吃紧的设备而言,盲目使用更大的量化模型可能换来频繁的OOM
50%UnverifiedIQ3_S的基准表现基本接近BF16原始精度
50%UnverifiedIQ3_S公布的基准数据中有两项指标存在异常,可能导致平均分偏高
50%UnverifiedIQ3_S和IQ3_XXS同属3-bit量化,但IQ3_S保留了更多关键权重精度,在多语言任务尤其非英语场景中通常表现更稳定,代价是文件略大
50%Unverified在RTX 5080上以IQ3_S量化跑27B模型,短对话生成速度约每秒48 token
50%Unverified文章称IQ3_S档位通常能将准确率保留提升到90%以上、体积约13-15GB,Q4_K_M能保留95%以上准确率、体积约16-18GB
50%UnverifiedIQ2_XXS以约2.06位的平均比特率对权重编码,相比IQ3_S(约3.44位)或Q4_K_M(约4.83位)压缩率更高但信息损失更大
50%UnverifiedIQ2_XXS以约2.06位的平均比特率编码权重,IQ3_S约3.44位,Q4_K_M约4.83位
50%UnverifiedStrata的本次更新带来了双卡优化,并在官方默认配置中加入了IQ3_S量化模型
50%