模型量化
将神经网络权重从高精度浮点数转换为低精度表示的技术,可显著降低模型内存占用和加速推理
核心事实
时间轴 (近 90 天)
传统模型量化以降低权重数值精度为路径,经历了从FP16到INT8再到4比特、2比特乃至1比特的演进
量化级别的选择本质上是在显存预算与输出质量之间做取舍,没有统一的最优解
更大的基座模型即便经过较激进的量化,整体能力仍优于参数量更小模型的轻度量化
本地LLM运行的技术基础是模型量化(Quantization)
厂商可以在不改变API端点名称的情况下对模型进行量化压缩(将权重从16位浮点降至8位甚至4位整数以节省显存)、以蒸馏模型替换部分请求或调整安全过滤阈值,这些变动对调用方不可见
随着算力成本下降和模型量化、投机解码等推理加速技术普及,同等质量的生成速度有望在未来一两年内显著压缩
模型量化、推测解码、连续批处理是用于降低推理延迟的软件技术
建议先从Q4量化版本开始体验,再根据实际效果决定是否切换更高精度版本
接受率越高意味着草稿模型猜测越准,大模型返工次数越少,直接决定投机解码的实际加速效果
端侧AI能力的实现前提是模型压缩与量化技术的成熟,使得原本需要GPU集群运行的大模型可以被精简到在移动芯片上流畅运行
还有 12 条时间轴事件
全部知识事实 (20)
量化技术通过将 32 位或 16 位浮点权重压缩为 4 位或 8 位整数表示,以牺牲少量精度换取内存与速度改善
90%已验证推理优化技术包括量化(Quantization)、批处理(Batching)、KV缓存(Key-Value Cache)和推测解码(Speculative Decoding)
90%已验证一个70B参数的FP16模型大约需要140GB显存,INT8量化后约需70GB,INT4量化后约需35-40GB
90%已验证量化技术通过将模型权重从FP32/FP16压缩为INT8/INT4等低精度格式,可将模型体积缩减50%-75%
90%已验证模型蒸馏是将大模型的能力压缩到小模型中以降低推理成本的技术
80%已验证模型量化技术(如GGUF格式的4-bit/8-bit量化)使得原本需要数十GB显存的大模型可以在消费级GPU甚至CPU上运行
80%已验证4-bit量化在损失约1-3%准确率的前提下,将模型体积缩减至原来的1/8
80%已验证模型量化通过用更低精度数值表示替代高精度参数,理论上可将模型体积和计算量缩减2-4倍
75%已验证对于7B参数模型的4-bit量化版本,通常需要至少8GB内存和现代多核CPU即可流畅运行,推理速度约为每秒10-30个token
75%已验证量化技术可将模型体积压缩50%-75%,在损失极小精度前提下降低显存占用
65%已验证模型量化是将神经网络权重从高精度浮点数压缩为低精度整数的技术
65%已验证INT4 量化模型有望在 8GB 乃至更低显存的显卡上完成原本需要 16GB 或 24GB 显存的模型推理
70%待验证推测解码、模型蒸馏、KV Cache优化等推理优化技术的持续进步正在使单位推理成本快速下降
85%部分验证接受率越高意味着草稿模型猜测越准,大模型返工次数越少,直接决定投机解码的实际加速效果
80%待验证量化模型的困惑度可能仅上升0.1-0.5,但在特定下游任务(如代码生成、数学推理)上的表现可能出现显著退化
75%待验证速度提升与价格下降同时发生通常指向底层推理架构优化,可能路径包括模型蒸馏、量化、推测解码和流式处理架构
70%待验证业界降低LLM推理成本的主要优化路径包括模型量化、推测解码(Speculative Decoding)和语义缓存机制
60%待验证量化感知训练(QAT)让模型保留全精度权重副本,每次前向传播练习舍入操作,学会在极端压缩下的权重分布
60%待验证相比标准INT8量化,三值量化可将模型体积进一步缩小约4倍,并将矩阵乘法退化为纯加减运算
60%待验证4-bit量化模型的输出质量通常能达到原始模型的95%以上
60%