BitNet
微软研究院提出的1-bit/1.58-bit大语言模型架构,使用三值权重(-1、0、+1),将矩阵乘法替换为整数加减法,大幅降低推理计算与内存需求,适合移动端ARM架构部署。
核心事实
时间轴 (近 90 天)
Prism ML在转换为三值前应用旋转矩阵(正交变换)平滑分散权重异常值,使共享scale更合理,这一思路来源于BitNet、QuIP#等研究
三值量化将权重取-1、0、+1三个值,可用加减法替代乘法运算以降低硬件计算压力,与微软的BitNet系列研究方向相关
有开发者项目使用ESP32S3微控制器组成集群运行1.58位(BitNet)量化的语言模型
该项目更像是一次概念验证,展示极端量化技术与分布式计算结合所能触达的硬件下限
当权重只有-1、0、+1时,矩阵乘法中的浮点乘法可以退化为加法和减法或跳过零权重
相比16位浮点,三值量化理论上可以节省约十倍的存储空间
SHADOW-50M使用三元权重,所有参数被约束为{-1, 0, +1}三种取值,理论上每个参数只需1.58 bit
真正可用的 1-bit 级别大模型将是一类全新训练(引入量化感知训练QAT)的模型,而非对现有模型的事后压缩
BitNet 系列等二值化神经网络工作的前提通常是从训练阶段就采用低比特感知训练,而非对已训练好的全精度模型做事后压缩(PTQ)
实践中所谓的1-bit GGUF通常采用混合方案:embedding层和lm_head等关键组件保留较高精度,中间transformer层使用极低比特,整体平均比特率可能在1.5-2.0 bit/参数之间
还有 3 条时间轴事件
全部知识事实 (13)
BitNet 系列等二值化神经网络工作的前提通常是从训练阶段就采用低比特感知训练,而非对已训练好的全精度模型做事后压缩(PTQ)
65%待验证Prism ML在转换为三值前应用旋转矩阵(正交变换)平滑分散权重异常值,使共享scale更合理,这一思路来源于BitNet、QuIP#等研究
50%待验证三值量化将权重取-1、0、+1三个值,可用加减法替代乘法运算以降低硬件计算压力,与微软的BitNet系列研究方向相关
50%待验证相比16位浮点,三值量化理论上可以节省约十倍的存储空间
50%待验证该项目更像是一次概念验证,展示极端量化技术与分布式计算结合所能触达的硬件下限
50%待验证当权重只有-1、0、+1时,矩阵乘法中的浮点乘法可以退化为加法和减法或跳过零权重
50%待验证SHADOW-50M使用三元权重,所有参数被约束为{-1, 0, +1}三种取值,理论上每个参数只需1.58 bit
50%待验证实践中所谓的1-bit GGUF通常采用混合方案:embedding层和lm_head等关键组件保留较高精度,中间transformer层使用极低比特,整体平均比特率可能在1.5-2.0 bit/参数之间
50%待验证1-bit量化研究可追溯至微软研究院2024年发布的BitNet论文,提出用三值权重(-1, 0, 1)替代全精度浮点数,BitNet b1.58进一步证明1.58-bit在从头训练场景下的可行性
50%待验证BitNet是微软研究院于2023年提出的架构级创新,核心思想是在Transformer架构中将线性层权重替换为1-bit表示
50%待验证BitNet b1.58采用三值量化,每个权重取-1、0或+1三个值,约1.58 bit(log₂3)
50%待验证有开发者项目使用ESP32S3微控制器组成集群运行1.58位(BitNet)量化的语言模型
50%待验证真正可用的 1-bit 级别大模型将是一类全新训练(引入量化感知训练QAT)的模型,而非对现有模型的事后压缩
50%