[控场AI]
模型BitNet b1.58 / 1.58-bit LLM

BitNet

微软研究院提出的1-bit/1.58-bit大语言模型架构,使用三值权重(-1、0、+1),将矩阵乘法替换为整数加减法,大幅降低推理计算与内存需求,适合移动端ARM架构部署。

核心事实

时间轴 (近 90 天)

10月4日

Prism ML在转换为三值前应用旋转矩阵(正交变换)平滑分散权重异常值,使共享scale更合理,这一思路来源于BitNet、QuIP#等研究

待验证50%
10月3日

三值量化将权重取-1、0、+1三个值,可用加减法替代乘法运算以降低硬件计算压力,与微软的BitNet系列研究方向相关

待验证50%
9月29日

有开发者项目使用ESP32S3微控制器组成集群运行1.58位(BitNet)量化的语言模型

待验证50%
9月29日

该项目更像是一次概念验证,展示极端量化技术与分布式计算结合所能触达的硬件下限

待验证50%
9月29日

当权重只有-1、0、+1时,矩阵乘法中的浮点乘法可以退化为加法和减法或跳过零权重

待验证50%
9月29日

相比16位浮点,三值量化理论上可以节省约十倍的存储空间

待验证50%
9月15日

SHADOW-50M使用三元权重,所有参数被约束为{-1, 0, +1}三种取值,理论上每个参数只需1.58 bit

待验证50%
9月12日

真正可用的 1-bit 级别大模型将是一类全新训练(引入量化感知训练QAT)的模型,而非对现有模型的事后压缩

待验证50%
9月12日

BitNet 系列等二值化神经网络工作的前提通常是从训练阶段就采用低比特感知训练,而非对已训练好的全精度模型做事后压缩(PTQ)

已验证65%
8月24日

实践中所谓的1-bit GGUF通常采用混合方案:embedding层和lm_head等关键组件保留较高精度,中间transformer层使用极低比特,整体平均比特率可能在1.5-2.0 bit/参数之间

待验证50%

还有 3 条时间轴事件

全部知识事实 (13)

已验证

BitNet 系列等二值化神经网络工作的前提通常是从训练阶段就采用低比特感知训练,而非对已训练好的全精度模型做事后压缩(PTQ)

65%
待验证

Prism ML在转换为三值前应用旋转矩阵(正交变换)平滑分散权重异常值,使共享scale更合理,这一思路来源于BitNet、QuIP#等研究

50%
待验证

三值量化将权重取-1、0、+1三个值,可用加减法替代乘法运算以降低硬件计算压力,与微软的BitNet系列研究方向相关

50%
待验证

相比16位浮点,三值量化理论上可以节省约十倍的存储空间

50%
待验证

该项目更像是一次概念验证,展示极端量化技术与分布式计算结合所能触达的硬件下限

50%
待验证

当权重只有-1、0、+1时,矩阵乘法中的浮点乘法可以退化为加法和减法或跳过零权重

50%
待验证

SHADOW-50M使用三元权重,所有参数被约束为{-1, 0, +1}三种取值,理论上每个参数只需1.58 bit

50%
待验证

实践中所谓的1-bit GGUF通常采用混合方案:embedding层和lm_head等关键组件保留较高精度,中间transformer层使用极低比特,整体平均比特率可能在1.5-2.0 bit/参数之间

50%
待验证

1-bit量化研究可追溯至微软研究院2024年发布的BitNet论文,提出用三值权重(-1, 0, 1)替代全精度浮点数,BitNet b1.58进一步证明1.58-bit在从头训练场景下的可行性

50%
待验证

BitNet是微软研究院于2023年提出的架构级创新,核心思想是在Transformer架构中将线性层权重替换为1-bit表示

50%
待验证

BitNet b1.58采用三值量化,每个权重取-1、0或+1三个值,约1.58 bit(log₂3)

50%
待验证

有开发者项目使用ESP32S3微控制器组成集群运行1.58位(BitNet)量化的语言模型

50%
待验证

真正可用的 1-bit 级别大模型将是一类全新训练(引入量化感知训练QAT)的模型,而非对现有模型的事后压缩

50%

来源文章