待验证50% 置信事实精确时间
三值化权重每个权重仅携带约1.58 bits信息量(log₂3≈1.585),相比FP32的32 bits信息密度下降约20倍
1
来源数
50%
置信度
长期有效
时效性
2026/7/17
首次发现
来源
相关事实
待验证140GB的FP16 70B模型经4-bit量化后可压缩至约35-40GB,通信开销降低约75%;2-bit量化可压缩至约18GB但带来精度损失74% 相似待验证以Q4_0格式为例,每32个FP32权重被打包为一个量化块,包含一个缩放因子和32个4bit整数,平均每参数约占4.5bit,内存占用缩减至原来的约1/872% 相似待验证即便用 4-bit 量化把权重压缩到 214GB,仍远超单张 48GB 显卡的容量71% 相似待验证Bonsai三元版为1.71 bits约6GB,保留基座模型约97%质量;1-bit版为3.9GB,保留约90%质量69% 相似待验证从存储角度推算:27B参数×2字节(FP16)约54GB,INT8约27GB,INT4约13.5GB,2-bit约6.75GB,1.5-bit逼近5GB;4GB以内意味着平均比特宽度需低于1.5-bit69% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/538892API
curl https://kongchang.com/api/v1/knowledge/claims/538892MCP
get_claim(id=538892)