Unverified50% confidenceFactExact time
三值化权重每个权重仅携带约1.58 bits信息量(log₂3≈1.585),相比FP32的32 bits信息密度下降约20倍
1
Sources
50%
Confidence
Long-term
Relevance
7/17/2026
First Seen
Sources
Related Claims
Unverified140GB的FP16 70B模型经4-bit量化后可压缩至约35-40GB,通信开销降低约75%;2-bit量化可压缩至约18GB但带来精度损失74% similarUnverified以Q4_0格式为例,每32个FP32权重被打包为一个量化块,包含一个缩放因子和32个4bit整数,平均每参数约占4.5bit,内存占用缩减至原来的约1/872% similarUnverified即便用 4-bit 量化把权重压缩到 214GB,仍远超单张 48GB 显卡的容量71% similarUnverifiedBonsai三元版为1.71 bits约6GB,保留基座模型约97%质量;1-bit版为3.9GB,保留约90%质量69% similarUnverified从存储角度推算:27B参数×2字节(FP16)约54GB,INT8约27GB,INT4约13.5GB,2-bit约6.75GB,1.5-bit逼近5GB;4GB以内意味着平均比特宽度需低于1.5-bit69% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/538892API
curl https://kongchang.com/api/v1/knowledge/claims/538892MCP
get_claim(id=538892)