待验证50% 置信事实精确时间
Q3_K_M将每个权重压缩至约3bit,27B模型权重体积可降至约12~13GB
1
来源数
50%
置信度
长期有效
时效性
2026/7/11
首次发现
来源
4090跑Qwen3 27B为何这么慢?本地推理性能优化实战
redditr/ollama2026/7/10
相关事实
待验证原版QW3.6 27B模型文件体积约为54GB,Prismo通过数学压缩技术压缩至不到4GB,压缩比超过13倍,且声称不影响模型性能82% 相似待验证M3原始权重存储下限:BF16约854GB,8-bit约428GB,4-bit约214GB76% 相似已验证8GB显存建议运行7B模型(Q4量化),16GB显存建议运行7B到14B模型,24GB显存建议运行14B到32B模型,32GB显存建议运行32B到70B模型(Q4量化)76% 相似待验证140GB的FP16 70B模型经4-bit量化后可压缩至约35-40GB,通信开销降低约75%;2-bit量化可压缩至约18GB但带来精度损失75% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/486087API
curl https://kongchang.com/api/v1/knowledge/claims/486087MCP
get_claim(id=486087)