待验证50% 置信基准精确时间
Qwen3.8-Flash-Next的1-bit Dynamic GGUF版本可在75GB内存或统一内存上运行,相比原始BF16格式体积缩小79%,保留80%的top-1准确率
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/5
首次发现
有效期至:2026/12/4
来源
涉及实体
相关事实
待验证Qwen3-27B官方发布了GGUF格式的量化模型,最低8GB显存即可完成本地部署77% 相似待验证GGUF 量化格式可将FP16或BF16精度模型压缩至4-bit乃至2-bit精度72% 相似已验证Qwen2.5 9B模型在消费级GPU(如8GB显存)上即可流畅运行71% 相似已验证以 GGUF Q4 量化为基准,7B 模型约需 4-6GB 显存,13B 约需 8-10GB,70B 需 40GB 以上或多 GPU 并行71% 相似待验证Qwen3-0.6B 经 INT4 量化后模型文件仅约 400MB,保留约 95% 基准能力,普通笔记本 CPU 即可实现每秒 10-30 token 生成速度70% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/860387API
curl https://kongchang.com/api/v1/knowledge/claims/860387MCP
get_claim(id=860387)