共 5 篇相关文章

Unsloth发布Dynamic v3量化方案,Qwen3.8-27B GGUF模型在同体积下实现10% top-1%精度提升,并推出6-8GB的1-bit极限量化版本。新增Divergence-300长序列评测指标,更真实反映量化质量。

Quantprobe是一个开源内存分配优化框架,通过逐层量化布局和智能CPU/GPU拆分,让6GB显存的老显卡以22 tokens/s速度运行30B参数大模型,大幅降低本地LLM部署的硬件门槛。
每日AI新鲜事·08月05日午间版:Qwen3.6量化黑科技与Flowise关停
2026年08月05日午间版 AI新闻速递+热点深度讨论
每日AI新鲜事·08月03日午间版:Qwen3.8-Max发布与基准测试之争
2026年08月03日午间版 AI新闻速递+热点深度讨论
教程攻略实测DeepSeek V4 Flash开启MTP推测解码后的性能表现:代码生成场景提速约20%,文本生成提升有限。详解内存开销、准确性差异、Q4与Q3量化对比,以及通过Inference应用和OpenAI兼容API的完整部署教程。