#模型量化
共 26 篇相关文章
产品体验·4 分钟
Qwen3.6量化版本地部署实测:NVFP4、APEX、Q4、Q6哪个最值得选
实测Qwen3.6系列7-8个量化模型在工具调用、命令行操作、Bug修复、数学推理等8大维度的表现,对比NVFP4、APEX、Q4、Q6量化方案,附总分排名与选购建议,帮你找到最适合本地部署的量化版本。
阅读全文 →
产品体验·4 分钟
Qwen3.6 27B三大邪修量化模型实测:代码暴增15.8PP、40B蒸馏、16GB适配
实测对比三款基于Qwen3.6 27B的社区邪修量化模型:OmniMerge V4代码能力提升15.8个百分点,40B OPUS蒸馏版支持角色扮演与创意写作,16GB特化版让小显存也能跑稠密模型。附显存要求、参数设置与选型建议。
阅读全文 →
教程攻略·11 分钟
NVIDIA Model Optimizer训练后量化(PTQ)实战指南
深入解析NVIDIA Model Optimizer训练后量化(PTQ)工作流,涵盖INT8/INT4量化原理、校准方法、RTX GPU优化策略及大语言模型量化部署最佳实践,助你在消费级显卡上高效运行大模型。
阅读全文 →
前沿研究·9 分钟
SVDQuant:4-bit量化让扩散模型在消费级GPU上高效运行
SVDQuant是ICLR 2025 Spotlight论文,通过低秩分解吸收异常值实现扩散模型4-bit量化,显存降低75%。开源项目Nunchaku获3800+ Stars,让FLUX等大型图像生成模型在RTX 4060等中端显卡上流畅推理。
阅读全文 →
科技前沿·6 分钟
IBM Granite 4.1开源模型:21个量化版本SVG生成实测对比
IBM发布Granite 4.1系列开源大模型(Apache 2.0),Unsloth提供21种GGUF量化版本。Simon Willison用鹈鹕SVG测试不同量化级别,发现3B模型在SVG生成上表现一致——都很差,揭示了模型选型的关键启示。
阅读全文 →
科技前沿·6 分钟
IBM Granite 4.1量化测试:21个GGUF版本SVG生成对比实验
IBM Granite 4.1开源模型发布,Unsloth提供21种GGUF量化版本。Simon Willison用鹈鹕骑自行车SVG测试发现:3B小模型中量化级别对生成质量影响微乎其微,最小模型反而画出最好的自行车。
阅读全文 →