Qwen 3.8 Flash本地部署实测:单Spark可达43 token/s

Qwen 3.8 Flash以180B参数达到320B旗舰级性能,成为本地部署性价比最优选择。
Qwen 3.8 Flash是阿里Qwen团队推出的视觉语言模型,参数量仅180B,却在综合基准测试中与320B的GLM 5.3 Flash持平,部分指标实现反超。该模型原生支持视觉功能,在单台DGX Spark上可达30-43 token/s,双Spark TP2配置下提升至55-70 token/s,并支持4个全并发智能体。通过NVIDIA Media量化技术,模型在4-bit精度下保持了近乎无损的推理质量。测试表明TP2是推理性能与显存利用率之间的最优配置,而TP4因通信开销反而不及TP2。综合性能、硬件门槛和部署成本三个维度,Qwen 3.8 Flash已成为个人开发者和小团队本地部署的首选方案。
模型定位:参数量减半却比肩旗舰的视觉大模型
Qwen 3.8 Flash正在成为本地AI社区的新宠。根据Artificial Analysis最新的基准测试数据,这款模型的综合能力评级已与GLM 5.3 Flash处于同一梯队,但参数量仅为后者的一半(180B vs 320B)。在GDPPDF、长推理上下文和科学推理等多项专业测试中,Qwen 3.8 Flash与GLM打成平手,部分指标甚至实现反超。

对于本地部署用户来说,这意味着可以用更少的硬件资源获得接近旗舰模型的能力。尤其值得一提的是,该模型原生支持视觉功能,而非像DeepSeek V4 Flash那样后期以实验性方式添加,在多模态任务中的稳定性和表现更具优势。
硬件配置与推理速度实测数据
测试团队在三种典型硬件配置下进行了完整基准测试,以下是详细数据:
单台DGX Spark
- 首token延迟: 8秒
- 推理速度: 30-43 token/s
- KV缓存池: 99.5万(TP2模式)
- 最大上下文窗口: 262K tokens
双Spark TP2配置
- 推理速度: 55-70 token/s
- KV缓存池: 约500万
- 并发能力: 支持4个全并发智能体同时运行

4×RTX 3090配置
- 首token延迟: 6秒
- 推理速度: 133-161 token/s
- 最优模式: TP2
需要特别注意的是,该模型在TP4模式下并未展现速度优势,实测性能介于TP1和TP2之间。因此TP2被认为是黄金配置标准,在推理性能和显存利用率之间取得了最佳平衡。
量化方案:NVIDIA原生Media量化的实际表现
本次测试的所有模型均基于NVIDIA的Media量化技术运行。相比社区中常见的其他量化方案,NVIDIA的方案在保持模型无损质量方面优势明显——4-bit量化在大幅降低显存占用的同时,保留了模型的完整能力。

在实际任务测试中,量化后的Qwen 3.8 Flash在以下场景中均表现稳定:
- 构建HTML游戏(俄罗斯方块、贪吃蛇、太空侵略者)
- 网络搜索与信息检索
- 浏览器自动化操作
这些结果充分说明,Media量化过程并未对模型的实际推理能力造成显著影响。
不同硬件下的部署策略与智能体搭配
针对不同硬件条件,测试者给出了差异化的部署建议:
单/双Spark用户
Qwen 3.8 Flash应作为首选日常主力模型。相比DeepSeek V4 Flash,它提供更强的原生视觉能力和更快的推理速度,能够覆盖80%以上的自动化任务需求。
4×DGX Spark用户
推荐采用分层部署策略,构建完整的多智能体系统:
- 监督者智能体: TP4模式运行GLM 5.3 Flash
- 工作者智能体: Qwen 27B(NVLink加速,200 token/s)
- 子智能体: Qwen 3.6 35B

RTX 3090用户
2×3090可以运行该模型,但需要较高的系统内存支持。4×3090配置能获得最佳体验,推理速度可达160 token/s左右。
Qwen 3.8 Flash与GLM、DeepSeek等竞品横评
在与主要竞品的横向对比中,Qwen 3.8 Flash的综合优势如下:
| 对比维度 | Qwen 3.8 Flash | GLM 5.3 Flash | DeepSeek V4 Flash |
|---|---|---|---|
| 参数量 | 180B | 320B | — |
| 双Spark推理速度 | 55-70 token/s | 较慢 | ~70 token/s |
| 原生视觉支持 | ✅ 原生 | ✅ 原生 | ⚠️ 实验性 |
| 单/双Spark部署友好度 | 高 | 资源需求大 | 中等 |
- 对比GLM 5.3 Flash: 参数量减半但能力持平,在单/双Spark配置下速度优势明显
- 对比DeepSeek V4 Flash: 推理速度相当,但视觉能力更强、稳定性更好
- 对比Qwen 27B: 后者在NVLink加速下可达200 token/s,但在通用硬件上Qwen 3.8 Flash的部署门槛更低
目前,Qwen 3.8 Flash已成为本地AI社区最受欢迎的部署选择之一。完整的部署配方和基准测试数据已向社区开放,大幅降低了上手难度。
未来展望
如果Qwen团队后续推出针对TP4优化的Flash版本,将DGX Spark上的推理速度进一步提升至100 token/s级别,这款模型有望成为本地部署领域的绝对标杆。
就当前而言,对于大多数个人开发者和小团队用户,Qwen 3.8 Flash已经是在硬件成本、推理速度和模型能力三者之间取得最佳平衡的选择。
相关推荐

FDE实战:一句话需求秒变可上线AI页面全流程拆解
深度拆解FDE(前沿部署工程师)实战全流程:从一句话模糊需求到公网可访问页面,涵盖需求澄清、脏数据处理、AI工具协作与部署上线,解析FDE岗位核心能力与适合人群。

DSH开源方案实测:手机电脑云端三端互通远程控制
实测开源DSH三端互通方案,实现手机、电脑与云端服务器的AI工作流无缝协作。支持跨设备文件同步、远程运维容灾、双实例互为备份,附架构解析与部署思路。

法官裁定X已放弃Tweet商标,竞争对手合法启用Tweet.app
联邦法官裁定X(原Twitter)很可能已放弃Tweet商标和小鸟logo,竞争对手以Tweet.app重新上线。本文解析品牌重塑的商标法风险及对社交平台竞争格局的深远影响。