DeepSeek V4-Flash-Vision开源实测:8GB视觉模块让模型长出眼睛

DeepSeek首个多模态模型V4-Flash-Vision开源,仅增8GB视觉模块,定价与纯文本版持平。
DeepSeek正式将旗下首个多模态模型V4-Flash-Vision-EXP的完整权重(168GB FP8)开源至HuggingFace。该模型基于V4-Flash-0731文本底座,通过约8GB的视觉插件模块实现多模态能力,API定价与纯文本版保持一致,并延续分时折扣策略。当前本地部署仍面临vLLM和SGLang尚未完成适配的障碍,但开发者已通过API验证了其实用价值——利用截图反馈构建视觉Agent闭环,可在一天内完成集成TTS、OCR、声音克隆等多能力的应用平台开发。在同级别小模型横向对比中,V4-Flash系列依然是性价比最优选。
DeepSeek V4-Flash-Vision正式开源:首个多模态模型权重放出
DeepSeek再度出手。近日,DeepSeek将旗下首个多模态模型 V4-Flash-Vision-EXP 的完整权重开源至 HuggingFace,标志着这家以性价比著称的国产大模型厂商正式补齐了「视觉」这块拼图。此前该模型的 API 已在官网悄然上线,如今权重开放,意味着开发者终于可以尝试在本地部署,构建属于自己的视觉 Agent 应用。
你可能没注意到,这个模型并非从零训练的全新架构,而是基于 DeepSeek V4-Flash-0731 模型,外接了一个多模态插件模块。换句话说,它的底层文本能力与原版 Flash 一脉相承,视觉能力则是通过额外模块「叠加」而来。

从体量上看,V4-Flash-Vision 的模型大小约为 168GB(FP8 权重),而原版 V4-Flash 为 160GB。也就是说,整个多模态视觉能力仅仅增加了约 8GB 的权重。这一细节颇为耐人寻味——8GB 就能让模型「长出眼睛」,说明多模态的实现或许并没有想象中那么复杂,更多是在成熟文本底座上进行高效的视觉对齐。
从五月内测到正式开源的时间线
DeepSeek 早在今年五月就已经开始内测其视觉能力,只不过当时仅在网页端提供体验,直到后来才推出 API 版本,如今正式开源权重。这一节奏与 DeepSeek 一贯「发布即开源」的作风略有出入。
模型架构与 V4-Flash-0731 完全一致,但权重却迟迟没有立即开放。具体原因不得而知,或许与多模态模块的适配、安全审查有关。这种「先 API、后开源」的分阶段策略,也反映出多模态模型在工程落地上的额外考量。
本地部署现状:vLLM与SGLang暂未适配
目前,想要在本地部署 V4-Flash-Vision 的开发者还需要再等等。

一个略显反常的现象是:DeepSeek 尚未提供 vLLM 的部署命令,主流推理框架 vLLM 和 SGLang 目前也还未对该模型完成适配。通常大厂在模型发布当天,推理框架团队就会同步公布支持信息——例如通义千问的部分模型在发布时便已官宣兼容。一些大厂甚至会提前把模型交给推理框架团队做适配,因此开发者有时能从推理引擎的代码更新中「提前」嗅到新模型的动向。
不过 DeepSeek 这次并未如此。由于模型上传才刚刚完成,vLLM、SGLang 等主流框架还未针对这个 Vision-EXP 多模态扩展模块做支持。虽然它们此前已经适配了 V4-Flash 的纯文本版本,但对新增的视觉模块尚需时间。预计相关适配信息将很快公布。因此,短期内本地部署仍存在一定门槛。
实测体验:一天搭建多模态应用平台
除了参数层面的讨论,实际项目也验证了模型的开发效率。据测试者介绍,他的一个模型服务网站几乎完全基于 DeepSeek V4-Flash-Vision 开发,没有使用其他任何模型。

这个平台不仅提供 API 接口,还集成了 TTS(文本转语音)、语音识别、OCR、声音克隆、图生文等多个本地模型的能力,并为每个功能配套了简化的 Demo 展示应用,用于验证模型可用性并对接 API。

针对「一天真能开发出来吗」的质疑,测试者明确回应:确实是一天内完成了核心开发。其做法是并行启动三四个子 Agent 同步开发不同模块——正是因为模型具备视觉能力,才能通过截图向它反馈前端页面的实际渲染效果,从而快速定位和修复报错。这种「截图 → 分析 → 修改提示词 → 重新生成」的闭环,正是多模态视觉 Agent 相比纯文本模型的核心优势所在。
DeepSeek分时定价策略:性价比是关键卖点
在价格方面,V4-Flash-Vision 的 API 定价与 V4-Flash 完全一致,做到了「加量不加价」。更重要的是 DeepSeek 的分时定价策略:
- 周末:价格为正常价格的一半
- 非工作时间(下班后):价格为工作日价格的一半
这也是许多开发者选择在周末密集开发的原因之一。从实际使用反馈来看,这是目前「性价比最高的多模态模型」之一。
横向对比:小模型阵营谁更强
在同级别的小模型中,横向对比结果相当直观:
- Gemma 5.3 Flash:使用体验较差,频繁中断、卡顿,已被不少开发者移出日常使用清单。即便免费也难以满足实际开发需求,在 OpenRouter 上的表现与官方版本可能存在差异,推理稳定性堪忧。
- 千问 Qwen3-8B Flash:效果与 DeepSeek 的 27B 模型「差不了太多」,其原生上下文为 256K,可扩展至 1M,官网已提供 100 万上下文的 API 接口,在长上下文场景中有一定竞争力。
综合来看,目前小模型领域的性价比标杆依旧是 DeepSeek V4-Flash 系列。此次视觉能力的加入,无疑进一步巩固了它在轻量级、高性价比开发场景中的领先地位。
总结:DeepSeek多模态开源的意义与展望
DeepSeek V4-Flash-Vision 的开源,代表着国产大模型在多模态方向上又迈出了扎实的一步。仅 8GB 的视觉模块增量、与文本版一致的定价、以及实测中展现出的视觉 Agent 开发能力,都让它在性价比维度上颇具竞争力。
当然,本地部署的支持仍需等待 vLLM 与 SGLang 完成适配。对于追求成本效益的开发者而言,这是一个值得持续关注的模型——尤其是在构建需要「看图理解」的自动化开发流程时。后续本地部署的实际表现和推理框架的适配进度,仍有待进一步验证。
相关推荐

Vercel AI SDK 发布 @ai-sdk/vue@2.0.256 补丁更新
Vercel AI SDK 发布 @ai-sdk/vue@2.0.256 补丁版本,同步核心包 ai@5.0.256 依赖。本文解读该更新内容、Vue 适配包定位及对开发者升级的实际影响。

@ai-sdk/zai@3.0.10 发布:依赖更新的补丁版本解析
Vercel AI SDK 发布 @ai-sdk/zai@3.0.10 补丁版本,同步更新 provider、provider-utils 与 openai-compatible 等底层依赖。本文解析该版本变更内容及 AI SDK provider 体系的设计意义。

Vercel AI SDK 更新:@ai-sdk/workflow 2.0.29 修复工具结果保留问题
Vercel AI SDK 发布 @ai-sdk/workflow 2.0.29 补丁版本,核心修复工作流在终止、延迟、暂停三种响应状态下 provider 工具执行结果的保留问题,并同步升级 ai@7.0.98 等核心依赖。