DeepSeek V4.1 Flash发布:552B参数多模态模型更快更省更强

DeepSeek V4.1 Flash 以552B稀疏架构原生支持多模态,性能超越上代旗舰Pro,同步大幅降低显存与部署成本。
DeepSeek 正式发布并开源 V4.1 Flash,这是 Flash 系列首款原生支持视觉理解的多模态模型。技术上采用全新 Causal Encoder-Decoder 非对称架构,总参数 552B,但推理时输入侧仅激活 8B、输出侧仅激活 16B,以极低实际算力实现了超越上一代旗舰 DeepSeek V4 Pro 的基准测试成绩。资源层面,KVCache 对 HBM 和 SSD 的需求分别降至原来的 1/4 和 1/8,大幅降低长上下文推理成本与开源部署门槛。配合全面升级的工具链(WorkBody、CodeBody、OpenCode、DeepSeek Harness)及应用端三模式合并,DeepSeek 完成了从模型到生态的一体化迭代。过渡期内 V4 Pro 请求将转接至 V4.1 Flash 并按 Flash 价格计费,开发者可实现"降价+升级"的双重收益。
DeepSeek V4.1 Flash 正式上线
DeepSeek 团队再度出手,正式发布并开源了 DeepSeek V4.1 Flash,同步开放 API 调用,调用名称为 DeepSeek Flash。与以往版本相比,本次发布最引人注目的一点是——该模型原生支持视觉理解,意味着 Flash 系列从这一代起正式迈入多模态时代。
从命名策略也能看出 DeepSeek 的产品迭代节奏:Flash 主打"快"与"普惠",定位于高频、低成本的日常推理场景;而更高端的 V4.1 Pro 则尚在路线图之中。这种"Flash 先行、Pro 随后"的发布节奏,与业界常见的旗舰机型分级策略颇为相似。

全新的 Causal Encoder-Decoder 非对称架构
技术层面上,V4.1 Flash 采用了全新的 Causal Encoder-Decoder 非对称架构,总参数量高达 552B。但说个细节,它在输入和输出阶段分别只激活 8B 和 16B 参数。
这种"大总量、小激活"的稀疏化设计,是当前大模型降本增效的主流思路。通过在推理时只调用一部分专家参数,模型既能保留超大规模参数带来的知识容量与智能上限,又能把实际的计算开销压到极低。对于一个总参数 552B 却只激活十几 B 的模型来说,这意味着推理成本可以接近中小模型的水平,同时享受超大模型的能力。
性能表现:Flash 超越上一代旗舰 Pro
官方给出的说法相当激进:V4.1 Flash 在基准测试中"成功超越了包括 DeepSeek V4 Pro 在内的一众旗舰模型的智能水平"。
这是一个颇具冲击力的结论。要知道,Flash 系列过去在产品序列中是"经济款",而 Pro 才是旗舰。如今新一代的 Flash 就能在智能水平上反超上一代的 Pro,说明架构迭代带来的性能提升幅度相当可观。这也解释了为什么 DeepSeek 敢于用 Flash 来统一承接旧模型的流量。
KVCache 显存与存储需求大幅下降
除了智能水平,V4.1 Flash 在系统资源层面的优化同样亮眼。相比上一代,模型的 KVCache 对 HBM(高带宽显存)和 SSD 的需求分别降至四分之一和八分之一。

KVCache 是大模型推理时缓存注意力键值对的关键机制,长上下文场景下往往会成为显存瓶颈。将 HBM 需求压缩到原来的 1/4、SSD 需求压缩到 1/8,直接意味着单卡可以承载更长的上下文、更多的并发请求,或者在更廉价的硬件上运行。这正是"更快、更普惠"背后的工程支撑——降低的不仅是官方的服务成本,也为开源部署者节省了硬件门槛。
定价策略与模型迁移方案
伴随新模型上线,Flash 系列的新定价已经生效。DeepSeek 同时对旧模型进行了梳理和迁移:
- V4 Flash 与 V4 Flash Vision XP 已下线,旧模型名暂时转接至新模型;
- 北京时间 9 月 14 日 12 点后至 V4.1 Pro 上线前,原本的 DeepSeek V4 Pro 请求也将转接至 V4.1 Flash,并按 Flash 的价格计费。

这一迁移策略颇具巧思:既然新 Flash 的智能已超越旧 Pro,那么在 V4.1 Pro 正式登场之前,让 Flash 临时承接 Pro 的请求,用户不仅不会感受到能力下降,反而能以更低价格获得更强服务。对于开发者而言,这是一次"降价+升级"的双重利好。
工具链与生态全面接入
DeepSeek 这次并非只更新模型本体,而是同步升级了整个生态工具链。WorkBody、CodeBody 和 OpenCode 已全量接入新模型。

DeepSeek Harness 与模型深度结合
配套发布的 DeepSeek Harness 新版本与 V4 Pro、V4.1 Flash 的模型训练进行了深度结合,支持保留 KVCache 更新系统提示词。这一特性对于需要频繁调整 system prompt 的 Agent、编程助手等应用尤为重要——过去更新系统提示词往往意味着缓存失效、重新计算,而现在可以在保留缓存的前提下更新,显著降低多轮交互的延迟与成本。
应用端三种模式合并升级
在面向普通用户的层面,DeepSeek 应用和网页端也进行了简化。原本的快速、专家、思考三种模式合并升级,由新模型统一提供服务。这意味着用户不再需要手动在不同模式间切换,模型会自适应地处理不同复杂度的任务。这种"化繁为简"的产品思路,与新架构在单一模型内兼顾速度与智能的能力密切相关。
总结:DeepSeek V4.1 Flash 带来了什么
综合来看,DeepSeek V4.1 Flash 的发布传递出几个清晰信号:
- 架构突破:通过 Causal Encoder-Decoder 非对称架构与稀疏激活机制,用更小的实际算力实现了超越上一代旗舰的性能;
- 资源优化:KVCache 对 HBM 和 SSD 需求的大幅下降,为长上下文推理与低成本部署铺平道路;
- 全栈升级:从模型、工具链到终端应用的一体化更新,体现出 DeepSeek 越来越成熟的产品化能力。
随着 V4.1 Pro 的临近,DeepSeek 的模型矩阵将进一步完善。对于开发者和普通用户而言,这次"更强、更快、更普惠"的升级,无疑值得第一时间尝试。
相关推荐

Treebar:Mac菜单栏管理Git工作树,一眼掌控所有AI编程Agent
Treebar是一款macOS菜单栏应用,专为AI编程多工作树场景设计。它将所有Git Worktree状态统一展示在MacBook刘海区域,让开发者实时监控Codex等AI Agent的工作进度,无需切换终端即可掌握全局。即将开源核心代码。

苹果确认Hide My Email域名永久保留,用户隐私获长期保障
苹果公司公开承诺iCloud+ Hide My Email功能使用的@icloud.com域名将永久保留,不会弃用或迁移。本文解析域名稳定性对邮箱转发隐私工具的关键意义,以及对用户账户安全的底层保障。

终端正在拖慢你:多任务时代的效率反思
终端是程序员的信仰工具,但在多任务并行的现代开发场景中,它的线性设计正在成为效率瓶颈。本文分析终端的心智负担模型为何在第六个任务时崩溃,以及开发者该如何重新评估工具选择。