DeepSeek V4.1 Flash发布:最小号全面反超旗舰,成本砍至四分之一

DeepSeek V4.1 Flash以更小模型全面超越旗舰,同步大幅削减成本并筹备科创板IPO。
DeepSeek 发布 V4.1 Flash,定位最小号却在性能、速度与成本上全面超越自家旗舰 V4 Pro。该模型采用原生多模态设计,将原有三种交互模式合并为统一入口,大幅降低用户与开发者的使用门槛。在成本结构上,KVCache 降至上代四分之一、高端内存需求下降 75%、静态存储降至八分之一,这对 AI Agent 等长上下文密集型场景的规模化落地具有重要意义。9 月 14 日起,V4 Pro 将正式下线,全部请求路由至 Flash,实现彻底的价格重构。与此同时,DeepSeek 已委托中信证券筹备科创板 IPO,形成技术、价格与资本三线并进的竞争格局。
最小号却全面反超旗舰
DeepSeek 再次投下一颗重磅炸弹——V4.1 Flash 正式上线。按官方口径,这个定位于「最小号」的模型,在性能、速度、成本以及总用时上,全面超越了自家旗舰 V4 Pro。这种「以小博大」的定位并不常见:通常厂商会用更大的模型压制上一代,而 DeepSeek 却直接用一个更轻量的版本完成了对旗舰的超越,本质上是架构与工程层面的效率跃迁。
对于用户而言,这意味着可以用更低的成本,获得比过去旗舰更强的推理体验。这也符合 DeepSeek 一贯的技术路线——不靠堆参数,而靠工程优化把成本压到极致。

原生多模态与三模式合一
V4.1 Flash 是原生多模态设计,能够直接看图理解内容。更重要的是产品形态上的简化:过去的「快速」「专家」「实图」三个模式,如今已经合并成一个统一入口。
这种合并背后其实是模型能力的自适应——不再需要用户手动选择模式,模型可以根据任务类型自行调度算力与策略。对普通用户来说,交互门槛降低了;对开发者来说,接口调用也更加统一,减少了工程适配的复杂度。
成本才是真正的杀手锏:KVCache降至四分之一
V4.1 Flash 最具冲击力的部分,是它在成本结构上的大幅优化。
- KVCache 砍到上一代的四分之一:这直接影响到长上下文与多轮对话场景的显存占用。
- 高端内存需求下降 75%:意味着部署所需的高端硬件门槛大幅降低。
- 静态硬盘需求降至八分之一:存储成本被压缩到极致。

为什么这对 AI Agent 场景意义重大
KVCache 与内存开销的下降,对 Agent 类任务尤其关键。Agent 需要维持长链路的上下文记忆、频繁调用工具、反复读写缓存,是典型的「吃缓存」任务。过去这类任务成本高昂,很大程度上限制了 Agent 应用的规模化落地。
V4.1 Flash 把缓存成本压到四分之一,意味着运行一个长期在线的 Agent 的经济性会明显改善。这可能会成为推动 AI Agent 应用普及的一个重要拐点——当单次调用与长期运行的成本足够低,开发者才敢于把 Agent 用在真实的生产环境中。
KVCache(Key-Value Cache,键值缓存)是大语言模型推理中的核心技术机制。在 Transformer 架构中,模型每处理一个 token 时都需要计算注意力权重,而之前所有 token 的 Key 和 Value 向量可以被缓存起来复用,避免重复计算。这种缓存机制大幅提升了推理速度,但代价是显存占用随上下文长度线性增长——对话越长、工具调用越多,KVCache 就越大。
在 AI Agent 场景中,一个任务可能涉及数十轮工具调用与中间结果的累积,上下文窗口往往达到数万甚至数十万 token,KVCache 的显存消耗会成为部署瓶颈。将 KVCache 开销压缩至四分之一,意味着同等硬件上可以并发处理更多 Agent 实例,或者支撑更长的对话链路,这对于需要 7×24 小时在线运行的生产级 Agent 应用而言,是真实可感的成本节约。
旗舰下线:9月14日起全线按 Flash 计费
DeepSeek 这次还给出了明确的时间表:9 月 14 日中午 12 点,V4 Pro 正式下线,所有请求将全部路由到 V4.1 Flash。
这是一个相当激进的决策。它意味着旗舰版本不再单独存在,全线按照 Flash 的价格计费。换句话说,用户将以「最小号」的价格,享受到超越旧旗舰的能力。

一次彻底的价格重构
直接下线旗舰、统一路由到低价模型,这种做法在行业里并不多见。大多数厂商会保留高价旗舰以维持利润空间,而 DeepSeek 选择用最低的价格覆盖全部需求。
这背后的逻辑很清晰:既然新的小号在各项指标上都已超越旧旗舰,那么保留一个更贵、更慢的旗舰就失去了意义。与其让产品线复杂化,不如一刀切地简化,把价格优势彻底释放出来,用极致性价比抢占市场。
科创板(科创板,Shanghai STAR Market)是上海证券交易所于 2019 年设立的专属板块,定位于支持硬科技与高成长型企业上市融资,对盈利要求相对宽松,允许尚未盈利但具备核心技术壁垒的企业申报。AI 大模型公司通常前期研发投入巨大、商业化路径尚在探索,科创板的上市条件对这类企业更为友好。
中信证券作为国内头部投行,承接 DeepSeek 的 IPO 辅导工作,意味着整个资本化进程已进入实质性阶段。一旦上市成功,DeepSeek 将获得持续的公开融资渠道,能够在算力采购、研发投入与人才竞争上保持更强的弹药储备,而不必完全依赖股东追加投资。这对于在算力军备竞赛中维持技术领先地位至关重要。
资本层面同步发力:DeepSeek筹备科创板 IPO
除了产品端的动作,DeepSeek 在资本层面也有新进展——已委托中信证券,筹备科创板 IPO。

这意味着 DeepSeek 正在从一家技术公司,向具备完整资本运作能力的科技企业迈进。速度、成本、资本,三条线同时开火,构成了一套完整的竞争打法:技术上保持领先,价格上极限压低,资本上储备弹药。
这轮大模型价格战的核心看点
国内大模型的价格战已持续多轮,而 DeepSeek 这次的做法尤其值得关注。它不是单纯地降价促销,而是通过底层架构优化,让「低价」变得可持续——成本真的被砍下来了,而不是靠补贴硬撑。
当一家公司能同时做到「更强、更快、更便宜」,并且还在筹备上市补充资金,那么它在这轮竞争中的位置无疑相当有利。对整个行业而言,这也会倒逼其他厂商加速自身的效率优化,最终受益的还是广大开发者与用户。
结语
V4.1 Flash 的发布,展现了 DeepSeek 一贯的工程主义风格——用架构创新换取极致的成本效率。原生多模态、三模式合一、缓存成本骤降、旗舰全线下线,再加上科创板 IPO 布局,每一步都指向同一个目标:以性价比重塑市场格局。
9 月 14 日之后,DeepSeek 的全部算力都将跑在 Flash 之上。这场以速度、成本、资本三线并进的攻势,或将成为国产大模型竞争进入新阶段的一个标志性事件。
相关推荐

Treebar:Mac菜单栏管理Git工作树,一眼掌控所有AI编程Agent
Treebar是一款macOS菜单栏应用,专为AI编程多工作树场景设计。它将所有Git Worktree状态统一展示在MacBook刘海区域,让开发者实时监控Codex等AI Agent的工作进度,无需切换终端即可掌握全局。即将开源核心代码。

苹果确认Hide My Email域名永久保留,用户隐私获长期保障
苹果公司公开承诺iCloud+ Hide My Email功能使用的@icloud.com域名将永久保留,不会弃用或迁移。本文解析域名稳定性对邮箱转发隐私工具的关键意义,以及对用户账户安全的底层保障。

终端正在拖慢你:多任务时代的效率反思
终端是程序员的信仰工具,但在多任务并行的现代开发场景中,它的线性设计正在成为效率瓶颈。本文分析终端的心智负担模型为何在第六个任务时崩溃,以及开发者该如何重新评估工具选择。