[控场AI]
模型

DeepSeek V4 Flash

DeepSeek V4 Flash是由DeepSeek推出的轻量级语言模型,属于DeepSeek V4系列的精简版本。该模型在保持较强语言理解与生成能力的同时,针对推理效率进行了优化,支持MTP(多令牌预测)推测解码技术以加速推理过程,适用于对响应速度和计算资源有较高要求的应用场景。

核心事实

时间轴 (近 90 天)

9月24日

Colibri通过coli chat、coli serve、coli web统一调用,支持GLM 5.2/5.3、Kimi K3、DeepSeek V4 Flash、Qwen3等模型

待验证50%
9月23日

用2840亿参数的DeepSeek V4 Flash实测,token生成从37提升到53 tokens/s(约1.5倍),Prompt Processing从483跃升到1485 tokens/s(约三倍)

待验证50%
9月22日

DeepSeek V4 Flash在22个多轮测试中失败13个(fail_fast 45%),Gemini同样失败13个

待验证50%
9月17日

社区实测显示Pro套餐跑DeepSeek V4 Flash一个月能跑约100亿Token,而跑GLM 5.1只剩约16亿Token,差距达6倍

已过期50%
9月16日

Cline 桌面版官方演示中的开放权重模型包括 GLM、Kimi、DeepSeek 系列,其中 DeepSeek V4 Flash 和 Laguna S2.1 标注为免费可用

已过期50%
9月12日

Deep Dog 2 的默认配置在监督智能体、研究子智能体和最终起草环节均使用 DeepSeek V4 Flash 模型,检索使用 Exa

待验证50%
9月11日

制作整期教程视频期间共105次请求、近400万token消耗,费用仅0.13美元,约75%的token走缓存通道

已过期50%
9月11日

Flash 在文笔干净度上基本戒掉了'AI 味'的套路化表达,学会用动作和物件推动情绪并留白

待验证50%
9月11日

推荐的工作流是用 Flash 快速产出脑洞和片段,再用 Pro 打磨结构与长篇一致性

待验证50%
9月11日

短平快、网感、预算敏感的需求适合选择 Flash

待验证50%

还有 40 条时间轴事件

全部知识事实 (20)

已验证

DeepSeek V4 Flash是深度求索推出的针对速度和成本优化的高性价比推理模型

80%
已验证

DeepSeek V4 Pro采用了MoE(Mixture of Experts,混合专家)架构,在推理时只激活部分参数以降低计算成本

80%
已验证

DeepSeek V4 Flash是一款总参数量284B的MoE多模态模型

80%
已验证

DeepSeek 将原生多模态能力率先落地在 Flash 级别而非旗舰版本,意在优先占领高频、规模化应用场景

75%
已验证

相比上一代V4 Flash,V4.1 Flash对高速显存(HBM)的需求降到四分之一,对SSD持久化存储的需求降到八分之一

75%
已验证

V4.1 Flash在DeepSWE基准上以0.2分的微弱优势超过Opus 5

70%
已验证

V4 Flash的缓存大小只有V3.2的7%

70%
已验证

本地化部署的安全优势在于数据不出设备、消除网络传输的中间人攻击风险以及减少对云服务提供商的信任依赖

65%
已验证

DeepSeek将实验性多模态模型V4-Flash-Vision-EXP上线API平台,其文本能力与V4 Flash持平

90%
已验证

DeepSeek推出了实验版多模态模型DeepSeek V4 Flash Vision EXP,在文本与多模态任务中均表现优异

90%
已验证

DeepSeek将实验性多模态模型V4-Flash-Vision-EXP上线API平台,其文本能力与V4 Flash持平,多模态智能体基准测试性能接近Opus 4.8水平

85%
已验证

DeepSeek 官方在 DeepSeek V4 Pro 模型发布后推出了 DeepSeek Harness(简称 DSH)

70%
待验证

V4 Pro的代码生成速度明显慢于V4 Flash

90%
部分验证

在双Spark系统上,DeepSeek V4 Flash(FP8量化)峰值约每秒53个Token

65%
待验证

Ewan大部分工作使用DeepSeek V4 Flash模型,评价其非常快、相对便宜、功能强大

60%
待验证

该测试中模型短上下文场景输出速度约20 token/秒,200K+上下文降至约13 token/秒

60%
待验证

Colibri通过coli chat、coli serve、coli web统一调用,支持GLM 5.2/5.3、Kimi K3、DeepSeek V4 Flash、Qwen3等模型

50%
待验证

用2840亿参数的DeepSeek V4 Flash实测,token生成从37提升到53 tokens/s(约1.5倍),Prompt Processing从483跃升到1485 tokens/s(约三倍)

50%
待验证

DeepSeek V4 Flash在22个多轮测试中失败13个(fail_fast 45%),Gemini同样失败13个

50%
待验证

Deep Dog 2 的默认配置在监督智能体、研究子智能体和最终起草环节均使用 DeepSeek V4 Flash 模型,检索使用 Exa

50%

来源文章