DeepSeek V4.1 Flash
DeepSeek系列的轻量级快速推理模型版本,属于Flash系列,推理成本较低,适合高频调用场景
Core Facts
Timeline (last 90 days)
编程订阅服务Command Code宣布把DeepSeek V4.1 Flash的60美元使用量永久纳入其GOAT套餐
在DeepSWE编程榜上Beam得44.4分垫底,低于DeepSeek V4.1 Flash的74.2分、Kimi K3约68分、GLM约61分、Qwen3 Max约51分
Cline 免费模型列表新增了 Solar Mini 4,移除了 DeepSeek V4.1 Flash 和 space-bunny-alpha,并新增了 Engy 提供商
在Gorgon Halo上运行DeepSeek V4.1 Flash的推荐方式是使用Dwarf Star实现搭配Q2量化版本,主模型权重约占163GB,完整文件约366GB(含Ngram表)
SWA-bounded replay模式让长输入提示中的大多数早期token只经过模型约一半的层,仅对最近窗口内token执行完整全层计算,以牺牲部分精度换取速度和内存占用降低
在2000 token新提示下,DeepSeek V4.1 Flash在Q4量化提示处理起始约360 tokens/s,64K上下文约307;token生成稳定约14 tokens/s
一位用户使用「制作一段以纸飞机为主角的短动画」提示词对四款AI模型进行了横向测试
v3.0.68 将 Nvidia 的默认模型切换为 DeepSeek V4.1 Flash
Mgroup GEMM、MQA Logits、MGroup MoE三个算子与DeepSeek V4.1 Flash等新模型的特定架构深度绑定
端云协同采用云端DeepSeek V4.1 Flash负责任务拆解编排,端侧依靠本地算力执行并由云端模型验收
40 more timeline events
All Facts (20)
DeepSeek Flash版本是针对低延迟场景优化的蒸馏模型,牺牲部分复杂推理能力换取更快的响应速度和更低的Token单价
90%VerifiedDeepSeek V4 Flash是深度求索推出的针对速度和成本优化的高性价比推理模型
80%VerifiedDeepSeek V4 Flash是一款总参数量284B的MoE多模态模型
80%VerifiedDeepSeek V4.1 Flash号称在能力、速度、成本三个维度上实现突破
75%VerifiedV4.1 Flash是原生多模态设计,能够直接看图理解内容
75%VerifiedDeepSeek 将原生多模态能力率先落地在 Flash 级别而非旗舰版本,意在优先占领高频、规模化应用场景
75%VerifiedDeepSeek V4.1 Flash 在 GPQA、HLE 等方面的评分低于此前版本
75%Verified相比上一代V4 Flash,V4.1 Flash对高速显存(HBM)的需求降到四分之一,对SSD持久化存储的需求降到八分之一
75%VerifiedV4 Flash的缓存大小只有V3.2的7%
70%VerifiedV4.1 Flash采用全新的CED(因果编码)架构,核心思路是输入和输出的计算不对称
70%VerifiedV4.1 Flash在DeepSWE基准上以0.2分的微弱优势超过Opus 5
70%VerifiedFlash版本定位于更轻量、更快速的推理,适合延迟敏感或资源受限场景;PRO版本面向更强能力上限,对显存与算力要求更高
70%VerifiedV4.1 Flash处理输入时激活80亿参数,生成输出时激活160亿参数
65%VerifiedDeepSeek V4.1 Flash 实现的浏览器操作系统界面呈现出带动画效果的动态桌面,弹窗设计精致,Dock栏应用能正常调用
65%VerifiedDeepSeek V4.1 Flash 采用 Causal Encoder-Decoder 非对称架构,总参数量为 552B
65%VerifiedV4.1 Flash在输入阶段仅激活80亿参数,输出阶段激活160亿参数
65%Verified该模型基于V4 Flash架构,通过持续训练(continued training)叠加视觉模块获得图像理解能力
65%VerifiedDeepSeek推出了实验版多模态模型DeepSeek V4 Flash Vision EXP,在文本与多模态任务中均表现优异
90%Verified9月14日中午12点,V4 Pro正式下线,所有请求将全部路由到V4.1 Flash
65%Unverified发布方宣称DeepSeek-V4.1-Flash的成本仅为Opus 5和GPT-5.6 Sol的1/40
70%