DeepSeek V4
DeepSeek V4是由DeepSeek发布的大规模语言模型,采用混合专家(MoE)架构,具备在推理时仅激活部分参数的稀疏计算特性。该模型在编程、数学推理及智能体(Agent)任务等领域表现突出,属于开源大语言模型系列,支持多种通用自然语言处理与生成任务。
Core Facts
Timeline (last 90 days)
Claude网页端新增了Agent模式,并提供包括Claude、DeepSeek V4、Flash等在内的多种模型选项
B站UP主星月组织了一场多维度AI模型写小说测评,涵盖六个主流大模型(Gemini 3.8 Flash High、Cloud Opus 5、GPT 5.6、DeepSeek V4、千问3.8、GLM 5.3)
演示中使用DeepSeek V4模型生成科幻小说,模型会先展示思考过程再逐节点输出结果
TileLang 在英伟达平台已验证成熟,承载 DeepSeek V4 系列模型训练中大部分算子的实现
中转平台提供DeepSeek V4模型,选择该模型调用时消耗中转平台的Token
Cline 的免费模型中包含一款被称为「牛来」的神秘模型以及 DeepSeek V4
DeepSeek V4的成本数据基于8月17日之前的定价,之后价格可能上调
读取2个GitHub项目、2个本地项目并编写2个小游戏的实测消耗为1.2元
DeepSeek发布了V4的首个视觉版本权重,模型规模达305B(约3050亿参数),并同步提供最小推理实现
DeepSeek V4视觉版官方部署要求需要4张NVIDIA GB300显卡才能支撑完整推理服务
2 more timeline events
All Facts (16)
DeepSeek V4采用自研的分层压缩注意力策略,设计了CSA(压缩吸收注意力)和HCA(重度压缩注意力)两种注意力模式交替使用
90%VerifiedTileLang 在英伟达平台已验证成熟,承载 DeepSeek V4 系列模型训练中大部分算子的实现
65%UnverifiedDeepSeek V4采用MUON优化器替代AdamW进行训练
85%UnverifiedDeepSeek V4引入了流形约束超链接(Manifold-constrained Hyperconnection,MHC)作为对传统残差连接的升级方案
85%UnverifiedDeepSeek V4支持百万级Token上下文窗口,并以MIT许可证发布
85%UnverifiedDeepSeek V4引入了MHC流形约束连接技术,用于保证深层网络训练稳定性
85%UnverifiedDeepSeek V4系列采用了MLA、MoE路由优化以及NSA等创新架构技术
85%UnverifiedDeepSeek V4采用了MoE(Mixture of Experts,混合专家)架构
75%Unverified演示中使用DeepSeek V4模型生成科幻小说,模型会先展示思考过程再逐节点输出结果
50%Unverified中转平台提供DeepSeek V4模型,选择该模型调用时消耗中转平台的Token
50%UnverifiedDeepSeek V4视觉版官方部署要求需要4张NVIDIA GB300显卡才能支撑完整推理服务
50%UnverifiedClaude网页端新增了Agent模式,并提供包括Claude、DeepSeek V4、Flash等在内的多种模型选项
50%UnverifiedB站UP主星月组织了一场多维度AI模型写小说测评,涵盖六个主流大模型(Gemini 3.8 Flash High、Cloud Opus 5、GPT 5.6、DeepSeek V4、千问3.8、GLM 5.3)
50%UnverifiedDeepSeek发布了V4的首个视觉版本权重,模型规模达305B(约3050亿参数),并同步提供最小推理实现
50%UnverifiedDeepSeek发布了V4的首个视觉版本权重,模型规模达到305B(约3050亿参数)
50%UnverifiedDeepSeek Harness在V0.1.1版本中正式加入对V4多模态模型的支持,以及Files文档存储系统功能
50%