DeepSeek V4
DeepSeek V4是由DeepSeek发布的大规模语言模型,采用混合专家(MoE)架构,具备在推理时仅激活部分参数的稀疏计算特性。该模型在编程、数学推理及智能体(Agent)任务等领域表现突出,属于开源大语言模型系列,支持多种通用自然语言处理与生成任务。
核心事实
时间轴 (近 90 天)
读取2个GitHub项目、2个本地项目并编写2个小游戏的实测消耗为1.2元
DeepSeek V4的成本数据基于8月17日之前的定价,之后价格可能上调
DeepSeek发布了V4的首个视觉版本权重,模型规模达305B(约3050亿参数),并同步提供最小推理实现
DeepSeek V4视觉版官方部署要求需要4张NVIDIA GB300显卡才能支撑完整推理服务
DeepSeek发布了V4的首个视觉版本权重,模型规模达到305B(约3050亿参数)
DeepSeek Harness在V0.1.1版本中正式加入对V4多模态模型的支持,以及Files文档存储系统功能
文中提及 DeepSeek V4 Pro 是可选的底座模型版本,效果更佳
全部知识事实 (16)
DeepSeek-V4-Pro是DeepSeek推出的最新旗舰级大语言模型
90%已验证DeepSeek V4在编程、数学推理和多语言理解方面表现突出
80%已验证通过修改Claude Code的连接配置,可以将后端模型从Claude替换为DeepSeek V4
65%待验证DeepSeek V4采用MUON优化器替代AdamW进行训练
85%待验证DeepSeek V4引入了流形约束超链接(Manifold-constrained Hyperconnection,MHC)作为对传统残差连接的升级方案
85%待验证DeepSeek V4采用了MoE(Mixture of Experts,混合专家)架构
75%待验证原来跑百万上下文需要10张H20级别的显卡,DeepSeek V4现在1-2张就够了
75%待验证DeepSeek V4已与升腾(华为)和寒武纪等国产硬件厂商展开深度合作
75%待验证DeepSeek V4的成本数据基于8月17日之前的定价,之后价格可能上调
50%待验证读取2个GitHub项目、2个本地项目并编写2个小游戏的实测消耗为1.2元
50%待验证DeepSeek V4视觉版官方部署要求需要4张NVIDIA GB300显卡才能支撑完整推理服务
50%待验证使用DeepSeek V4 API按日常使用强度估算,每月费用通常在5-20元人民币之间
50%待验证DeepSeek发布了V4的首个视觉版本权重,模型规模达305B(约3050亿参数),并同步提供最小推理实现
50%待验证DeepSeek发布了V4的首个视觉版本权重,模型规模达到305B(约3050亿参数)
50%待验证DeepSeek Harness在V0.1.1版本中正式加入对V4多模态模型的支持,以及Files文档存储系统功能
50%待验证DeepSeek V4模型原本预计在3月发布,但已推迟到更晚时间
80%