DeepSeek-V3
DeepSeek推出的第三代大语言模型,支持128K token上下文窗口
Core Facts
Timeline (last 90 days)
DeepSeek-V3 总参数达 685B,以 Q4 量化后体积仍超过 400GB
Meta的Llama 3、阿里的Qwen2.5、幻方科技的DeepSeek-V3/R1、Mistral AI的Mistral/Mixtral以及Google的Gemma 2均在Hugging Face平台托管
7B以下参数的模型在指令遵循、长文推理等方面与GPT-4o、DeepSeek-V3等商用模型差距明显,适合文本分类、简单问答等轻量任务
DeepSeek-V2/V3、Qwen2-MoE 等近期热门模型均采用了 MoE 架构
DeepSeek-V3 和 Qwen3 等新一代模型已在预训练阶段原生集成了 MTP 机制
DeepSeek-V3 采用无辅助损失的负载均衡策略,通过为每个专家引入可学习的偏置项来自动学习合理的负载分配
Meta的LLaMA系列、Mistral AI的Mixtral、DeepSeek的DeepSeek-V3/R1等开源模型在编程、推理等任务上的表现已逐步逼近甚至部分场景超越闭源商业模型
Google的Switch Transformer和Mixtral 8x7B是MoE架构的经典代表,Qwen3、DeepSeek-V3等也采用了该架构
开源大模型如Meta的Llama系列、阿里Qwen系列、DeepSeek-V3/R1、Mistral AI系列已达到接近甚至部分超越闭源商业模型的水平
DeepSeek-V3支持128K上下文,大约能容纳一个中等规模Go项目约5-8万行核心业务逻辑代码
1 more timeline events
All Facts (20)
DeepSeek-V3采用了混合专家架构(MoE),总参数量达6710亿,但每次推理仅激活约370亿参数
90%VerifiedGPT-4、Claude 3.5、DeepSeek-V3等新一代模型的指令跟随能力和上下文理解能力大幅提升,使复杂提示词模板变得不再必要
80%VerifiedDeepSeek-V3拥有671B总参数,但每次推理仅激活约37B参数
80%VerifiedDeepSeek在V3中通过无辅助损失的负载均衡策略和专用MoE并行框架部分解决了MoE工程挑战
65%VerifiedMoE架构通过路由器动态选择少数专家参与计算,实现稀疏激活,GPT-4、Mistral、DeepSeek等主流前沿模型均采用类似设计
65%VerifiedDeepSeek-V3的训练成本仅为GPT的二十分之一
65%Unverified2024年底至2025年初,DeepSeek-V3和DeepSeek-R1相继发布
95%UnverifiedDeepSeek-V3的MoE架构将算力消耗降低了约80%
75%UnverifiedDeepSeek-V3于2024年底发布
70%UnverifiedDeepSeek-V3以极低的训练成本实现了顶尖推理能力
70%UnverifiedDeepSeek-V3是DeepSeek于2024年底发布的旗舰基座模型
60%UnverifiedDeepSeek-V3 总参数达 685B,以 Q4 量化后体积仍超过 400GB
50%UnverifiedMeta的Llama 3、阿里的Qwen2.5、幻方科技的DeepSeek-V3/R1、Mistral AI的Mistral/Mixtral以及Google的Gemma 2均在Hugging Face平台托管
50%Unverified7B以下参数的模型在指令遵循、长文推理等方面与GPT-4o、DeepSeek-V3等商用模型差距明显,适合文本分类、简单问答等轻量任务
50%UnverifiedDeepSeek-V2/V3、Qwen2-MoE 等近期热门模型均采用了 MoE 架构
50%UnverifiedDeepSeek-V3 和 Qwen3 等新一代模型已在预训练阶段原生集成了 MTP 机制
50%UnverifiedDeepSeek-V3 采用无辅助损失的负载均衡策略,通过为每个专家引入可学习的偏置项来自动学习合理的负载分配
50%UnverifiedMeta的LLaMA系列、Mistral AI的Mixtral、DeepSeek的DeepSeek-V3/R1等开源模型在编程、推理等任务上的表现已逐步逼近甚至部分场景超越闭源商业模型
50%UnverifiedGoogle的Switch Transformer和Mixtral 8x7B是MoE架构的经典代表,Qwen3、DeepSeek-V3等也采用了该架构
50%Unverified开源大模型如Meta的Llama系列、阿里Qwen系列、DeepSeek-V3/R1、Mistral AI系列已达到接近甚至部分超越闭源商业模型的水平
50%