[KongchangAI]
ModelDeepSeek V3

DeepSeek-V3

DeepSeek推出的第三代大语言模型,支持128K token上下文窗口

Core Facts

Timeline (last 90 days)

Oct 7

DeepSeek-V3 总参数达 685B,以 Q4 量化后体积仍超过 400GB

Unverified50%
Sep 16

Meta的Llama 3、阿里的Qwen2.5、幻方科技的DeepSeek-V3/R1、Mistral AI的Mistral/Mixtral以及Google的Gemma 2均在Hugging Face平台托管

Unverified50%
Sep 11

7B以下参数的模型在指令遵循、长文推理等方面与GPT-4o、DeepSeek-V3等商用模型差距明显,适合文本分类、简单问答等轻量任务

Unverified50%
Sep 10

DeepSeek-V2/V3、Qwen2-MoE 等近期热门模型均采用了 MoE 架构

Unverified50%
Sep 5

DeepSeek-V3 和 Qwen3 等新一代模型已在预训练阶段原生集成了 MTP 机制

Unverified50%
Sep 5

DeepSeek-V3 采用无辅助损失的负载均衡策略,通过为每个专家引入可学习的偏置项来自动学习合理的负载分配

Unverified50%
Sep 4

Meta的LLaMA系列、Mistral AI的Mixtral、DeepSeek的DeepSeek-V3/R1等开源模型在编程、推理等任务上的表现已逐步逼近甚至部分场景超越闭源商业模型

Unverified50%
Sep 3

Google的Switch Transformer和Mixtral 8x7B是MoE架构的经典代表,Qwen3、DeepSeek-V3等也采用了该架构

Unverified50%
Aug 31

开源大模型如Meta的Llama系列、阿里Qwen系列、DeepSeek-V3/R1、Mistral AI系列已达到接近甚至部分超越闭源商业模型的水平

Unverified50%
Aug 27

DeepSeek-V3支持128K上下文,大约能容纳一个中等规模Go项目约5-8万行核心业务逻辑代码

Unverified50%

1 more timeline events

All Facts (20)

Verified

DeepSeek-V3采用了混合专家架构(MoE),总参数量达6710亿,但每次推理仅激活约370亿参数

90%
Verified

GPT-4、Claude 3.5、DeepSeek-V3等新一代模型的指令跟随能力和上下文理解能力大幅提升,使复杂提示词模板变得不再必要

80%
Verified

DeepSeek-V3拥有671B总参数,但每次推理仅激活约37B参数

80%
Verified

DeepSeek在V3中通过无辅助损失的负载均衡策略和专用MoE并行框架部分解决了MoE工程挑战

65%
Verified

MoE架构通过路由器动态选择少数专家参与计算,实现稀疏激活,GPT-4、Mistral、DeepSeek等主流前沿模型均采用类似设计

65%
Verified

DeepSeek-V3的训练成本仅为GPT的二十分之一

65%
Unverified

2024年底至2025年初,DeepSeek-V3和DeepSeek-R1相继发布

95%
Unverified

DeepSeek-V3的MoE架构将算力消耗降低了约80%

75%
Unverified

DeepSeek-V3于2024年底发布

70%
Unverified

DeepSeek-V3以极低的训练成本实现了顶尖推理能力

70%
Unverified

DeepSeek-V3是DeepSeek于2024年底发布的旗舰基座模型

60%
Unverified

DeepSeek-V3 总参数达 685B,以 Q4 量化后体积仍超过 400GB

50%
Unverified

Meta的Llama 3、阿里的Qwen2.5、幻方科技的DeepSeek-V3/R1、Mistral AI的Mistral/Mixtral以及Google的Gemma 2均在Hugging Face平台托管

50%
Unverified

7B以下参数的模型在指令遵循、长文推理等方面与GPT-4o、DeepSeek-V3等商用模型差距明显,适合文本分类、简单问答等轻量任务

50%
Unverified

DeepSeek-V2/V3、Qwen2-MoE 等近期热门模型均采用了 MoE 架构

50%
Unverified

DeepSeek-V3 和 Qwen3 等新一代模型已在预训练阶段原生集成了 MTP 机制

50%
Unverified

DeepSeek-V3 采用无辅助损失的负载均衡策略,通过为每个专家引入可学习的偏置项来自动学习合理的负载分配

50%
Unverified

Meta的LLaMA系列、Mistral AI的Mixtral、DeepSeek的DeepSeek-V3/R1等开源模型在编程、推理等任务上的表现已逐步逼近甚至部分场景超越闭源商业模型

50%
Unverified

Google的Switch Transformer和Mixtral 8x7B是MoE架构的经典代表,Qwen3、DeepSeek-V3等也采用了该架构

50%
Unverified

开源大模型如Meta的Llama系列、阿里Qwen系列、DeepSeek-V3/R1、Mistral AI系列已达到接近甚至部分超越闭源商业模型的水平

50%

Source Articles