ModelDeepSeek V2
DeepSeek-V2
DeepSeek发布的MoE大语言模型,引入细粒度专家切分与共享专家机制,将专家数量从8扩大至160,部分专家对所有token始终激活以保留通用知识
Core Facts
Timeline (last 90 days)
Aug 24
DeepSeek-V2将每个Transformer层的FFN拆分为多个专家模块,通过门控网络动态路由,每个token只激活约10%的参数
Unverified50%
Aug 4
Mixtral and DeepSeek-V2 adopt sparse activation strategies
Unverified90%
Jul 2
以Google Switch Transformer、Mixtral为代表的MoE模型成功部署后,MoE架构已成为超大规模语言模型的主流技术选择
Unverified50%
Jun 1
Google的Switch Transformer和Mistral的Mixtral 8x7B是MoE架构的典型代表
Verified75%
Jun 1
DeepSeek采用了混合专家架构(MoE)和多头潜在注意力机制(MLA)
Verified80%
All Facts (5)
Verified
DeepSeek采用了混合专家架构(MoE)和多头潜在注意力机制(MLA)
80%VerifiedGoogle的Switch Transformer和Mistral的Mixtral 8x7B是MoE架构的典型代表
75%UnverifiedMixtral and DeepSeek-V2 adopt sparse activation strategies
90%UnverifiedDeepSeek-V2将每个Transformer层的FFN拆分为多个专家模块,通过门控网络动态路由,每个token只激活约10%的参数
50%Unverified以Google Switch Transformer、Mixtral为代表的MoE模型成功部署后,MoE架构已成为超大规模语言模型的主流技术选择
50%