[控场AI]
概念Mixture of Experts / MoE架构 / 稀疏MoE

MoE

混合专家模型(Mixture of Experts,MoE)是一种机器学习架构范式,由多个专门化的子网络(称为"专家")和一个门控路由机制组成。在处理每个输入时,路由机制仅激活其中少数专家,而非全部参数,从而在保持模型整体容量的同时显著降低单次推理的计算量。MoE广泛应用于大规模语言模型和深度学习系统,是提升模型规模与计算效率之间平衡的重要技术路径。

核心事实

时间轴 (近 90 天)

8月25日

Qwen3-235B的MoE版本实际激活参数仅约22B

待验证50%
8月24日

MoE 模型微调时通常需要加载全部参数及对应的优化器状态,对硬件资源的要求远超同等激活参数量的密集模型

待验证50%
8月24日

DeepSeek-V2将每个Transformer层的FFN拆分为多个专家模块,通过门控网络动态路由,每个token只激活约10%的参数

待验证50%
8月24日

MoE架构通过多个专家网络和路由机制,在每次前向传播时只选择性激活部分专家,在保持大模型容量的同时降低计算开销

待验证50%
8月24日

MoE架构只激活部分专家子网络,通常每次推理激活2个专家

待验证50%
8月23日

在MoE架构中,FFN层被替换为多个并行的专家网络,由门控网络根据输入动态选择激活其中少数几个(通常为2个)专家

待验证50%
7月20日

MoE训练时通常需引入辅助损失强制负载均衡,否则会形成少数Expert富者愈富的马太效应导致大多数Expert退化为死代码

待验证50%
7月20日

MoE模型的Expert路由阶段中,不同线程被分派到不同Expert会导致严重的Warp分歧问题

待验证50%
7月2日

以Google Switch Transformer、Mixtral为代表的MoE模型成功部署后,MoE架构已成为超大规模语言模型的主流技术选择

待验证50%
6月3日

DeepSeek V4的核心创新包括对MoE(混合专家)架构的持续优化和对训练流水线的深度工程调优

待验证70%

还有 8 条时间轴事件

全部知识事实 (18)

已验证

DeepSeek-V3采用了混合专家架构(MoE),总参数量达6710亿,但每次推理仅激活约370亿参数

90%
已验证

MOE架构将模型内部划分为多个专家子网络,每次推理时由门控网络动态选择少数专家参与计算,实际激活参数量远小于总参数量

90%
已验证

DeepSeek V4采用混合专家模型(MoE)架构

90%
已验证

MoE架构最早由Jacobs等人在1991年提出,近年来被Google的Switch Transformer和Mixtral等模型重新带入主流

80%
已验证

DeepSeek采用MOE(Mixture of Experts,混合专家)架构,每次推理时只激活部分专家子网络而非全部参数

80%
已验证

Qwen3.6 35B-A3B是混合专家架构(MoE),总参数量35B,每次推理实际激活参数量约3B

70%
已验证

智谱AI发布了GLM 4.6,采用混合专家(MoE)架构优化

65%
部分验证

Gemma 4的26B MOE模型采用混合专家架构,拥有260亿总参数但任意时刻仅约40亿参数处于激活状态

75%
待验证

DeepSeek V4的核心创新包括对MoE(混合专家)架构的持续优化和对训练流水线的深度工程调优

70%
待验证

Qwen3-235B的MoE版本实际激活参数仅约22B

50%
待验证

MoE 模型微调时通常需要加载全部参数及对应的优化器状态,对硬件资源的要求远超同等激活参数量的密集模型

50%
待验证

DeepSeek-V2将每个Transformer层的FFN拆分为多个专家模块,通过门控网络动态路由,每个token只激活约10%的参数

50%
待验证

MoE架构通过多个专家网络和路由机制,在每次前向传播时只选择性激活部分专家,在保持大模型容量的同时降低计算开销

50%
待验证

MoE架构只激活部分专家子网络,通常每次推理激活2个专家

50%
待验证

在MoE架构中,FFN层被替换为多个并行的专家网络,由门控网络根据输入动态选择激活其中少数几个(通常为2个)专家

50%
待验证

MoE模型的Expert路由阶段中,不同线程被分派到不同Expert会导致严重的Warp分歧问题

50%
待验证

MoE训练时通常需引入辅助损失强制负载均衡,否则会形成少数Expert富者愈富的马太效应导致大多数Expert退化为死代码

50%
待验证

以Google Switch Transformer、Mixtral为代表的MoE模型成功部署后,MoE架构已成为超大规模语言模型的主流技术选择

50%

来源文章