[控场AI]
概念Mixture of Experts / MoE架构 / 稀疏MoE

MoE

混合专家模型(Mixture of Experts,MoE)是一种机器学习架构范式,由多个专门化的子网络(称为"专家")和一个门控路由机制组成。在处理每个输入时,路由机制仅激活其中少数专家,而非全部参数,从而在保持模型整体容量的同时显著降低单次推理的计算量。MoE广泛应用于大规模语言模型和深度学习系统,是提升模型规模与计算效率之间平衡的重要技术路径。

核心事实

时间轴 (近 90 天)

9月11日

MoE架构虽然降低计算成本,但其较大的总参数量对显存和存储需求依然较高,对本地部署提出更高要求

待验证50%
9月11日

MoE架构中每个输入token只有一小部分专家网络被激活参与计算,由门控路由网络决定分配

待验证50%
9月10日

MoE架构相比传统Dense架构在保持模型总知识容量的同时大幅降低了每次前向传播的计算量,但对GPU间通信带宽要求极高

待验证50%
9月10日

在MoE模型中稠密层参数量占比通常不到总参数的20%,但每个token都必须经过,因此需要更高精度保护

待验证50%
9月10日

MoE架构中每个token的处理仅由路由器选择部分专家(通常2-8个)参与计算,实现大容量、低激活的设计

待验证50%
9月10日

混合专家模型(MoE)中每个输入token只会被路由到其中2-4个专家处理,其余专家保持休眠

待验证50%
9月10日

MoE模型虽然计算量小,但整个模型仍需加载到内存中,因此对内存总量要求不低,但对内存带宽压力因每次只读取激活参数而大幅降低

待验证50%
9月10日

MoE模型每次只读取激活的部分参数,速度比同量级稠密模型快得多,例如GLM 5.3 Flash每token仅读约30GB

待验证50%
9月9日

2017年Google Brain的Shazeer等人将MoE引入深度学习,首次将其扩展到大规模语言模型

待验证50%
9月9日

MoE的核心权衡是大容量低算力:激活量只有总参数量的一部分,但显存需求不打折扣

待验证50%

还有 40 条时间轴事件

全部知识事实 (20)

已验证

DeepSeek-V3采用了混合专家架构(MoE),总参数量达6710亿,但每次推理仅激活约370亿参数

90%
已验证

MOE架构将模型内部划分为多个专家子网络,每次推理时由门控网络动态选择少数专家参与计算,实际激活参数量远小于总参数量

90%
已验证

DeepSeek是由中国人工智能公司深度求索开发的大语言模型系列

90%
已验证

GPT-4和Mixtral等主流大模型也采用了MoE架构

85%
已验证

DeepSeek-V3拥有671B总参数,但每次推理仅激活约37B参数

80%
已验证

Gemma 4的26B MOE模型采用混合专家架构,拥有260亿总参数但任意时刻仅约40亿参数处于激活状态

80%
已验证

MoE架构最早由Jacobs等人在1991年提出,近年来被Google的Switch Transformer和Mixtral等模型重新带入主流

80%
已验证

DeepSeek采用MOE(Mixture of Experts,混合专家)架构,每次推理时只激活部分专家子网络而非全部参数

80%
已验证

DeepSeek采用了混合专家架构(MoE)和多头潜在注意力机制(MLA)

80%
已验证

MoE架构的核心思想源自1991年Jacobs等人提出的混合专家系统

80%
已验证

Flash模型通常采用知识蒸馏技术,以旗舰模型为教师模型训练出参数量更小、推理速度更快的学生模型

75%
已验证

专家负载不均衡是MoE最典型的训练难题,可能导致'专家崩溃'现象,通常引入辅助负载均衡损失或Token丢弃策略解决

75%
已验证

Google的Switch Transformer和Mistral的Mixtral 8x7B是MoE架构的典型代表

75%
已验证

Qwen 3.8 Flash Next采用混合专家架构(MoE)

70%
已验证

DeepSeek V4 Flash uses a Mixture of Experts (MOE) architecture with a total parameter count exceeding 600 billion (600B+).

70%
已验证

Qwen3.6 35B-A3B是混合专家架构(MoE),总参数量35B,每次推理实际激活参数量约3B

70%
已验证

Google在Switch Transformer中大规模验证了Mixture of Experts(MOE)架构

70%
已验证

MoE架构仅激活部分专家网络,通常为总参数量的15-25%

65%
已验证

若MoE模型每次推理仅激活约1/8的参数,实际计算开销可能仅相当于百亿参数级别的稠密模型

65%
已验证

MoE架构通过路由器为每个token动态选择Top-K个专家进行计算,使参数总量可扩展而每次推理激活参数量维持不变

65%

来源文章