MoE
混合专家模型(Mixture of Experts,MoE)是一种机器学习架构范式,由多个专门化的子网络(称为"专家")和一个门控路由机制组成。在处理每个输入时,路由机制仅激活其中少数专家,而非全部参数,从而在保持模型整体容量的同时显著降低单次推理的计算量。MoE广泛应用于大规模语言模型和深度学习系统,是提升模型规模与计算效率之间平衡的重要技术路径。
Core Facts
Timeline (last 90 days)
中国电信开源的星辰系列模型采用MoE架构,支持256K上下文并可扩展至512K,是首批全程基于昇腾910C训练的大模型之一
MoE 内核需要同时解决计算规整化和负载均衡两个问题,因专家间负载不均衡会拖累整体利用率
Chord 是由 Novita Labs 开源的一套 W4A16 MoE 内核,专门针对 Kimi K2.x 系列模型进行了优化
MoE架构中选择性计算不意味着选择性存储,所有专家必须同时驻留在内存中,因为逐token的路由选择是动态且无法预知的
v4.1 Flash是混合专家(MoE)架构,每层包含384个路由专家网络外加1个共享专家,路由器为每个token挑选其中6个
MoE架构的代价是训练和调度复杂度更高,且总参数量带来的存储需求依然存在
MoE架构由一个轻量级路由器动态选择少数几个专家参与计算,其余专家保持静默
多机多卡部署中专家并行会引入跨设备的 All-to-All 通信,这是 MoE 在分布式环境下延迟高于等算力稠密模型的主要原因之一
MoE 模型在相同硬件上可处理更多并发请求,或在相同延迟预算下服务更大的模型容量
总参数量反映模型的知识容量与表达能力上限,激活参数量决定推理时的算力消耗和延迟
40 more timeline events
All Facts (20)
DeepSeek-V3采用了混合专家架构(MoE),总参数量达6710亿,但每次推理仅激活约370亿参数
90%VerifiedMOE架构将模型内部划分为多个专家子网络,每次推理时由门控网络动态选择少数专家参与计算,实际激活参数量远小于总参数量
90%VerifiedDeepSeek是由中国人工智能公司深度求索开发的大语言模型系列
90%VerifiedGPT-4和Mixtral等主流大模型也采用了MoE架构
85%VerifiedDeepSeek-V3拥有671B总参数,但每次推理仅激活约37B参数
80%VerifiedGemma 4的26B MOE模型采用混合专家架构,拥有260亿总参数但任意时刻仅约40亿参数处于激活状态
80%VerifiedMoE架构最早由Jacobs等人在1991年提出,近年来被Google的Switch Transformer和Mixtral等模型重新带入主流
80%VerifiedDeepSeek采用MOE(Mixture of Experts,混合专家)架构,每次推理时只激活部分专家子网络而非全部参数
80%VerifiedDeepSeek采用了混合专家架构(MoE)和多头潜在注意力机制(MLA)
80%VerifiedMoE架构的核心思想源自1991年Jacobs等人提出的混合专家系统
80%VerifiedFlash模型通常采用知识蒸馏技术,以旗舰模型为教师模型训练出参数量更小、推理速度更快的学生模型
75%Verified专家负载不均衡是MoE最典型的训练难题,可能导致'专家崩溃'现象,通常引入辅助负载均衡损失或Token丢弃策略解决
75%VerifiedGoogle的Switch Transformer和Mistral的Mixtral 8x7B是MoE架构的典型代表
75%VerifiedQwen 3.8 Flash Next采用混合专家架构(MoE)
70%VerifiedDeepSeek V4 Flash uses a Mixture of Experts (MOE) architecture with a total parameter count exceeding 600 billion (600B+).
70%VerifiedQwen3.6 35B-A3B是混合专家架构(MoE),总参数量35B,每次推理实际激活参数量约3B
70%VerifiedGoogle在Switch Transformer中大规模验证了Mixture of Experts(MOE)架构
70%VerifiedMoE架构仅激活部分专家网络,通常为总参数量的15-25%
65%Verified若MoE模型每次推理仅激活约1/8的参数,实际计算开销可能仅相当于百亿参数级别的稠密模型
65%VerifiedGPT-4采用混合专家(MoE)架构,估计总参数量达1.8万亿,每次推理实际激活参数约为总量的1/8
65%