Switch Transformer是由Google提出的基于混合专家(Mixture of Experts,MoE)架构的大规模语言模型。其核心设计是将传统Transformer中的前馈网络替换为多个专家网络,并通过路由机制在每次前向传播时动态选择激活少量专家,从而在保持计算效率的同时大幅扩展模型参数规模。该模型验证了MoE架构在自然语言处理领域的有效性,为稀疏激活模型的研究提供了重要参考。
MoE架构最早由Jacobs等人在1991年提出,近年来被Google的Switch Transformer和Mixtral等模型重新带入主流
Google的Switch Transformer和Mistral的Mixtral 8x7B是MoE架构的典型代表
MoE(混合专家)的核心思想可追溯至1991年Jacobs等人提出的早期混合专家框架,谷歌2021年的Switch Transformer将其推入大规模语言模型时代
Switch Transformer(2021年)每个token只路由到单一专家(top-1 routing)
MoE(混合专家)的核心思想可追溯至1991年Jacobs等人提出的早期混合专家框架,谷歌2021年的Switch Transformer将其推入大规模语言模型时代
以Google Switch Transformer、Mixtral为代表的MoE模型成功部署后,MoE架构已成为超大规模语言模型的主流技术选择
Google的Switch Transformer和Mistral的Mixtral 8x7B是MoE架构的典型代表
MoE架构最早由Jacobs等人在1991年提出,近年来被Google的Switch Transformer和Mixtral等模型重新带入主流
MoE架构最早由Jacobs等人在1991年提出,近年来被Google的Switch Transformer和Mixtral等模型重新带入主流
80%VerifiedGoogle的Switch Transformer和Mistral的Mixtral 8x7B是MoE架构的典型代表
75%Partially VerifiedMoE(混合专家)的核心思想可追溯至1991年Jacobs等人提出的早期混合专家框架,谷歌2021年的Switch Transformer将其推入大规模语言模型时代
65%UnverifiedSwitch Transformer(2021年)每个token只路由到单一专家(top-1 routing)
50%Unverified以Google Switch Transformer、Mixtral为代表的MoE模型成功部署后,MoE架构已成为超大规模语言模型的主流技术选择
50%