待验证50% 置信事实精确时间
Google 的 Switch Transformer(2021)和 Mistral 的 Mixtral 8x7B(2023)都采用了稀疏 MoE 架构,即每次前向传播只激活少数几个专家
1
来源数
50%
置信度
长期有效
时效性
2026/7/17
首次发现
来源
相关事实
待验证Switch Transformer和Mixtral系列广泛采用了MoE架构74% 相似待验证Meta的LLaMA系列、Google的Gemma、Mistral AI的Mistral/Mixtral、阿里的Qwen系列都在Transformers中获得支持67% 相似待验证Google 2017年提出的Sparsely-Gated MoE首次将稀疏门控引入Transformer规模的序列模型,可在不显著增加计算量前提下将模型容量扩大1000倍以上65% 相似待验证Meta的LLaMA系列、Google的Gemma、阿里的Qwen、DeepSeek等主流开源模型都优先适配Transformers格式64% 相似已验证MoE架构将Transformer的前馈网络层替换为多个并行专家子网络,通过路由网络对每个token动态选择激活2-4个专家62% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/544377API
curl https://kongchang.com/api/v1/knowledge/claims/544377MCP
get_claim(id=544377)