Unverified50% confidenceFactExact time
2022年Google的《Switch Transformers》将MoE中选Top-K专家简化为选Top-1专家,并通过辅助负载均衡损失函数解决专家坍塌问题
1
Sources
50%
Confidence
Long-term
Relevance
7/21/2026
First Seen
Sources
Related Claims
Verified谷歌2021年发布的Switch Transformer通过将路由简化为Top-1选择并引入专家容量机制缓解负载不均衡问题80% similarVerifiedGoogle在Switch Transformer中大规模验证了Mixture of Experts(MOE)架构80% similarUnverifiedMoE混合专家架构最早可追溯至1991年的学术论文,谷歌于2021年发布Switch Transformer将专家数量扩展至2048个71% similarVerified混合专家架构(MoE)由Google Brain于2017年在Transformer框架下规模化应用,核心思想是将模型参数分组为多个专家子网络,每次推理仅激活其中一小部分67% similarUnverifiedGoogle 的 Switch Transformer 和 Mixtral 采用了混合专家模型(MoE)思想,通过门控网络将输入路由到不同专家子网络并只激活部分参数66% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/584867API
curl https://kongchang.com/api/v1/knowledge/claims/584867MCP
get_claim(id=584867)