Unverified50% confidenceFactExact time
MoE架构由Google 2017年的论文奠基,通过路由网络将Token动态分配给少数专家子网络,Qwen 3.5 122B总参数122B但每次推理仅激活约22B
1
Sources
50%
Confidence
Long-term
Relevance
7/12/2026
First Seen
Sources
AMD Ryzen AI Halo实测:x86架构能否撼动英伟达DGX Spark?
bilibili量子菠萝_7/7/2026
Related Claims
UnverifiedMoE架构由多个专家子网络和一个路由器组成,路由器根据输入token动态选择少数几个专家参与计算,DeepSeek V2/V3、Mixtral 8x7B、Google Gemini 1.5均采用这一架构72% similarUnverifiedMoE架构由 Google Brain 于 2017 年提出,GPT-4、Mixtral 8x7B 等知名模型均采用该架构68% similarVerified混合专家架构(MoE)由Google Brain于2017年在Transformer框架下规模化应用,核心思想是将模型参数分组为多个专家子网络,每次推理仅激活其中一小部分67% similarUnverifiedMoE(混合专家)架构最早由Hinton团队在2017年提出,通过门控路由网络动态选择Top-K个专家子网络参与计算67% similarUnverifiedMoE架构历史可追溯至1991年Jacobs等人的原始论文,Google于2017年将其应用于序列到序列模型并显著提升性能66% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/489932API
curl https://kongchang.com/api/v1/knowledge/claims/489932MCP
get_claim(id=489932)