待验证50% 置信事实精确时间
MoE 模型每个 token 只被路由到少数几个专家进行计算,使总参数量大但激活参数量小
1
来源数
50%
置信度
长期有效
时效性
2026/9/15
首次发现
来源
涉及实体
相关事实
待验证在MoE模型中稠密层参数量占比通常不到总参数的20%,但每个token都必须经过,因此需要更高精度保护72% 相似已验证MoE架构每次推理时通常仅激活总参数的10%-20%72% 相似待验证Pangu 2.0 uses a sparse architecture employing Mixture of Experts (MoE), activating only a subset of parameters per inference rather than all 505 billion72% 相似待验证MoE的8选2配置意味着8个专家中每次只激活2个,实际计算量仅为密集模型的约四分之一69% 相似已验证若MoE模型每次推理仅激活约1/8的参数,实际计算开销可能仅相当于百亿参数级别的稠密模型68% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/922943API
curl https://kongchang.com/api/v1/knowledge/claims/922943MCP
get_claim(id=922943)