Unverified50% confidenceFactExact time
MoE 模型每个 token 只被路由到少数几个专家进行计算,使总参数量大但激活参数量小
1
Sources
50%
Confidence
Long-term
Relevance
9/15/2026
First Seen
Sources
Related Entities
Related Claims
Unverified在MoE模型中稠密层参数量占比通常不到总参数的20%,但每个token都必须经过,因此需要更高精度保护72% similarVerifiedMoE架构每次推理时通常仅激活总参数的10%-20%72% similarUnverifiedPangu 2.0 uses a sparse architecture employing Mixture of Experts (MoE), activating only a subset of parameters per inference rather than all 505 billion72% similarUnverifiedMoE的8选2配置意味着8个专家中每次只激活2个,实际计算量仅为密集模型的约四分之一69% similarVerified若MoE模型每次推理仅激活约1/8的参数,实际计算开销可能仅相当于百亿参数级别的稠密模型68% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/922943API
curl https://kongchang.com/api/v1/knowledge/claims/922943MCP
get_claim(id=922943)