Unverified60% confidenceFactExact time
该模型每层有512个专家,但每个token只激活其中10个,真正参与计算的权重约6B
2
Sources
60%
Confidence
Long-term
Relevance
10/5/2026
First Seen
Sources
Related Entities
Related Claims
UnverifiedMoE的8选2配置意味着8个专家中每次只激活2个,实际计算量仅为密集模型的约四分之一74% similarUnverifiedMoE模型每个token只激活512个专家中的约10个,有效激活参数量约20-30B级别72% similarUnverifiedM2.5采用混合专家架构(Mixture of Experts,MoE),每次推理只有10B参数真正参与计算,总参数量可能远超10B68% similarUnverified服务同等数量的并发用户,超大模型所需的GPU集群规模可能是同等智能水平小模型的5至10倍67% similarUnverified以1000×1000权重矩阵为例,若LoRA的秩设为8,只需训练约1.6万个参数而非100万个原始参数67% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/978653API
curl https://kongchang.com/api/v1/knowledge/claims/978653MCP
get_claim(id=978653)