待验证50% 置信事实精确时间
在MoE模型中每个token只激活少量Expert(通常2-4个,Top-K路由),实际计算量可能仅相当于6-7B的Dense模型
1
来源数
50%
置信度
长期有效
时效性
2026/7/20
首次发现
来源
相关事实
待验证MoE模型中'35B'指总参数量,每个token只激活少量Expert(通常2-4个),实际计算量可能仅相当于6-7B的Dense模型84% 相似待验证MoE 模型每次推理仅激活总参数量的一小部分,Qwen3 Max 每次推理激活量可能为总量的1/8至1/1674% 相似待验证Kimi K2.7 Code采用384个专家的MoE架构,每个token选择8个专家加1个共享专家,实际计算量约为稠密模型的2.3%70% 相似待验证千问3.6的35B MOE模型每次只激活其中3B的参数70% 相似已验证Mixtral 8x7B模型拥有8个专家,每个Token只激活2个,总参数量达到47B,但单次推理的计算量仅相当于一个13B参数的稠密模型68% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/575452API
curl https://kongchang.com/api/v1/knowledge/claims/575452MCP
get_claim(id=575452)