Unverified50% confidenceFactExact time
在MoE模型中每个token只激活少量Expert(通常2-4个,Top-K路由),实际计算量可能仅相当于6-7B的Dense模型
1
Sources
50%
Confidence
Long-term
Relevance
7/20/2026
First Seen
Sources
Related Claims
UnverifiedMoE模型中'35B'指总参数量,每个token只激活少量Expert(通常2-4个),实际计算量可能仅相当于6-7B的Dense模型84% similarUnverifiedMoE 模型每次推理仅激活总参数量的一小部分,Qwen3 Max 每次推理激活量可能为总量的1/8至1/1674% similarUnverifiedKimi K2.7 Code采用384个专家的MoE架构,每个token选择8个专家加1个共享专家,实际计算量约为稠密模型的2.3%70% similarUnverified千问3.6的35B MOE模型每次只激活其中3B的参数70% similarVerifiedMixtral 8x7B模型拥有8个专家,每个Token只激活2个,总参数量达到47B,但单次推理的计算量仅相当于一个13B参数的稠密模型68% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/575452API
curl https://kongchang.com/api/v1/knowledge/claims/575452MCP
get_claim(id=575452)