待验证60% 置信事实精确时间
MoE 模型每次推理仅激活总参数量的一小部分,Qwen3 Max 每次推理激活量可能为总量的1/8至1/16
2
来源数
60%
置信度
长期有效
时效性
2026/7/23
首次发现
来源
相关事实
待验证MoE模型中'35B'指总参数量,每个token只激活少量Expert(通常2-4个),实际计算量可能仅相当于6-7B的Dense模型78% 相似待验证千问3.6的35B MOE模型每次只激活其中3B的参数78% 相似部分验证Qwen 3 Max和DeepSeek-V3均采用MoE架构,总参数量达数千亿,但实际推理激活参数仅为总量的一小部分77% 相似待验证在MoE模型中每个token只激活少量Expert(通常2-4个,Top-K路由),实际计算量可能仅相当于6-7B的Dense模型74% 相似待验证千问三235B MoE总参数量2350亿,但每次推理实际激活的参数约22B73% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/602608API
curl https://kongchang.com/api/v1/knowledge/claims/602608MCP
get_claim(id=602608)