Unverified90% confidenceFactTime unknown
MoE架构的显存占用与推理延迟按激活参数量计算,而非总参数量
1
Sources
90%
Confidence
Long-term
Relevance
5/31/2026
First Seen
Sources
MiniMax M2.5实测:10B参数如何跑出旗舰级编程能力
bilibili程序员晓刘
Related Entities
Related Claims
UnverifiedMoE架构通过路由器为每个token动态选择Top-K个专家进行计算,使参数总量可扩展而每次推理激活参数量维持不变80% similarUnverifiedMoE架构在任意时刻只有不到十分之一的参数实际参与计算,使模型在拥有大模型知识容量的同时保持小模型的推理速度和计算成本79% similarUnverifiedMoE模型在推理延迟和计算成本上往往优于同参数规模的Dense模型,但代价是需要更大显存加载全部专家权重78% similarUnverifiedMoE架构每次推理只激活Top-K个专家,总参数量远大于单次推理实际激活的参数量77% similarUnverified超大参数规模模型通常采用MoE(混合专家)架构,每次推理只激活一部分参数而非全量计算74% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/13433API
curl https://kongchang.com/api/v1/knowledge/claims/13433MCP
get_claim(id=13433)