Verified65% confidenceFactExact time
MoE架构仅激活部分专家网络,通常为总参数量的15-25%
3
Sources
65%
Confidence
Long-term
Relevance
7/25/2026
First Seen
Sources
小米静默发布MiMo-V2.5-DFlash:300B模型推理速度或将翻倍
redditr/LocalLLaMA7/12/2026
Related Claims
UnverifiedMoE架构在处理每个输入token时只激活一小部分专家子网络,通常为总专家数的1/8到1/1682% similarUnverified混合专家架构(MoE)每次推理只激活全部专家子网络中的一小部分,通常为10-20%76% similarVerifiedMoE架构每次推理时通常仅激活总参数的10%-20%75% similarVerified混合专家架构(MoE)在推理时仅激活约10%-30%的总参数量,显著降低单次推理的FLOPs和显存占用67% similarUnverifiedMoE架构最早由Jacobs等人于1991年提出,每次前向传播通常仅激活总参数的5%~20%65% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/613432API
curl https://kongchang.com/api/v1/knowledge/claims/613432MCP
get_claim(id=613432)