待验证60% 置信事实时间未知
M2.5采用混合专家架构(Mixture of Experts,MoE),每次推理只有10B参数真正参与计算,总参数量可能远超10B
2
来源数
60%
置信度
长期有效
时效性
2026/5/31
首次发现
来源
MiniMax M2.5实测:10B参数如何跑出旗舰级编程能力
bilibili程序员晓刘
涉及实体
相关事实
已验证混合专家架构(MoE)在推理时仅激活约10%-30%的总参数量,显著降低单次推理的FLOPs和显存占用74% 相似待验证Google DeepMind研究表明,涌现能力表现为非线性的相变特征,模型参数量从10B增长到100B过程中某些复杂推理能力会突然跃升70% 相似待验证MoE架构中,一个标称800亿参数的模型每次推理时可能只激活约200亿参数,VRAM占用大幅降低70% 相似待验证混合专家架构(MoE)每次推理只激活全部专家子网络中的一小部分,通常为10-20%70% 相似待验证参数量在1亿以下的轻量模型经领域数据微调后可达95%以上意图分类准确率,单次推理延迟控制在5-20ms以内69% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/13431API
curl https://kongchang.com/api/v1/knowledge/claims/13431MCP
get_claim(id=13431)