待验证50% 置信事实精确时间
MoE模型虽然计算量小,但整个模型仍需加载到内存中,因此对内存总量要求不低,但对内存带宽压力因每次只读取激活参数而大幅降低
1
来源数
50%
置信度
长期有效
时效性
2026/9/10
首次发现
来源
涉及实体
相关事实
待验证MoE模型采用稀疏激活,Qwen 3.5 122B总参数122B但每次推理仅激活约10B,需将全部参数加载进内存,对内存容量极度敏感72% 相似待验证自回归推理是memory-bound(内存带宽受限)问题,因为batch size通常为1时算术强度极低,GPU大部分时间在等待数据搬运72% 相似待验证MoE模型每次只读取激活的部分参数,速度比同量级稠密模型快得多,例如GLM 5.3 Flash每token仅读约30GB71% 相似待验证当显存不足时,系统会将模型的一部分卸载到主内存中运行,此时主内存的容量与带宽直接影响推理速度71% 相似待验证模型规模越大,记忆能力反而越强,因为更大的模型拥有更强的参数容量来存储低频样本70% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/888682API
curl https://kongchang.com/api/v1/knowledge/claims/888682MCP
get_claim(id=888682)