待验证50% 置信事实精确时间
Google 2017年提出的Sparsely-Gated MoE首次将稀疏门控引入Transformer规模的序列模型,可在不显著增加计算量前提下将模型容量扩大1000倍以上
1
来源数
50%
置信度
长期有效
时效性
2026/7/24
首次发现
来源
相关事实
待验证Google 的 Switch Transformer(2021)和 Mistral 的 Mixtral 8x7B(2023)都采用了稀疏 MoE 架构,即每次前向传播只激活少数几个专家65% 相似待验证Switch Transformer和Mixtral系列广泛采用了MoE架构60% 相似待验证Blackwell的第二代Transformer Engine新增FP4精度支持,理论上可将Transformer模型的训练吞吐量相比H100提升2-4倍60% 相似待验证GShard于2020年首次在Transformer中实现了600B参数的MoE训练59% 相似待验证DiT(Diffusion Transformer)架构的参数量已达数十亿级别,单次推理的中间激活值在高分辨率下可占满80GB A100的全部显存59% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/604998API
curl https://kongchang.com/api/v1/knowledge/claims/604998MCP
get_claim(id=604998)