待验证50% 置信事实精确时间
Gshard(2020)首次实现了万亿参数MoE模型的分布式训练,Switch Transformer(2022)将每个token的路由选择收敛为单一专家
1
来源数
50%
置信度
长期有效
时效性
2026/7/20
首次发现
来源
相关事实
待验证Switch Transformer将专家数量扩展至2048个,2022年谷歌GLaM模型进一步验证了MoE在多任务泛化上的优势77% 相似待验证Switch Transformer于2021年提出,将每次路由的专家数量精简为170% 相似已验证谷歌2021年发布的Switch Transformer将MoE大规模应用于Transformer语言模型,将模型容量扩展至万亿参数级别70% 相似已验证2017年Google提出Transformer架构,2018年出现BERT,2020年后出现GPT系列模型,将NLP推向预训练+微调的大模型时代68% 相似待验证Switch Transformer 由 William Fedus 等人于2021年提出,首次将 MoE 扩展到万亿参数规模62% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/567255API
curl https://kongchang.com/api/v1/knowledge/claims/567255MCP
get_claim(id=567255)