待验证60% 置信事实精确时间
MoE架构将标准Transformer的FFN层替换为N个并行专家子网络,并通过门控路由网络每次选择Top-K个专家进行计算(通常K=2),实现稀疏激活
2
来源数
60%
置信度
长期有效
时效性
2026/7/22
首次发现
来源
相关事实
已验证MoE架构将Transformer的前馈网络层替换为多个并行专家子网络,通过路由网络对每个token动态选择激活2-4个专家84% 相似待验证上下文缓存技术底层依赖Transformer的KV Cache机制,前缀相同的Key和Value向量可复用64% 相似待验证Switch Transformer和Mixtral系列广泛采用了MoE架构63% 相似待验证主流Transformer架构通过KV Cache机制避免重复计算已处理的Token62% 相似待验证代表性等变神经网络架构包括SchNet、EGNN、SE(3)-Transformer,扩散框架相关模型包括FrameDiff、FoldFlow61% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/587199API
curl https://kongchang.com/api/v1/knowledge/claims/587199MCP
get_claim(id=587199)