Unverified60% confidenceFactExact time
MoE架构将标准Transformer的FFN层替换为N个并行专家子网络,并通过门控路由网络每次选择Top-K个专家进行计算(通常K=2),实现稀疏激活
2
Sources
60%
Confidence
Long-term
Relevance
7/22/2026
First Seen
Sources
Related Claims
VerifiedMoE架构将Transformer的前馈网络层替换为多个并行专家子网络,通过路由网络对每个token动态选择激活2-4个专家84% similarUnverified上下文缓存技术底层依赖Transformer的KV Cache机制,前缀相同的Key和Value向量可复用64% similarUnverifiedSwitch Transformer和Mixtral系列广泛采用了MoE架构63% similarUnverified主流Transformer架构通过KV Cache机制避免重复计算已处理的Token62% similarUnverified代表性等变神经网络架构包括SchNet、EGNN、SE(3)-Transformer,扩散框架相关模型包括FrameDiff、FoldFlow61% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/587199API
curl https://kongchang.com/api/v1/knowledge/claims/587199MCP
get_claim(id=587199)