Unverified50% confidenceFactExact time
DeepSeek-V2将每个Transformer层的FFN拆分为多个专家模块,通过门控网络动态路由,每个token只激活约10%的参数
1
Sources
50%
Confidence
Long-term
Relevance
8/24/2026
First Seen
Sources
Related Entities
Related Claims
UnverifiedDeepSeek采用MoE(混合专家模型)架构,与传统密集型Transformer模型每次推理激活全部参数不同,MoE每次推理由路由器动态选择少数专家参与计算67% similarVerifiedDeepSeek采用MOE(Mixture of Experts,混合专家)架构,每次推理时只激活部分专家子网络而非全部参数65% similarVerifiedDeepSeek-V3拥有671B参数但仅激活37B,采用256个路由专家加1个共享专家的架构,每个token选择8个专家处理62% similarUnverifiedDeepSeek + Dify + Ollama三者组合构成了一个从模型推理到应用编排的完整私有化技术栈62% similarUnverified精排层普遍使用深度学习模型如Wide&Deep、DeepFM或Transformer架构进行CTR预估和互动概率计算62% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/795622API
curl https://kongchang.com/api/v1/knowledge/claims/795622MCP
get_claim(id=795622)