[控场AI]
产品DeepEP Ascend

DeepEP

DeepSeek开源的面向昇腾平台的MoE专家并行通信加速库,专注于解决混合专家模型的跨设备Dispatch/Combine通信问题,支持FP8数据类型

核心事实

时间轴 (近 90 天)

10月4日

DeepEP对应NCCL,负责多卡之间的通信;FlashMLA对应FlashAttention,用于超长文本处理;TileKernels对应CUTLASS;DeepSelect对应DALI这类数据管线

待验证50%
10月3日

MoE 层的跨卡通信由两个对称操作组成:Dispatch(派单)和 Combine(收答案),合起来构成一次 All-to-All 通信

待验证50%
10月3日

DeepEP 装包只装 host 端,kernel 在第一次运行时现场编译并缓存,下次直接复用

待验证50%
10月3日

DeepEP 将 Token 数据从 BF16 压缩为 FP8 E4M3,体积减半,并为每个 Token 附带一个 scale 因子用于还原,属于 per-token 量化粒度

待验证50%
10月3日

DeepEP README 验证了 Dispatch 环节 FP8 结果与参考答案的数值对齐,但未覆盖端到端对模型精度的影响

待验证50%
10月3日

设置 defer epilogue 后,Dispatch 只负责搬运,将 epilogue 打扫推迟到调用 event.current_stream.wait 时,中间空档可用于计算 shared expert,实现通信与计算重叠

待验证50%
10月1日

六个组件分工:DeepGEMM加速通用矩阵运算,DeepEP负责大规模跨设备通信,TileKernels提供常规向量计算和访存算子,FlashMLA提供稀疏注意力算子,DeepSelect做高效数据筛选

待验证50%
10月1日

2025年9月30日,DeepSeek开源了一批底层基础设施组件,包括算子、编程语言、计算库、通信库

已验证65%

全部知识事实 (8)

来源文章