DeepEP
DeepSeek开源的面向昇腾平台的MoE专家并行通信加速库,专注于解决混合专家模型的跨设备Dispatch/Combine通信问题,支持FP8数据类型
核心事实
时间轴 (近 90 天)
DeepEP对应NCCL,负责多卡之间的通信;FlashMLA对应FlashAttention,用于超长文本处理;TileKernels对应CUTLASS;DeepSelect对应DALI这类数据管线
MoE 层的跨卡通信由两个对称操作组成:Dispatch(派单)和 Combine(收答案),合起来构成一次 All-to-All 通信
DeepEP 装包只装 host 端,kernel 在第一次运行时现场编译并缓存,下次直接复用
DeepEP 将 Token 数据从 BF16 压缩为 FP8 E4M3,体积减半,并为每个 Token 附带一个 scale 因子用于还原,属于 per-token 量化粒度
DeepEP README 验证了 Dispatch 环节 FP8 结果与参考答案的数值对齐,但未覆盖端到端对模型精度的影响
设置 defer epilogue 后,Dispatch 只负责搬运,将 epilogue 打扫推迟到调用 event.current_stream.wait 时,中间空档可用于计算 shared expert,实现通信与计算重叠
六个组件分工:DeepGEMM加速通用矩阵运算,DeepEP负责大规模跨设备通信,TileKernels提供常规向量计算和访存算子,FlashMLA提供稀疏注意力算子,DeepSelect做高效数据筛选
2025年9月30日,DeepSeek开源了一批底层基础设施组件,包括算子、编程语言、计算库、通信库
全部知识事实 (8)
2025年9月30日,DeepSeek开源了一批底层基础设施组件,包括算子、编程语言、计算库、通信库
65%待验证DeepEP对应NCCL,负责多卡之间的通信;FlashMLA对应FlashAttention,用于超长文本处理;TileKernels对应CUTLASS;DeepSelect对应DALI这类数据管线
50%待验证MoE 层的跨卡通信由两个对称操作组成:Dispatch(派单)和 Combine(收答案),合起来构成一次 All-to-All 通信
50%待验证DeepEP 装包只装 host 端,kernel 在第一次运行时现场编译并缓存,下次直接复用
50%待验证DeepEP 将 Token 数据从 BF16 压缩为 FP8 E4M3,体积减半,并为每个 Token 附带一个 scale 因子用于还原,属于 per-token 量化粒度
50%待验证DeepEP README 验证了 Dispatch 环节 FP8 结果与参考答案的数值对齐,但未覆盖端到端对模型精度的影响
50%待验证设置 defer epilogue 后,Dispatch 只负责搬运,将 epilogue 打扫推迟到调用 event.current_stream.wait 时,中间空档可用于计算 shared expert,实现通信与计算重叠
50%待验证六个组件分工:DeepGEMM加速通用矩阵运算,DeepEP负责大规模跨设备通信,TileKernels提供常规向量计算和访存算子,FlashMLA提供稀疏注意力算子,DeepSelect做高效数据筛选
50%