DeepEP Ascend
DeepSeek开源的面向华为昇腾平台的大规模跨设备通信组件,用于MoE架构中Token的Dispatch/Combine操作
时间轴 (近 90 天)
DeepEP Ascend 的公开 API 与 NVIDIA 版 DeepEP 完全对齐,包括 EP Buffer、Dispatch、Combine 以及 defer epilogue 参数,NVIDIA 卡上的代码移植到昇腾后 Python 层基本不用改
DeepSeek 将 DeepEP 通信库移植到国产昇腾 NPU,并在 GitHub 上开源,名为 DeepEP Ascend
昇腾版 DeepEP 必须使用展开式布局(Dispatch Expand),且目前是单一通信域
DeepEP Ascend 目前真正就绪的是 EP 跨卡派单机制,PP、bucket、ngram 等其他分工方式 API 已占位但实现尚未完成
DeepEP Ascend 在昇腾950上 Dispatch 的持续带宽能达到物理有效载荷上限的90%~95%,前提是EP规模不超过32;更大EP规模及Combine仍在优化中
开源清单包括 TileLang、DeepGEMM Ascend、DeepEP Ascend、TileKernels、FlashMLA 以及 DeepSelect,全部托管在 GitHub,许可证为 MIT
DeepSeek社区开源了面向昇腾平台的DeepEP Ascend与DeepGEMM Ascend两个底层加速项目
DeepEP提供四类Buffer:EP Buffer(专家并行Dispatch与Combine)、PP Buffer(流水线并行Send/Receive)、Ingram Buffer(Table写入与按层Fetch)、Bucket Buffer(分桶操作)
DeepEP在关键训练通信用例中通信带宽可以达到理论极限的90%以上
全部知识事实 (9)
DeepEP Ascend 的公开 API 与 NVIDIA 版 DeepEP 完全对齐,包括 EP Buffer、Dispatch、Combine 以及 defer epilogue 参数,NVIDIA 卡上的代码移植到昇腾后 Python 层基本不用改
50%待验证DeepEP Ascend 目前真正就绪的是 EP 跨卡派单机制,PP、bucket、ngram 等其他分工方式 API 已占位但实现尚未完成
50%待验证昇腾版 DeepEP 必须使用展开式布局(Dispatch Expand),且目前是单一通信域
50%待验证DeepEP Ascend 在昇腾950上 Dispatch 的持续带宽能达到物理有效载荷上限的90%~95%,前提是EP规模不超过32;更大EP规模及Combine仍在优化中
50%待验证DeepEP提供四类Buffer:EP Buffer(专家并行Dispatch与Combine)、PP Buffer(流水线并行Send/Receive)、Ingram Buffer(Table写入与按层Fetch)、Bucket Buffer(分桶操作)
50%待验证DeepEP在关键训练通信用例中通信带宽可以达到理论极限的90%以上
50%待验证DeepSeek 将 DeepEP 通信库移植到国产昇腾 NPU,并在 GitHub 上开源,名为 DeepEP Ascend
50%待验证开源清单包括 TileLang、DeepGEMM Ascend、DeepEP Ascend、TileKernels、FlashMLA 以及 DeepSelect,全部托管在 GitHub,许可证为 MIT
50%待验证DeepSeek社区开源了面向昇腾平台的DeepEP Ascend与DeepGEMM Ascend两个底层加速项目
50%