FlashMLA
DeepSeek开源的稀疏注意力算子库,用于提升大模型长上下文处理效率,支持NVIDIA和华为昇腾平台
核心事实
时间轴 (近 90 天)
DeepEP对应NCCL,负责多卡之间的通信;FlashMLA对应FlashAttention,用于超长文本处理;TileKernels对应CUTLASS;DeepSelect对应DALI这类数据管线
开源清单包括 TileLang、DeepGEMM Ascend、DeepEP Ascend、TileKernels、FlashMLA 以及 DeepSelect,全部托管在 GitHub,许可证为 MIT
六个组件分工:DeepGEMM加速通用矩阵运算,DeepEP负责大规模跨设备通信,TileKernels提供常规向量计算和访存算子,FlashMLA提供稀疏注意力算子,DeepSelect做高效数据筛选
FlashMLA在昇腾950上稀疏注意力算子的预填充吞吐做到410 TFLOPS(硬件理论峰值的95%),解码360 TFLOPS(占83%),均为DeepSeek自己公布,无第三方实测
FlashMLA此次发布为破坏性变更,移除了对Hopper架构及V3、V3.2、V4.0的支持,并更改了FP8和FP4的KV Cache格式,与旧版本不兼容
2025年9月30日,DeepSeek开源了一批底层基础设施组件,包括算子、编程语言、计算库、通信库
全部知识事实 (6)
2025年9月30日,DeepSeek开源了一批底层基础设施组件,包括算子、编程语言、计算库、通信库
65%待验证DeepEP对应NCCL,负责多卡之间的通信;FlashMLA对应FlashAttention,用于超长文本处理;TileKernels对应CUTLASS;DeepSelect对应DALI这类数据管线
50%待验证六个组件分工:DeepGEMM加速通用矩阵运算,DeepEP负责大规模跨设备通信,TileKernels提供常规向量计算和访存算子,FlashMLA提供稀疏注意力算子,DeepSelect做高效数据筛选
50%待验证FlashMLA在昇腾950上稀疏注意力算子的预填充吞吐做到410 TFLOPS(硬件理论峰值的95%),解码360 TFLOPS(占83%),均为DeepSeek自己公布,无第三方实测
50%待验证开源清单包括 TileLang、DeepGEMM Ascend、DeepEP Ascend、TileKernels、FlashMLA 以及 DeepSelect,全部托管在 GitHub,许可证为 MIT
50%待验证FlashMLA此次发布为破坏性变更,移除了对Hopper架构及V3、V3.2、V4.0的支持,并更改了FP8和FP4的KV Cache格式,与旧版本不兼容
50%