[控场AI]
产品

FlashMLA

DeepSeek开源的稀疏注意力算子库,用于提升大模型长上下文处理效率,支持NVIDIA和华为昇腾平台

核心事实

时间轴 (近 90 天)

10月4日

DeepEP对应NCCL,负责多卡之间的通信;FlashMLA对应FlashAttention,用于超长文本处理;TileKernels对应CUTLASS;DeepSelect对应DALI这类数据管线

待验证50%
10月1日

开源清单包括 TileLang、DeepGEMM Ascend、DeepEP Ascend、TileKernels、FlashMLA 以及 DeepSelect,全部托管在 GitHub,许可证为 MIT

待验证50%
10月1日

六个组件分工:DeepGEMM加速通用矩阵运算,DeepEP负责大规模跨设备通信,TileKernels提供常规向量计算和访存算子,FlashMLA提供稀疏注意力算子,DeepSelect做高效数据筛选

待验证50%
10月1日

FlashMLA在昇腾950上稀疏注意力算子的预填充吞吐做到410 TFLOPS(硬件理论峰值的95%),解码360 TFLOPS(占83%),均为DeepSeek自己公布,无第三方实测

待验证50%
10月1日

FlashMLA此次发布为破坏性变更,移除了对Hopper架构及V3、V3.2、V4.0的支持,并更改了FP8和FP4的KV Cache格式,与旧版本不兼容

待验证50%
10月1日

2025年9月30日,DeepSeek开源了一批底层基础设施组件,包括算子、编程语言、计算库、通信库

已验证65%

全部知识事实 (6)

来源文章