ConceptMulti-head Latent Attention
MLA
DeepSeek设计的多头潜在注意力机制架构,DSpark投机解码算法针对该架构特点进行了专项工程优化
Timeline (last 90 days)
Aug 26
DeepSeek的前缀缓存实现基于MLA(Multi-head Latent Attention)架构,MLA通过低秩压缩将KV Cache的存储需求降低了数十倍
Unverified50%
DeepSeek设计的多头潜在注意力机制架构,DSpark投机解码算法针对该架构特点进行了专项工程优化
DeepSeek的前缀缓存实现基于MLA(Multi-head Latent Attention)架构,MLA通过低秩压缩将KV Cache的存储需求降低了数十倍