[控场AI]
概念Multi-head Latent Attention

MLA

DeepSeek设计的多头潜在注意力机制架构,DSpark投机解码算法针对该架构特点进行了专项工程优化

时间轴 (近 90 天)

8月26日

DeepSeek的前缀缓存实现基于MLA(Multi-head Latent Attention)架构,MLA通过低秩压缩将KV Cache的存储需求降低了数十倍

待验证50%

全部知识事实 (1)

来源文章