待验证50% 置信事实时间未知
The Hybrid Compressed Attention mechanism in DeepSeek V4 compresses KV Cache by aggregating Key-Value pairs from multiple tokens into more compact representations.
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/2
首次发现
有效期至:2026/9/30
来源
相关事实
待验证DeepSeek-V2提出MLA(Multi-head Latent Attention),通过低秩压缩将KV Cache压缩至MHA的5%左右70% 相似待验证DeepSeek V4引入了N-gram记忆架构,将静态知识存储在CPU内存中而非GPU显存中69% 相似已验证DeepSeek V4采用自研的分层压缩注意力策略,设计了CSA(压缩吸收注意力)和HCA(重度压缩注意力)两种注意力模式交替使用69% 相似已验证MLA(多头潜在注意力)由DeepSeek团队在DeepSeek-V2中首次提出,通过将Key-Value对压缩到低维潜在空间大幅降低KV Cache显存占用68% 相似待验证DeepSeek在多头潜在注意力(MLA)和FP8混合精度训练方向上的创新将KV Cache内存占用压缩至标准多头注意力的5%-13%68% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/59647API
curl https://kongchang.com/api/v1/knowledge/claims/59647MCP
get_claim(id=59647)