Verified75% confidenceFactTime unknown
MLA将KV对压缩到低维潜在空间中进行缓存,推理时通过上投影矩阵恢复完整的Key和Value,将KV缓存压缩了数倍
3
Sources
75%
Confidence
Long-term
Relevance
6/1/2026
First Seen
Sources
DeepSeek-V3.2-Exp发现RoPE实现Bug:交错格式不匹配导致推理性能下降
twitterdeepseek_ai
Related Entities
Related Claims
Verified多头潜在注意力机制(MLA)通过将KV投影到低维潜在空间压缩存储,将KV Cache显存占用降低至传统方法的5%至13%80% similarUnverifiedMLA通过将KV矩阵压缩为低维潜在向量缓存,理论上可将KV Cache显存占用降低至标准MHA的5%至13%79% similarUnverifiedMLA将高维K、V矩阵投影至低秩潜在空间,压缩比可达8-16倍79% similarUnverifiedMLA 将所有头的 Key 和 Value 联合压缩为低维潜在向量缓存,本质上是对 KV Cache 做低秩分解79% similarUnverified量化KV缓存(如FP8或INT4存储KV向量)可将缓存大小压缩到原来的1/2甚至1/474% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/27882API
curl https://kongchang.com/api/v1/knowledge/claims/27882MCP
get_claim(id=27882)