待验证50% 置信事实精确时间
KV Cache内存占用与层数×注意力头数×上下文长度×精度成正比,GQA通过让多个查询头共享同一组Key-Value头来减少缓存量,Llama 2/3和Qwen系列已采用此设计
1
来源数
50%
置信度
长期有效
时效性
2026/9/3
首次发现
来源
涉及实体
相关事实
待验证KV Cache 通过在 GPU 显存中缓存已计算的 Key-Value 对,将自注意力计算复杂度从 O(N²) 降至 O(N),但显存占用随序列长度线性增长79% 相似待验证GQA 将注意力头分组共享 KV 投影,可将 KV 缓存压缩至原来的 1/4 甚至更低而几乎不损失模型质量77% 相似待验证KV缓存(Key-Value Cache)策略将已计算的注意力键值对存储在GPU显存中以供复用,会大量占用GPU内存资源77% 相似待验证MLA 将所有头的 Key 和 Value 联合压缩为低维潜在向量缓存,本质上是对 KV Cache 做低秩分解76% 相似已验证KV缓存将已计算的Key-Value矩阵存储在显存中实现增量计算,代价是显存占用随序列长度线性增长72% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/849956API
curl https://kongchang.com/api/v1/knowledge/claims/849956MCP
get_claim(id=849956)