Unverified50% confidenceFactExact time
KV Cache内存占用与层数×注意力头数×上下文长度×精度成正比,GQA通过让多个查询头共享同一组Key-Value头来减少缓存量,Llama 2/3和Qwen系列已采用此设计
1
Sources
50%
Confidence
Long-term
Relevance
9/3/2026
First Seen
Sources
Related Entities
Related Claims
UnverifiedKV Cache 通过在 GPU 显存中缓存已计算的 Key-Value 对,将自注意力计算复杂度从 O(N²) 降至 O(N),但显存占用随序列长度线性增长79% similarUnverifiedGQA 将注意力头分组共享 KV 投影,可将 KV 缓存压缩至原来的 1/4 甚至更低而几乎不损失模型质量77% similarUnverifiedKV缓存(Key-Value Cache)策略将已计算的注意力键值对存储在GPU显存中以供复用,会大量占用GPU内存资源77% similarUnverifiedMLA 将所有头的 Key 和 Value 联合压缩为低维潜在向量缓存,本质上是对 KV Cache 做低秩分解76% similarVerifiedKV缓存将已计算的Key-Value矩阵存储在显存中实现增量计算,代价是显存占用随序列长度线性增长72% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/849956API
curl https://kongchang.com/api/v1/knowledge/claims/849956MCP
get_claim(id=849956)