已验证75% 置信事实精确时间
KV Cache 通过在 GPU 显存中缓存已计算的 Key-Value 对,将自注意力计算复杂度从 O(N²) 降至 O(N),但显存占用随序列长度线性增长
3
来源数
75%
置信度
长期有效
时效性
2026/9/2
首次发现
来源
涉及实体
相关事实
待验证KV缓存(Key-Value Cache)策略将已计算的注意力键值对存储在GPU显存中以供复用,会大量占用GPU内存资源80% 相似已验证KV缓存将已计算的Key-Value矩阵存储在显存中实现增量计算,代价是显存占用随序列长度线性增长80% 相似待验证KV Cache内存占用与层数×注意力头数×上下文长度×精度成正比,GQA通过让多个查询头共享同一组Key-Value头来减少缓存量,Llama 2/3和Qwen系列已采用此设计79% 相似已验证KV Cache的显存占用随序列长度线性增长,700亿参数采用GQA的模型处理10万Token时KV Cache占用可能高达数十GB76% 相似待验证提示词缓存通过在服务器端保存已计算的 KV 矩阵,将重复前缀的处理从 O(n²) 降低至 O(1) 的缓存读取,可实现高达90%的延迟和成本压缩75% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/842837API
curl https://kongchang.com/api/v1/knowledge/claims/842837MCP
get_claim(id=842837)