Verified75% confidenceFactExact time
KV Cache 通过在 GPU 显存中缓存已计算的 Key-Value 对,将自注意力计算复杂度从 O(N²) 降至 O(N),但显存占用随序列长度线性增长
3
Sources
75%
Confidence
Long-term
Relevance
9/2/2026
First Seen
Sources
Related Entities
Related Claims
UnverifiedKV缓存(Key-Value Cache)策略将已计算的注意力键值对存储在GPU显存中以供复用,会大量占用GPU内存资源80% similarVerifiedKV缓存将已计算的Key-Value矩阵存储在显存中实现增量计算,代价是显存占用随序列长度线性增长80% similarUnverifiedKV Cache内存占用与层数×注意力头数×上下文长度×精度成正比,GQA通过让多个查询头共享同一组Key-Value头来减少缓存量,Llama 2/3和Qwen系列已采用此设计79% similarVerifiedKV Cache的显存占用随序列长度线性增长,700亿参数采用GQA的模型处理10万Token时KV Cache占用可能高达数十GB76% similarUnverified提示词缓存通过在服务器端保存已计算的 KV 矩阵,将重复前缀的处理从 O(n²) 降低至 O(1) 的缓存读取,可实现高达90%的延迟和成本压缩75% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/842837API
curl https://kongchang.com/api/v1/knowledge/claims/842837MCP
get_claim(id=842837)