Unverified50% confidenceTradeoffExact time
在100K+ Token长上下文场景下KV Cache可能成为显存瓶颈,催生了GQA、PagedAttention等优化技术
1
Sources
50%
Confidence
Long-term
Relevance
7/22/2026
First Seen
Sources
Related Claims
UnverifiedvLLM通过PagedAttention技术将KV Cache的内存碎片率从60%以上压缩至接近零,在高并发场景下可将推理吞吐量提升数倍73% similarUnverified在长上下文场景(如128K token窗口模型)中,KV Cache的显存占用可能超过模型权重本身72% similarUnverifiedvLLM的PagedAttention将KV Cache划分为固定大小物理块,通过块表实现地址映射,将碎片化率从60-80%降至不足4%,吞吐量提升可达24倍71% similarUnverified上下文越长,模型需要缓存的 KV Cache 越大,KV Cache 使模型生成新 Token 时无需重新计算所有历史 Token 的注意力权重71% similarVerifiedKV Cache的显存占用随序列长度线性增长,700亿参数采用GQA的模型处理10万Token时KV Cache占用可能高达数十GB71% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/587517API
curl https://kongchang.com/api/v1/knowledge/claims/587517MCP
get_claim(id=587517)