已验证65% 置信权衡取舍精确时间
KV Cache占用的显存随序列长度线性增长
3
来源数
65%
置信度
长期有效
时效性
2026/7/11
首次发现
来源
vLLM推理框架详解:吞吐优化核心原理与面试攻略
bilibiliAI大模型升升2026/6/9
相关事实
已验证KV Cache的显存占用随序列长度线性增长,700亿参数采用GQA的模型处理10万Token时KV Cache占用可能高达数十GB82% 相似待验证KV缓存将已计算的Key-Value矩阵存储在显存中实现增量计算,代价是显存占用随序列长度线性增长79% 相似待验证KV缓存随上下文长度增加,显存占用可达总显存的60%以上74% 相似待验证KV Cache(键值缓存)用于避免自回归生成时对历史 token 的重复计算,但长上下文场景下预填充阶段需占用大量 HBM 显存带宽,拉长首 token 延迟(TTFT)70% 相似待验证上下文越长,模型需要缓存的 KV Cache 越大,KV Cache 使模型生成新 Token 时无需重新计算所有历史 Token 的注意力权重70% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/488192API
curl https://kongchang.com/api/v1/knowledge/claims/488192MCP
get_claim(id=488192)