待验证90% 置信事实时间未知
上下文长度从4K扩展到8K时,KV Cache占用的显存会近乎翻倍
1
来源数
90%
置信度
长期有效
时效性
2026/6/1
首次发现
来源
本地部署大模型怎么判断显存爆了?一文看懂显存监控方法
bilibili步步梅
涉及实体
相关事实
待验证当上下文长度扩展至百万Token时,KV Cache本身就会占用数十GB显存79% 相似待验证LLaMA-2 7B 在 4096 Token 上下文下 KV Cache 约占 2 GB,扩展到 32K 上下文时可飙升至 16 GB 以上75% 相似已验证KV Cache的显存占用随序列长度线性增长,700亿参数采用GQA的模型处理10万Token时KV Cache占用可能高达数十GB74% 相似待验证KV缓存的显存占用与上下文长度、模型层数和注意力头数成正比,8K上下文下一个典型27B模型可能额外消耗2~4GB显存72% 相似待验证对于70B参数的模型,8K上下文的KV Cache可能额外占用数GB显存71% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/17566API
curl https://kongchang.com/api/v1/knowledge/claims/17566MCP
get_claim(id=17566)