待验证50% 置信事实精确时间
对于 LLaMA-2 70B 模型,处理 4096 token 的上下文时,FP16 精度下 KV Cache 约需 20GB 系统内存
1
来源数
50%
置信度
长期有效
时效性
2026/7/19
首次发现
来源
相关事实
待验证以LLaMA-2 70B为例,处理4096 token上下文、批量大小32时,KV Cache可消耗超过80GB显存79% 相似待验证LLaMA-2 7B 在 4096 Token 上下文下 KV Cache 约占 2 GB,扩展到 32K 上下文时可飙升至 16 GB 以上79% 相似待验证以LLaMA-2 70B模型为例,2048 token的序列需约4GB显存仅用于KV缓存78% 相似待验证LLaMA-2-70B在128K上下文长度下单请求KV Cache可占用超过160GB显存78% 相似已验证KV Cache的显存占用随序列长度线性增长,700亿参数采用GQA的模型处理10万Token时KV Cache占用可能高达数十GB78% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/563763API
curl https://kongchang.com/api/v1/knowledge/claims/563763MCP
get_claim(id=563763)