Unverified50% confidenceFactExact time
对于 LLaMA-2 70B 模型,处理 4096 token 的上下文时,FP16 精度下 KV Cache 约需 20GB 系统内存
1
Sources
50%
Confidence
Long-term
Relevance
7/19/2026
First Seen
Sources
Related Claims
Unverified以LLaMA-2 70B为例,处理4096 token上下文、批量大小32时,KV Cache可消耗超过80GB显存79% similarUnverifiedLLaMA-2 7B 在 4096 Token 上下文下 KV Cache 约占 2 GB,扩展到 32K 上下文时可飙升至 16 GB 以上79% similarUnverified以LLaMA-2 70B模型为例,2048 token的序列需约4GB显存仅用于KV缓存78% similarUnverifiedLLaMA-2-70B在128K上下文长度下单请求KV Cache可占用超过160GB显存78% similarVerifiedKV Cache的显存占用随序列长度线性增长,700亿参数采用GQA的模型处理10万Token时KV Cache占用可能高达数十GB78% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/563763API
curl https://kongchang.com/api/v1/knowledge/claims/563763MCP
get_claim(id=563763)