Unverified50% confidenceFactExact time
200K token的上下文请求相比8K token请求,需要约25倍的KV-Cache显存
1
Sources
50%
Confidence
Long-term
Relevance
7/15/2026
First Seen
Sources
Related Claims
Unverified以LLaMA-2 70B为例,处理4096 token上下文、批量大小32时,KV Cache可消耗超过80GB显存72% similarUnverified每轮工具调用平均产生2K Token的输入输出,到第20轮时仅工具调用历史记录就累积约40K Token70% similarUnverified当上下文长度扩展至百万Token时,KV Cache本身就会占用数十GB显存70% similarUnverified一个200K上下文窗口的请求,其KV Cache可能占据数十GB显存69% similarUnverifiedLLaMA-2-70B在128K上下文长度下单请求KV Cache可占用超过160GB显存69% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/523832API
curl https://kongchang.com/api/v1/knowledge/claims/523832MCP
get_claim(id=523832)