已验证75% 置信基准精确时间
以LLaMA-2 70B模型为例,2048 token的序列需约4GB显存仅用于KV缓存
3
来源数
75%
置信度
长期有效
时效性
2026/7/20
首次发现
来源
相关事实
已验证以LLaMA-2 70B为例,处理4096 token上下文、批量大小32时,KV Cache可消耗超过80GB显存80% 相似待验证对于 LLaMA-2 70B 模型,处理 4096 token 的上下文时,FP16 精度下 KV Cache 约需 20GB 系统内存78% 相似待验证对于一个32层、4096维的模型,处理2048个Token的KV Cache约占用1GB显存78% 相似待验证以 Llama-3 70B 为例,在 A100 80GB GPU 上处理 32K token 的预填充阶段约需 800-1200ms,而处理 2K token 仅需约 50ms76% 相似待验证以LLaMA-3 70B模型为例,在80层、head_dim=128、BF16精度下,每个token大约占用80KB的KV缓存74% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/573208API
curl https://kongchang.com/api/v1/knowledge/claims/573208MCP
get_claim(id=573208)