待验证50% 置信事实精确时间
LLaMA-2-70B在128K上下文长度下单请求KV Cache可占用超过160GB显存
1
来源数
50%
置信度
长期有效
时效性
2026/7/14
首次发现
来源
相关事实
待验证以LLaMA-2 70B为例,处理4096 token上下文、批量大小32时,KV Cache可消耗超过80GB显存82% 相似待验证LLaMA-2 7B 在 4096 Token 上下文下 KV Cache 约占 2 GB,扩展到 32K 上下文时可飙升至 16 GB 以上81% 相似待验证支持128K上下文的70B参数模型的KV Cache满负荷时可能需要数百GB显存,超过单张H100的80GB显存容量78% 相似待验证对于 LLaMA-2 70B 模型,处理 4096 token 的上下文时,FP16 精度下 KV Cache 约需 20GB 系统内存78% 相似待验证LLaMA-3 70B权重约140GB,推理时每生成一个Token都需要完整遍历一次权重77% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/503793API
curl https://kongchang.com/api/v1/knowledge/claims/503793MCP
get_claim(id=503793)