待验证50% 置信事实精确时间
LLaMA-3 70B权重约140GB,推理时每生成一个Token都需要完整遍历一次权重
1
来源数
50%
置信度
长期有效
时效性
2026/7/19
首次发现
来源
相关事实
待验证LLaMA-2-70B在128K上下文长度下单请求KV Cache可占用超过160GB显存77% 相似待验证以LLaMA-2 70B为例,处理4096 token上下文、批量大小32时,KV Cache可消耗超过80GB显存76% 相似待验证对于 LLaMA-2 70B 模型,处理 4096 token 的上下文时,FP16 精度下 KV Cache 约需 20GB 系统内存72% 相似待验证An M4 Max with 128GB unified memory can directly hold large model weights72% 相似待验证Meta的LLaMA 2 70B模型即便使用4-bit量化仍需约35GB显存才能完整加载72% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/559601API
curl https://kongchang.com/api/v1/knowledge/claims/559601MCP
get_claim(id=559601)