待验证50% 置信事实精确时间
LLaMA-2 70B单条32K上下文长度序列在FP16下KV缓存可达约80GB
1
来源数
50%
置信度
长期有效
时效性
2026/7/19
首次发现
来源
相关事实
已验证以LLaMA-3 70B(80层、64头、每头128维)为例,单个token的KV Cache约占2.6MB(FP16精度),32K上下文的KV Cache总量约达83GB82% 相似待验证LLaMA-2-7B使用FP16精度时每个token的KV Cache约占0.5MB79% 相似待验证P100采用4颗HBM2堆叠,总带宽达732 GB/s,远超同期消费级GTX 1080的320 GB/s77% 相似待验证35B模型在FP16精度下需要约70GB显存,远超RTX 5090的32GB容量,因此单卡部署需量化76% 相似待验证Llama 3 8B有32层、8个KV头(GQA架构,查询头32个)、头维度128,8192上下文FP16单序列下KV缓存约1.07GB75% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/560956API
curl https://kongchang.com/api/v1/knowledge/claims/560956MCP
get_claim(id=560956)