待验证50% 置信基准精确时间
Llama 3 8B有32层、8个KV头(GQA架构,查询头32个)、头维度128,8192上下文FP16单序列下KV缓存约1.07GB
1
来源数
50%
置信度
长期有效
时效性
2026/8/12
首次发现
来源
相关事实
已验证以LLaMA-3 70B(80层、64头、每头128维)为例,单个token的KV Cache约占2.6MB(FP16精度),32K上下文的KV Cache总量约达83GB76% 相似待验证LLaMA-2 70B单条32K上下文长度序列在FP16下KV缓存可达约80GB75% 相似待验证4块RTX 3090 SXM4 GPU提供总计96GB显存空间,每块拥有24GB GDDR6X显存和10496个CUDA核心72% 相似待验证典型7B模型(32层、32头、128维度)在FP16精度下处理2048 token序列、批大小8时,KV Cache约消耗4GB显存71% 相似待验证GB200 NVL72的72块GPU可以按照NVLink拓扑结构划分为不同粒度的块,包括9个8-GPU块、4个18-GPU块、2个36-GPU块或1个72-GPU块70% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/735608API
curl https://kongchang.com/api/v1/knowledge/claims/735608MCP
get_claim(id=735608)