Unverified50% confidenceBenchmarkExact time
Llama 3 8B有32层、8个KV头(GQA架构,查询头32个)、头维度128,8192上下文FP16单序列下KV缓存约1.07GB
1
Sources
50%
Confidence
Long-term
Relevance
8/12/2026
First Seen
Sources
Related Claims
Verified以LLaMA-3 70B(80层、64头、每头128维)为例,单个token的KV Cache约占2.6MB(FP16精度),32K上下文的KV Cache总量约达83GB76% similarUnverifiedLLaMA-2 70B单条32K上下文长度序列在FP16下KV缓存可达约80GB75% similarUnverified4块RTX 3090 SXM4 GPU提供总计96GB显存空间,每块拥有24GB GDDR6X显存和10496个CUDA核心72% similarUnverified典型7B模型(32层、32头、128维度)在FP16精度下处理2048 token序列、批大小8时,KV Cache约消耗4GB显存71% similarUnverifiedGB200 NVL72的72块GPU可以按照NVLink拓扑结构划分为不同粒度的块,包括9个8-GPU块、4个18-GPU块、2个36-GPU块或1个72-GPU块70% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/735608API
curl https://kongchang.com/api/v1/knowledge/claims/735608MCP
get_claim(id=735608)