Unverified50% confidenceFactExact time
LLaMA-2 70B单条32K上下文长度序列在FP16下KV缓存可达约80GB
1
Sources
50%
Confidence
Long-term
Relevance
7/19/2026
First Seen
Sources
Related Claims
Verified以LLaMA-3 70B(80层、64头、每头128维)为例,单个token的KV Cache约占2.6MB(FP16精度),32K上下文的KV Cache总量约达83GB82% similarUnverifiedLLaMA-2-7B使用FP16精度时每个token的KV Cache约占0.5MB79% similarUnverifiedP100采用4颗HBM2堆叠,总带宽达732 GB/s,远超同期消费级GTX 1080的320 GB/s77% similarUnverified35B模型在FP16精度下需要约70GB显存,远超RTX 5090的32GB容量,因此单卡部署需量化76% similarUnverifiedLlama 3 8B有32层、8个KV头(GQA架构,查询头32个)、头维度128,8192上下文FP16单序列下KV缓存约1.07GB75% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/560956API
curl https://kongchang.com/api/v1/knowledge/claims/560956MCP
get_claim(id=560956)