Unverified50% confidenceFactExact time
上下文越长,模型需要缓存的 KV Cache 越大,KV Cache 使模型生成新 Token 时无需重新计算所有历史 Token 的注意力权重
1
Sources
50%
Confidence
Long-term
Relevance
7/22/2026
First Seen
Sources
Related Claims
UnverifiedKV Cache(键值缓存)用于避免自回归生成时对历史 token 的重复计算,但长上下文场景下预填充阶段需占用大量 HBM 显存带宽,拉长首 token 延迟(TTFT)83% similarUnverified在长上下文场景(如128K token窗口模型)中,KV Cache的显存占用可能超过模型权重本身80% similarVerifiedKV Cache的显存占用随序列长度线性增长,700亿参数采用GQA的模型处理10万Token时KV Cache占用可能高达数十GB74% similarUnverifiedPrompt Caching通过复用相同前缀的KV Cache跳过重复计算,降低延迟和Token费用72% similarUnverified对于典型 7B 参数模型,每 1K token 的 KV Cache 约需 0.5–1GB 显存72% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/593011API
curl https://kongchang.com/api/v1/knowledge/claims/593011MCP
get_claim(id=593011)