待验证50% 置信事实精确时间
上下文越长,模型需要缓存的 KV Cache 越大,KV Cache 使模型生成新 Token 时无需重新计算所有历史 Token 的注意力权重
1
来源数
50%
置信度
长期有效
时效性
2026/7/22
首次发现
来源
相关事实
待验证KV Cache(键值缓存)用于避免自回归生成时对历史 token 的重复计算,但长上下文场景下预填充阶段需占用大量 HBM 显存带宽,拉长首 token 延迟(TTFT)83% 相似待验证在长上下文场景(如128K token窗口模型)中,KV Cache的显存占用可能超过模型权重本身80% 相似已验证KV Cache的显存占用随序列长度线性增长,700亿参数采用GQA的模型处理10万Token时KV Cache占用可能高达数十GB74% 相似待验证Prompt Caching通过复用相同前缀的KV Cache跳过重复计算,降低延迟和Token费用72% 相似待验证对于典型 7B 参数模型,每 1K token 的 KV Cache 约需 0.5–1GB 显存72% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/593011API
curl https://kongchang.com/api/v1/knowledge/claims/593011MCP
get_claim(id=593011)