待验证50% 置信事实精确时间
缓存命中率在大模型API调用场景中指KV Cache(键值缓存)的复用比例,模型可直接从缓存中读取已处理token的注意力键值对
1
来源数
50%
置信度
长期有效
时效性
2026/9/4
首次发现
来源
涉及实体
相关事实
待验证KV缓存(Key-Value Cache)策略将已计算的注意力键值对存储在GPU显存中以供复用,会大量占用GPU内存资源79% 相似待验证上下文越长,模型需要缓存的 KV Cache 越大,KV Cache 使模型生成新 Token 时无需重新计算所有历史 Token 的注意力权重76% 相似待验证num_ctx 参数直接影响内存占用,KV缓存需要为每个上下文token存储注意力计算的中间状态74% 相似已验证智能体的记忆包括短期记忆(对话上下文窗口,通常4K~128K tokens)、长期记忆(向量数据库)和过程记忆(工具调用中间状态缓存)72% 相似待验证KV缓存的显存占用与上下文长度、模型层数和注意力头数成正比,8K上下文下一个典型27B模型可能额外消耗2~4GB显存72% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/852239API
curl https://kongchang.com/api/v1/knowledge/claims/852239MCP
get_claim(id=852239)