待验证50% 置信事实精确时间
在长上下文场景(如128K token窗口模型)中,KV Cache的显存占用可能超过模型权重本身
1
来源数
50%
置信度
长期有效
时效性
2026/7/17
首次发现
来源
相关事实
待验证上下文越长,模型需要缓存的 KV Cache 越大,KV Cache 使模型生成新 Token 时无需重新计算所有历史 Token 的注意力权重80% 相似待验证数千亿参数模型处理128K上下文窗口时,KV Cache可能占据数十GB显存77% 相似待验证传统LLM推理引擎在处理KV Cache时存在严重的内存碎片问题,对于13B参数模型,单个请求的KV Cache可能占用数GB内存,而实际利用率可能低于50%76% 相似待验证对于70B参数的模型,8K上下文的KV Cache可能额外占用数GB显存76% 相似待验证不同大模型在上下文窗口大小方面存在显著差异,从8K到128K tokens不等76% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/544850API
curl https://kongchang.com/api/v1/knowledge/claims/544850MCP
get_claim(id=544850)