ConceptKV cache offload
KV Cache
KV Cache(键值缓存)是Transformer模型推理过程中的一种优化机制,用于缓存注意力计算中每个token对应的键(Key)和值(Value)向量。在自回归生成任务中,模型每步生成新token时无需重新计算历史token的键值对,而是直接复用缓存结果,从而显著降低重复计算量、提升推理效率。该机制以增加显存占用为代价换取计算速度的提升,是大语言模型部署优化的核心技术之一。
Timeline (last 90 days)
Jun 1
传统LLM推理中KV Cache的内存管理导致60%-80%的显存被浪费
Unverified75%
Jun 1
传统LLM推理中KV Cache的显存浪费率可达60-80%
Unverified70%
Jun 1
传统LLM推理中,KV Cache的内存管理导致60%-80%的GPU显存被浪费
Unverified75%
Jun 1
Transformers框架近期对视频生成模型、推理优化(如量化、KV Cache)等方向的支持力度明显加大
Unverified75%
Jun 1
推测解码、模型蒸馏、KV Cache优化等推理优化技术的持续进步正在使单位推理成本快速下降
Unverified85%
Jun 1
Dynamo提供分布式KV Cache管理、请求级别的动态路由、GPU资源的细粒度调度等能力
Unverified85%
Jun 1
DeepSeek API对缓存命中的Token提供显著折扣
Verified70%
Jun 1
KV Cache是Transformer架构的核心推理优化机制,其显存占用量会随序列长度和并发批次线性增长
Verified80%
Jun 1
PagedAttention技术借鉴操作系统虚拟内存的分页思想,将KV Cache切分为固定大小的物理块动态分配
Verified80%
Jun 1
对于70B参数的模型,8K上下文的KV Cache可能额外占用数GB显存
Unverified75%
8 more timeline events
Source Articles
Claude Code接入开源模型缓存不命中?原因与解决方案详解Jul 20Pi Agent深度解析:极简开源框架的四大核心优势Jul 20Goku:基于WebAssembly的浏览器端LLM推理引擎与模型管理器Jul 20Bernini分块生成:ComfyUI视频超分的工程化新解法Jul 20Kimi K3开源领衔:AI编程agent框架透明化竞赛全解析Jul 19AirLLM:4GB显卡跑70B大模型的核心原理与适用场景Jul 19GLM国产开源模型:百万Token上下文能否挑战Claude Code?Jul 19Gemini Spark深度集成Workspace,Google即将开放AI Pro高级权限Jul 19