[KongchangAI]
ConceptKV cache offload

KV Cache

KV Cache(键值缓存)是Transformer模型推理过程中的一种优化机制,用于缓存注意力计算中每个token对应的键(Key)和值(Value)向量。在自回归生成任务中,模型每步生成新token时无需重新计算历史token的键值对,而是直接复用缓存结果,从而显著降低重复计算量、提升推理效率。该机制以增加显存占用为代价换取计算速度的提升,是大语言模型部署优化的核心技术之一。

Timeline (last 90 days)

Jun 1

传统LLM推理中KV Cache的内存管理导致60%-80%的显存被浪费

Unverified75%
Jun 1

传统LLM推理中KV Cache的显存浪费率可达60-80%

Unverified70%
Jun 1

传统LLM推理中,KV Cache的内存管理导致60%-80%的GPU显存被浪费

Unverified75%
Jun 1

Transformers框架近期对视频生成模型、推理优化(如量化、KV Cache)等方向的支持力度明显加大

Unverified75%
Jun 1

推测解码、模型蒸馏、KV Cache优化等推理优化技术的持续进步正在使单位推理成本快速下降

Unverified85%
Jun 1

Dynamo提供分布式KV Cache管理、请求级别的动态路由、GPU资源的细粒度调度等能力

Unverified85%
Jun 1

DeepSeek API对缓存命中的Token提供显著折扣

Verified70%
Jun 1

KV Cache是Transformer架构的核心推理优化机制,其显存占用量会随序列长度和并发批次线性增长

Verified80%
Jun 1

PagedAttention技术借鉴操作系统虚拟内存的分页思想,将KV Cache切分为固定大小的物理块动态分配

Verified80%
Jun 1

对于70B参数的模型,8K上下文的KV Cache可能额外占用数GB显存

Unverified75%

8 more timeline events

Source Articles