[KongchangAI]
Concept前缀缓存

Prefix Caching

大语言模型推理优化技术,将多个请求共享的相同前缀部分(如系统提示词)的KV计算结果持久化缓存,实现跨请求复用,从而减少重复计算、降低延迟并提升吞吐量

Timeline (last 90 days)

Sep 23

Prefix Caching实现请求间KV复用,vLLM采用block hash,SGLang采用radix tree

Unverified50%
Sep 11

PagedAttention 支持多个请求共享相同前缀的 KV Cache(Prefix Caching)

Unverified50%
Sep 11

vLLM 使用 Prefix Caching(前缀缓存)技术来复用相同前缀请求的 KV Cache

Unverified50%
Sep 6

vLLM当前实现存在bug:在前缀缓存中会把最后一个约16 token的缓存块直接丢弃并重新计算,即使请求命中了缓存

Expired50%
Sep 6

当前缀缓存与DFlash2投机解码同时启用时,总吞吐量下降约37%,甚至比完全不开投机解码还要慢

Expired50%
Sep 6

前缀缓存通过复用已计算的KV Cache,可节省50%-80%的prefill阶段计算量,vLLM通过基数树结构实现细粒度缓存命中匹配

Unverified50%

All Facts (4)

Source Articles