[控场AI]
概念前缀缓存

Prefix Caching

大语言模型推理优化技术,将多个请求共享的相同前缀部分(如系统提示词)的KV计算结果持久化缓存,实现跨请求复用,从而减少重复计算、降低延迟并提升吞吐量

时间轴 (近 90 天)

9月23日

Prefix Caching实现请求间KV复用,vLLM采用block hash,SGLang采用radix tree

待验证50%
9月11日

PagedAttention 支持多个请求共享相同前缀的 KV Cache(Prefix Caching)

待验证50%
9月11日

vLLM 使用 Prefix Caching(前缀缓存)技术来复用相同前缀请求的 KV Cache

待验证50%
9月6日

vLLM当前实现存在bug:在前缀缓存中会把最后一个约16 token的缓存块直接丢弃并重新计算,即使请求命中了缓存

已过期50%
9月6日

当前缀缓存与DFlash2投机解码同时启用时,总吞吐量下降约37%,甚至比完全不开投机解码还要慢

已过期50%
9月6日

前缀缓存通过复用已计算的KV Cache,可节省50%-80%的prefill阶段计算量,vLLM通过基数树结构实现细粒度缓存命中匹配

待验证50%

全部知识事实 (4)

来源文章