概念前缀缓存
Prefix Caching
大语言模型推理优化技术,将多个请求共享的相同前缀部分(如系统提示词)的KV计算结果持久化缓存,实现跨请求复用,从而减少重复计算、降低延迟并提升吞吐量
时间轴 (近 90 天)
9月23日
Prefix Caching实现请求间KV复用,vLLM采用block hash,SGLang采用radix tree
待验证50%
9月11日
PagedAttention 支持多个请求共享相同前缀的 KV Cache(Prefix Caching)
待验证50%
9月11日
vLLM 使用 Prefix Caching(前缀缓存)技术来复用相同前缀请求的 KV Cache
待验证50%
9月6日
vLLM当前实现存在bug:在前缀缓存中会把最后一个约16 token的缓存块直接丢弃并重新计算,即使请求命中了缓存
已过期50%
9月6日
当前缀缓存与DFlash2投机解码同时启用时,总吞吐量下降约37%,甚至比完全不开投机解码还要慢
已过期50%
9月6日
前缀缓存通过复用已计算的KV Cache,可节省50%-80%的prefill阶段计算量,vLLM通过基数树结构实现细粒度缓存命中匹配
待验证50%