[控场AI]
概念前缀缓存 / Prefix KV Cache

Prefix Cache

大模型推理优化技术,在多轮对话中缓存固定前缀(如系统提示词)的KV计算结果,后续请求直接复用以减少重复计算、降低延迟和推理成本

时间轴 (近 90 天)

10月3日

SGLang v0.5.21 将前缀缓存的核心实现切换为 Rust 并设为默认后端

待验证50%
9月27日

Prefix Cache 优化是指当多轮对话中系统提示词保持不变时,API 服务端可缓存该前缀的 KV 计算结果供后续请求复用,减少重复计算、降低延迟和 Token 成本

待验证50%
9月11日

Prefix Cache按token前缀查找,查到第一个对不上的位置就停止

待验证50%

全部知识事实 (3)

来源文章