概念前缀缓存 / Prefix KV Cache
Prefix Cache
大模型推理优化技术,在多轮对话中缓存固定前缀(如系统提示词)的KV计算结果,后续请求直接复用以减少重复计算、降低延迟和推理成本
时间轴 (近 90 天)
10月3日
SGLang v0.5.21 将前缀缓存的核心实现切换为 Rust 并设为默认后端
待验证50%
9月27日
Prefix Cache 优化是指当多轮对话中系统提示词保持不变时,API 服务端可缓存该前缀的 KV 计算结果供后续请求复用,减少重复计算、降低延迟和 Token 成本
待验证50%
9月11日
Prefix Cache按token前缀查找,查到第一个对不上的位置就停止
待验证50%