RadixAttention
RadixAttention是SGLang推理框架中提出的一种注意力机制优化技术,通过基数树(Radix Tree)数据结构对KV Cache进行统一管理,实现跨请求的键值缓存自动复用。其核心能力包括:在多轮对话、批量推理等场景中识别共享前缀并复用对应缓存,从而减少重复计算、降低显存占用、提升大语言模型的推理吞吐效率。
时间轴 (近 90 天)
SGLang的RadixAttention将prompt和生成结果的KV组织成RadixTree,公共前缀在上层,论文数据显示无前缀复用负载下额外开销低于0.3%
RadixAttention 通过基数树(Radix Tree)结构管理共享前缀以减少重复计算
在共享相同系统指令的并发请求场景中,RadixAttention 可将 prefill 阶段计算量减少 80% 以上
在共享系统指令的并发请求场景中,RadixAttention 可将 prefill 阶段的计算量减少 80% 以上
RadixAttention 通过基数树结构在多个请求之间自动复用 KV Cache,管理共享前缀以减少重复计算,提升推理吞吐量
SGLang 的 RadixAttention 技术能够在多个请求之间自动复用 KV Cache,通过基数树结构管理共享前缀以减少重复计算
SGLang由LMSYS开发,专注于结构化输出和复杂工作流,引入了RadixAttention机制,能自动检测并复用prompt的公共前缀
SGLang是由UC Berkeley LMSYS团队开发的高性能大模型推理和服务框架,通过RadixAttention等技术优化KV Cache的复用效率
全部知识事实 (8)
SGLang的RadixAttention将prompt和生成结果的KV组织成RadixTree,公共前缀在上层,论文数据显示无前缀复用负载下额外开销低于0.3%
50%待验证RadixAttention 通过基数树(Radix Tree)结构管理共享前缀以减少重复计算
50%待验证在共享相同系统指令的并发请求场景中,RadixAttention 可将 prefill 阶段计算量减少 80% 以上
50%待验证在共享系统指令的并发请求场景中,RadixAttention 可将 prefill 阶段的计算量减少 80% 以上
50%待验证RadixAttention 通过基数树结构在多个请求之间自动复用 KV Cache,管理共享前缀以减少重复计算,提升推理吞吐量
50%待验证SGLang 的 RadixAttention 技术能够在多个请求之间自动复用 KV Cache,通过基数树结构管理共享前缀以减少重复计算
50%待验证SGLang由LMSYS开发,专注于结构化输出和复杂工作流,引入了RadixAttention机制,能自动检测并复用prompt的公共前缀
50%待验证SGLang是由UC Berkeley LMSYS团队开发的高性能大模型推理和服务框架,通过RadixAttention等技术优化KV Cache的复用效率
50%