RadixAttention是SGLang推理框架中提出的一种注意力机制优化技术,通过基数树(Radix Tree)数据结构对KV Cache进行统一管理,实现跨请求的键值缓存自动复用。其核心能力包括:在多轮对话、批量推理等场景中识别共享前缀并复用对应缓存,从而减少重复计算、降低显存占用、提升大语言模型的推理吞吐效率。
SGLang是由UC Berkeley LMSYS团队开发的高性能大模型推理和服务框架,通过RadixAttention等技术优化KV Cache的复用效率