SGLang
SGLang(Structured Generation Language)是一个面向大型语言模型的开源推理框架,旨在提升LLM服务的执行效率与编程灵活性。其核心特性包括:通过RadixAttention实现KV缓存的高效复用、支持结构化输出约束(如JSON模式)、以及提供简洁的前端编程接口用于构建复杂的多步骤推理流程。SGLang兼容多种主流模型架构及GPU硬件,适用于学术研究与生产环境下的高性能推理部署。
Timeline (last 90 days)
SGLang 采用缓存感知调度策略,优先调度能复用更多已有缓存的请求
SGLang 项目由 sgl-project 团队维护
SGLang 提供前端编程语言,支持编写包含多轮对话、控制流、并行调用及外部交互的复杂生成程序,并集成高效的约束解码引擎
RadixAttention 通过基数树结构在多个请求之间自动复用 KV Cache,管理共享前缀以减少重复计算,提升推理吞吐量
SGLang 发布了 v0.5.19 版本
SGLang 项目由 sgl-project 团队维护,在 GitHub 上已积累 35.5k Star 和 8.6k Fork
SGLang v0.5.19 可通过 pip 直接安装或升级到最新版本
SGLang 的 RadixAttention 技术能够在多个请求之间自动复用 KV Cache,通过基数树结构管理共享前缀以减少重复计算
SGLang(Structured Generation Language)是一个面向大语言模型和视觉语言模型的高性能服务框架
SGLang 发布了 v0.5.19 版本,由贡献者 Qiaolin-Yu 于 9 月 4 日打标发布(commit 0bcd822)
16 more timeline events
All Facts (20)
SGLang 采用缓存感知调度策略,优先调度能复用更多已有缓存的请求
50%UnverifiedSGLang 项目由 sgl-project 团队维护
50%UnverifiedRadixAttention 通过基数树结构在多个请求之间自动复用 KV Cache,管理共享前缀以减少重复计算,提升推理吞吐量
50%UnverifiedSGLang 提供前端编程语言,支持编写包含多轮对话、控制流、并行调用及外部交互的复杂生成程序,并集成高效的约束解码引擎
50%UnverifiedSGLang(Structured Generation Language)是一个面向大语言模型和视觉语言模型的高性能服务框架
50%UnverifiedSGLang v0.5.19 可通过 pip 直接安装或升级到最新版本
50%UnverifiedSGLang 的 RadixAttention 技术能够在多个请求之间自动复用 KV Cache,通过基数树结构管理共享前缀以减少重复计算
50%UnverifiedSGLang 项目由 sgl-project 团队维护,在 GitHub 上已积累 35.5k Star 和 8.6k Fork
50%Unverifiedllama.cpp、vLLM、SGLang、Ollama四种运行时对MTP功能有各自不同的命名和入口,且都不默认开启
50%UnverifiedSGLang由LMSYS开发,专注于结构化输出和复杂工作流,引入了RadixAttention机制,能自动检测并复用prompt的公共前缀
50%UnverifiedAdaptiveSpec在SGLang生产级服务引擎上实现,与EAGLE-3对比吞吐量提升最高达56%
50%Unverified通过--quantization quark_mxfp4,SGLang在加载时将NVFP4权重解量化并重新量化为MXFP4,在MiniMax-M2.7、GLM-5.1等模型上GSM8K准确率恢复达97.5%-100.2%
50%UnverifiedKimi K3在AMD MI355X上采用分组头MLA验证内核,在并发2-32时实现1.37-1.77倍吞吐量提升和1.45-2.42倍ITL改善
50%UnverifiedFlashInfer纯allreduce特性已为DeepSeek-V3/V3.2/V4自动启用,其他模型可通过--enable-flashinfer-pure-allreduce手动开启
50%Unverified通过--startup-weight-load-mode overlap可开启重叠式检查点加载特性
50%Unverified重叠式检查点分阶段加载让检查点页在CUDA graph捕获期间就从存储中并行分阶段载入
50%UnverifiedSGLang在GitHub上拥有超过34.1k Star
50%UnverifiedSGLang v0.5.18由212位贡献者提交的710个PR汇聚而成
50%UnverifiedSGLang是由UC Berkeley LMSYS团队开发的高性能大模型推理和服务框架,通过RadixAttention等技术优化KV Cache的复用效率
50%Unverified目前只有vLLM能在SM120显卡上跑通千问3.8 Flash Next的完整方案,SGLang暂不支持会在预热阶段崩溃,llama.cpp仍在优化合并请求中
50%