[KongchangAI]
Product

SGLang

SGLang(Structured Generation Language)是一个面向大型语言模型的开源推理框架,旨在提升LLM服务的执行效率与编程灵活性。其核心特性包括:通过RadixAttention实现KV缓存的高效复用、支持结构化输出约束(如JSON模式)、以及提供简洁的前端编程接口用于构建复杂的多步骤推理流程。SGLang兼容多种主流模型架构及GPU硬件,适用于学术研究与生产环境下的高性能推理部署。

Timeline (last 90 days)

Sep 11

SGLang 采用缓存感知调度策略,优先调度能复用更多已有缓存的请求

Unverified50%
Sep 11

SGLang 项目由 sgl-project 团队维护

Unverified50%
Sep 10

SGLang 提供前端编程语言,支持编写包含多轮对话、控制流、并行调用及外部交互的复杂生成程序,并集成高效的约束解码引擎

Unverified50%
Sep 10

RadixAttention 通过基数树结构在多个请求之间自动复用 KV Cache,管理共享前缀以减少重复计算,提升推理吞吐量

Unverified50%
Sep 10

SGLang 发布了 v0.5.19 版本

Unverified50%
Sep 10

SGLang 项目由 sgl-project 团队维护,在 GitHub 上已积累 35.5k Star 和 8.6k Fork

Unverified50%
Sep 10

SGLang v0.5.19 可通过 pip 直接安装或升级到最新版本

Unverified50%
Sep 10

SGLang 的 RadixAttention 技术能够在多个请求之间自动复用 KV Cache,通过基数树结构管理共享前缀以减少重复计算

Unverified50%
Sep 10

SGLang(Structured Generation Language)是一个面向大语言模型和视觉语言模型的高性能服务框架

Unverified50%
Sep 10

SGLang 发布了 v0.5.19 版本,由贡献者 Qiaolin-Yu 于 9 月 4 日打标发布(commit 0bcd822)

Unverified50%

16 more timeline events

All Facts (20)

Unverified

SGLang 采用缓存感知调度策略,优先调度能复用更多已有缓存的请求

50%
Unverified

SGLang 项目由 sgl-project 团队维护

50%
Unverified

RadixAttention 通过基数树结构在多个请求之间自动复用 KV Cache,管理共享前缀以减少重复计算,提升推理吞吐量

50%
Unverified

SGLang 提供前端编程语言,支持编写包含多轮对话、控制流、并行调用及外部交互的复杂生成程序,并集成高效的约束解码引擎

50%
Unverified

SGLang(Structured Generation Language)是一个面向大语言模型和视觉语言模型的高性能服务框架

50%
Unverified

SGLang v0.5.19 可通过 pip 直接安装或升级到最新版本

50%
Unverified

SGLang 的 RadixAttention 技术能够在多个请求之间自动复用 KV Cache,通过基数树结构管理共享前缀以减少重复计算

50%
Unverified

SGLang 项目由 sgl-project 团队维护,在 GitHub 上已积累 35.5k Star 和 8.6k Fork

50%
Unverified

llama.cpp、vLLM、SGLang、Ollama四种运行时对MTP功能有各自不同的命名和入口,且都不默认开启

50%
Unverified

SGLang由LMSYS开发,专注于结构化输出和复杂工作流,引入了RadixAttention机制,能自动检测并复用prompt的公共前缀

50%
Unverified

AdaptiveSpec在SGLang生产级服务引擎上实现,与EAGLE-3对比吞吐量提升最高达56%

50%
Unverified

通过--quantization quark_mxfp4,SGLang在加载时将NVFP4权重解量化并重新量化为MXFP4,在MiniMax-M2.7、GLM-5.1等模型上GSM8K准确率恢复达97.5%-100.2%

50%
Unverified

Kimi K3在AMD MI355X上采用分组头MLA验证内核,在并发2-32时实现1.37-1.77倍吞吐量提升和1.45-2.42倍ITL改善

50%
Unverified

FlashInfer纯allreduce特性已为DeepSeek-V3/V3.2/V4自动启用,其他模型可通过--enable-flashinfer-pure-allreduce手动开启

50%
Unverified

通过--startup-weight-load-mode overlap可开启重叠式检查点加载特性

50%
Unverified

重叠式检查点分阶段加载让检查点页在CUDA graph捕获期间就从存储中并行分阶段载入

50%
Unverified

SGLang在GitHub上拥有超过34.1k Star

50%
Unverified

SGLang v0.5.18由212位贡献者提交的710个PR汇聚而成

50%
Unverified

SGLang是由UC Berkeley LMSYS团队开发的高性能大模型推理和服务框架,通过RadixAttention等技术优化KV Cache的复用效率

50%
Unverified

目前只有vLLM能在SM120显卡上跑通千问3.8 Flash Next的完整方案,SGLang暂不支持会在预热阶段崩溃,llama.cpp仍在优化合并请求中

50%

Source Articles