SGLang
SGLang(Structured Generation Language)是一个面向大型语言模型的开源推理框架,旨在提升LLM服务的执行效率与编程灵活性。其核心特性包括:通过RadixAttention实现KV缓存的高效复用、支持结构化输出约束(如JSON模式)、以及提供简洁的前端编程接口用于构建复杂的多步骤推理流程。SGLang兼容多种主流模型架构及GPU硬件,适用于学术研究与生产环境下的高性能推理部署。
时间轴 (近 90 天)
vLLM、TensorRT-LLM、SGLang已被广泛用于生产环境,代表当前开源推理生态的较高水位
SGLang专注于结构化生成与复杂推理流程的调度效率
使用 SGLang 时配官方权重的效果优于配 Unsloth 量化
SGLang 使用官方 NVFP4 权重配合 D-Spark 投机解码在 Blackwell GPU 上跑出平均约 173 tokens/秒,短任务逼近 200,同时加载 262k 上下文窗口
vLLM、SGLang、llama.cpp 是目前最常用的三大推理框架,其共同特点是需要适配几百种模型架构和各种量化格式及硬件,导致架构臃肿、性能只能折中
vLLM 和 SGLang 属于服务型推理框架,支持连续批处理(Continuous Batching)、PagedAttention 等技术以最大化并发吞吐量
推理引擎领域除vLLM外,还有TensorRT-LLM、SGLang、TGI等多个方案在竞争市场份额
SGLang的RadixAttention将prompt和生成结果的KV组织成RadixTree,公共前缀在上层,论文数据显示无前缀复用负载下额外开销低于0.3%
在企业和服务端场景,经过校准的INT4(W4A16)格式如AWQ、GPTQ和AutoRound通过vLLM或SGLang部署到独立加速器时是行业标准
SGLang 源自伯克利,侧重于通过结构化生成语言优化复杂推理流水线,支持前缀缓存复用和正则表达式约束解码
还有 37 条时间轴事件
全部知识事实 (20)
SGLang专注于结构化生成与复杂推理流程的调度效率
50%待验证vLLM、TensorRT-LLM、SGLang已被广泛用于生产环境,代表当前开源推理生态的较高水位
50%待验证SGLang 使用官方 NVFP4 权重配合 D-Spark 投机解码在 Blackwell GPU 上跑出平均约 173 tokens/秒,短任务逼近 200,同时加载 262k 上下文窗口
50%待验证使用 SGLang 时配官方权重的效果优于配 Unsloth 量化
50%待验证vLLM、SGLang、llama.cpp 是目前最常用的三大推理框架,其共同特点是需要适配几百种模型架构和各种量化格式及硬件,导致架构臃肿、性能只能折中
50%待验证vLLM 和 SGLang 属于服务型推理框架,支持连续批处理(Continuous Batching)、PagedAttention 等技术以最大化并发吞吐量
50%待验证推理引擎领域除vLLM外,还有TensorRT-LLM、SGLang、TGI等多个方案在竞争市场份额
50%待验证SGLang的RadixAttention将prompt和生成结果的KV组织成RadixTree,公共前缀在上层,论文数据显示无前缀复用负载下额外开销低于0.3%
50%待验证在企业和服务端场景,经过校准的INT4(W4A16)格式如AWQ、GPTQ和AutoRound通过vLLM或SGLang部署到独立加速器时是行业标准
50%待验证SGLang 源自伯克利,侧重于通过结构化生成语言优化复杂推理流水线,支持前缀缓存复用和正则表达式约束解码
50%待验证在MI355X上通过移除不必要的专家填充,DeepSeek-V4的FP4 MoE模型权重从159.07 GB降至112.36 GB
50%待验证SGLang引入会话引用感知的统一Radix缓存,请求可携带session_id使缓存淘汰识别活跃会话仍引用的前缀,通过/close_session释放引用
50%待验证SGLang引入权重缓存守护进程,为每张GPU保留权重,使重启引擎从缓存而非存储恢复以缩短故障恢复时间
50%待验证SGLang推出DWDP(分布式权重数据并行)预填充并行策略,通过NVLink P2P预取对等专家权重并在本地计算,消除EP的全对全token分发开销
50%待验证该加载优化通过环境变量SGLANG_MOE_COPY_WEIGHT_VIEWS_BEFORE_H2D开启,默认关闭
50%待验证SGLang v0.5.17引入原生Rust服务层,包含分词管理器、入口验证、OpenAI兼容API服务器以及PD分离支持,以解决Python GIL瓶颈
50%待验证通过在H2D前将CPU权重视图复制到连续存储,完整模型加载时间从约35分钟降至6分20秒,实现5.6倍加速
50%待验证SGLang v0.5.17提供对Kimi K3和MiniMax-H3等前沿模型的零日(day-0)支持
50%待验证Kimi K3的SGLang支持已在NVIDIA GB300和AMD MI35x上完成验证
50%待验证GPT-OSS-20B的BF16加载从545秒降至70秒(7.8倍加速),Qwen3.5-397B获得1.93到2.3倍提升
50%