SGLang v0.5.18发布:710个PR带来哪些性能飞跃

SGLang v0.5.18更新概述
高性能大模型推理引擎 SGLang 迎来重要版本更新 v0.5.18。本次发布由 212 位贡献者提交的 710 个 PR 汇聚而成,堪称近期最庞大的一次社区协作成果。作为 GitHub 上拥有超过 34.1k Star 的明星开源项目,SGLang 一直以极致的推理性能和对最新模型的快速支持著称。
这次更新不仅新增了多个多模态与扩散模型支持,还在启动加速、张量并行、量化、投机解码等核心领域带来了大量性能优化。对于正在部署大模型推理服务的团队而言,v0.5.18 提供了实打实的效率提升。

新增模型支持:多模态与扩散模型全面扩展
本次版本在模型生态上继续扩张,覆盖了自回归、多模态和扩散三大类别。新增支持的模型包括:
- 自回归多模态模型:Muse Glimmer
- 自回归模型:Intern-S2-Mobius
- 视频与图像扩散模型:SANA-Video、LingBot-Video-MoE、LTX-2.5、Cosmos3 Edge & Distilled、LongCat-Image
除此之外,官方还为 Qwen3.8 系列、Ling-3.0、Nemotron 3.5 Lightning、Dots3-Note 以及 DeepSeek-V4-Pro-0813 提供了 cookbook 使用配方。这种「模型发布即适配」的节奏,正是 SGLang 在推理引擎竞争中保持领先的关键——它让开发者能够第一时间将前沿模型投入生产环境。
启动加速:重叠式检查点加载带来2.38倍提速
本次更新中一个核心亮点是 重叠式检查点分阶段加载(Overlapped checkpoint staging)。传统的模型加载流程是串行的:先从存储加载权重,再捕获 CUDA graph。而新机制让检查点页在 CUDA graph 捕获期间就从存储中并行分阶段载入。
实测数据令人印象深刻:
- Qwen3-32B 在 H100 上使用预取模式,启动速度比串行方式快 8.6%-11.7%
- 相比默认的普通加载方式,实现了 2.38 倍的加速(35.6 秒 vs 84.8 秒)
通过 --startup-weight-load-mode overlap 即可开启此特性。对于需要频繁扩缩容或冷启动的推理集群,这一优化的实际价值非常显著。
张量并行与分布式通信优化
在分布式推理层面,v0.5.18 引入了多项关键通信优化,直接降低了多卡推理的延迟开销。
TP LMHead All-to-All 通信合并
对于纯 DP 的 dp-attention 场景,TP LMHead 原本的 allgather + scatter 两步操作被合并为单次 all-to-all 通信。在 DeepSeek-V4-Pro B200 的解码测试中:
- LMHead 耗时从 320μs 降至 169μs
- TPOT(每输出 token 时间)从 36.97ms 改善到 35.67ms
FlashInfer MNNVL 纯 AllReduce
非融合的 allreduce 场景现在可以复用 FlashInfer MNNVL 工作区,而非回退到 NCCL。在 Blackwell 架构上,DeepSeek-V4-Flash TP4 解码在小批量下获得 最高 +6.9% 的性能提升。
该特性已为 DeepSeek-V3/V3.2/V4 自动启用,其他模型可通过 --enable-flashinfer-pure-allreduce 手动开启。
AMD与国产模型的深度适配优化
值得关注的是,SGLang 在异构硬件支持上持续发力,本次对 AMD 平台和国产大模型的优化力度相当大。
NVFP4 检查点在 AMD 上的量化转换
通过 --quantization quark_mxfp4,引擎会在加载时将 ModelOpt 和 Quark 的 NVFP4 权重解量化并重新量化为 MXFP4,全程无需持有完整精度副本。在 MiniMax-M2.7、GLM-5.1、Kimi-K2.6、Qwen3.5-397B 和 DeepSeek-R1 等模型上,GSM8K 准确率恢复达到 97.5%-100.2%。
Kimi K3 针对 MI355X 的深度调优
针对 Kimi K3 在 AMD MI355X 上的推理,SGLang 做了多层次优化:
- 用分组头 MLA 验证内核替代了此前每头重复读取共享潜变量的 MHA 结构路径,在并发 2-32 时实现 1.37-1.77 倍吞吐量提升和 1.45-2.42 倍 ITL 改善
- AITER MLA 预填充内核适配了 K3 的 12 头结构,TTFT 最多降低 14.9%
- gfx950 调优的解码阶段几何在 68k 输入下额外带来 46-73% 的 ITL 提升
- 这些优化下 GSM8K 准确率稳定保持在 0.951-0.957
缓存管理统一与开发体验改进
本次更新统一了编译内核缓存目录。Triton、FlashInfer、Inductor、DeepGEMM 以及 CUDA driver 的缓存全部移至 SGLANG_CACHE_DIR 之下。
注意:这是一项破坏性变更,升级后首次启动会触发重新编译,但后续的缓存管理将更加清晰统一。
此外,引擎在服务预热后会 冻结 GC(垃圾回收),减少运行时抖动。调度器方面也做了大量优化,包括:
- O(1) 时隙分配
- 批量缓存释放
- DP attention 调度器单次 D2H 拷贝收敛
这些改进进一步降低了主机侧开销,提升了服务稳定性。
依赖升级与配套更新
配套的依赖栈也同步更新至最新版本:
| 依赖 | 版本 |
|---|---|
| PyTorch | 2.13.0(搭配 triton 3.7.1) |
| FlashInfer | 0.6.17 |
| CuTeDSL | 4.6.2(修复 Blackwell 上的 FA4 启动回归) |
| DeepEP | 改为从 sgl-deep-ep wheels 安装 |
| sgl-kernel | 0.4.6.post1 |
总结:SGLang v0.5.18值得升级吗
SGLang v0.5.18 是一次厚积薄发的大版本更新。从启动加速、通信优化到跨硬件量化支持,几乎每个环节都体现了工程团队对推理效率的极致追求。特别是对 AMD MI355X、Blackwell 架构以及 DeepSeek-V4、Kimi K3 等前沿模型的深度适配,展现了 SGLang 在推理引擎赛道上的技术广度与响应速度。
对于生产环境的部署者,重叠式检查点加载和一系列并行优化能够直接转化为更低的延迟和更高的吞吐;而对模型研究者而言,快速的新模型支持大大缩短了从论文到落地的路径。
建议正在使用 SGLang 的团队评估升级,同时留意缓存目录变更等破坏性调整。
相关推荐

Dude系统:双检测多智能体如何揪出论文与代码的不一致
Dude是首个面向论文-代码差异检测的双检测多智能体系统,通过粒度对齐协商和两阶段显著性过滤机制,解决了多智能体系统中的过度解读与误报问题,召回率和精确率最高提升22.8%,F1分数提升18.7%。

全双工语音助手隐式指令遵循评测:DSB-IFEval基准解析
深入解析DSB-IFEval基准测试,揭示全双工语音助手在隐式指令遵循、人设推理和冲突消解方面的能力短板。覆盖六大语音系统实测对比,剖析架构差异带来的行为与内容权衡。

提示工程实现AI教学助手个性化:六维画像框架详解
深入解析基于提示工程的AI教学助手个性化框架,通过六维学习者画像与布鲁姆认知分类法,无需重训练模型即可实现96种个性化教学风格,为教育AI落地提供务实工程路径。