SGLang(Structured Generation Language)是一个面向大型语言模型的开源推理框架,旨在提升LLM服务的执行效率与编程灵活性。其核心特性包括:通过RadixAttention实现KV缓存的高效复用、支持结构化输出约束(如JSON模式)、以及提供简洁的前端编程接口用于构建复杂的多步骤推理流程。SGLang兼容多种主流模型架构及GPU硬件,适用于学术研究与生产环境下的高性能推理部署。
围绕DeepSeek等模型已经形成了包括推理框架(vLLM、SGLang)、Agent框架(如MetaGPT、AutoGen的国产适配)在内的完整技术栈
vLLM和SGLang在多轮对话场景下显存节省40%-60%
vLLM和SGLang相比LM Studio和Ollama,吞吐量提升3-8倍
Docker部署vLLM/SGLang过程中会产生大量缓存,几个小时就能写入100GB以上
Qwen3的27B NVFP4 MTP-XS模型SGLang目前无法运行,而vLLM已经支持
SGLang的推理性能比vLLM强10%-20%
SGLang由斯坦福团队开发,专注于结构化输出和复杂推理链的高效执行
SGLang推理框架在LFM2.5-8B-A1B发布当天(Day-0)即提供支持
SGLang由UC Berkeley LMSYS团队开发,于2024年初开源
AMD MI355X 每 GPU 吞吐量比 NVIDIA B200 SGLang 高 1.25 倍
20 more timeline events