[KongchangAI]
Product

SGLang

SGLang(Structured Generation Language)是一个面向大型语言模型的开源推理框架,旨在提升LLM服务的执行效率与编程灵活性。其核心特性包括:通过RadixAttention实现KV缓存的高效复用、支持结构化输出约束(如JSON模式)、以及提供简洁的前端编程接口用于构建复杂的多步骤推理流程。SGLang兼容多种主流模型架构及GPU硬件,适用于学术研究与生产环境下的高性能推理部署。

Timeline (last 90 days)

Jun 3

围绕DeepSeek等模型已经形成了包括推理框架(vLLM、SGLang)、Agent框架(如MetaGPT、AutoGen的国产适配)在内的完整技术栈

Unverified75%
Jun 1

vLLM和SGLang在多轮对话场景下显存节省40%-60%

Unverified60%
Jun 1

vLLM和SGLang相比LM Studio和Ollama,吞吐量提升3-8倍

Unverified50%
Jun 1

Docker部署vLLM/SGLang过程中会产生大量缓存,几个小时就能写入100GB以上

Unverified60%
Jun 1

Qwen3的27B NVFP4 MTP-XS模型SGLang目前无法运行,而vLLM已经支持

Unverified70%
Jun 1

SGLang的推理性能比vLLM强10%-20%

Unverified50%
May 31

SGLang由斯坦福团队开发,专注于结构化输出和复杂推理链的高效执行

Unverified90%
May 31

SGLang推理框架在LFM2.5-8B-A1B发布当天(Day-0)即提供支持

Unverified90%
May 31

SGLang由UC Berkeley LMSYS团队开发,于2024年初开源

Unverified85%
May 31

AMD MI355X 每 GPU 吞吐量比 NVIDIA B200 SGLang 高 1.25 倍

Unverified85%

20 more timeline events

All Facts (1)

Source Articles