Product
SGLang
SGLang(Structured Generation Language)是一个面向大型语言模型的开源推理框架,旨在提升LLM服务的执行效率与编程灵活性。其核心特性包括:通过RadixAttention实现KV缓存的高效复用、支持结构化输出约束(如JSON模式)、以及提供简洁的前端编程接口用于构建复杂的多步骤推理流程。SGLang兼容多种主流模型架构及GPU硬件,适用于学术研究与生产环境下的高性能推理部署。
Timeline (last 90 days)
Jun 3
围绕DeepSeek等模型已经形成了包括推理框架(vLLM、SGLang)、Agent框架(如MetaGPT、AutoGen的国产适配)在内的完整技术栈
Unverified75%
Jun 1
vLLM和SGLang在多轮对话场景下显存节省40%-60%
Unverified60%
Jun 1
vLLM和SGLang相比LM Studio和Ollama,吞吐量提升3-8倍
Unverified50%
Jun 1
Docker部署vLLM/SGLang过程中会产生大量缓存,几个小时就能写入100GB以上
Unverified60%
Jun 1
Qwen3的27B NVFP4 MTP-XS模型SGLang目前无法运行,而vLLM已经支持
Unverified70%
Jun 1
SGLang的推理性能比vLLM强10%-20%
Unverified50%
May 31
SGLang由斯坦福团队开发,专注于结构化输出和复杂推理链的高效执行
Unverified90%
May 31
SGLang推理框架在LFM2.5-8B-A1B发布当天(Day-0)即提供支持
Unverified90%
May 31
SGLang由UC Berkeley LMSYS团队开发,于2024年初开源
Unverified85%
May 31
AMD MI355X 每 GPU 吞吐量比 NVIDIA B200 SGLang 高 1.25 倍
Unverified85%
20 more timeline events
All Facts (1)
Source Articles
DeepSeek开源DeepSpec:推理加速60-85%的推测解码全栈工具库Jul 25GPUStack实战:Day 0部署DeepSeek-V4-Flash全流程详解Jul 16AMD GPU部署PD分离式SGLang多节点推理集群教程May 30SGLang v0.5.12.post1发布:DeepSeek V4稳定性修复与Blackwell适配May 30LFM2.5-8B-A1B:1.5B激活参数实现4倍体量效果的MoE模型May 30SGLang进军金融业:AI推理基础设施如何重塑华尔街May 30Cloudflare向SGLang贡献KV Cache与Mooncake关键修复May 30SGLang举办Agent Loops主题Office Hour,聚焦智能体循环架构优化May 30