vLLM
vLLM是一个开源的大型语言模型(LLM)推理与服务框架,专为高吞吐量、低延迟的模型部署而设计。其核心技术包括PagedAttention内存管理机制,能够高效管理注意力键值缓存,显著提升GPU利用率。vLLM支持连续批处理、张量并行等特性,兼容多种主流开源模型,广泛应用于生产环境中的LLM服务化部署。
Core Facts
Timeline (last 90 days)
vLLM 官方尚未公布 v0.29.1rc0 的完整 changelog 细节
v0.29.1rc0 版本由维护者 TQCB 打标,并通过 GitHub 验证签名,GPG 密钥 ID 为 B5690EEEBB952194
将水印与投机解码打通解决了加速时丢失水印的痛点
v0.29.1rc0 为投机解码引入了双密钥 Gumbel-Max 水印(Dual-key gumbel-max watermarking)机制
Ollama、vLLM、llama.cpp等本地推理工具链趋于成熟,让单张消费级GPU也能运行70亿至130亿参数量级的模型
使用 vLLM、TensorRT-LLM 做 rollout 再用 PyTorch/DeepSpeed 做训练的异构架构中数值不一致问题尤为突出
架构选择涉及开源模型与闭源API之间的权衡,以及vLLM、TensorRT-LLM等推理框架的适配
Spark-X2.5两款模型均通过Spark的out-of-tree通用插件实现了Day-0 vLLM支持
采用out-of-tree插件设计避免了对vLLM主干代码的侵入式修改
推理引擎领域除vLLM外,还有TensorRT-LLM、SGLang、TGI等多个方案在竞争市场份额
40 more timeline events
All Facts (20)
PagedAttention是vLLM框架的核心技术,借鉴操作系统虚拟内存管理思想将KV Cache分页存储
90%VerifiedvLLM是由UC Berkeley开发的高吞吐量大模型推理引擎,核心创新是PagedAttention技术
90%VerifiedvLLM通过PagedAttention技术实现了高效的KV Cache管理,将GPU显存利用率提升数倍
80%VerifiedOllama提供类似Docker的一键式模型管理体验,vLLM通过PagedAttention实现高吞吐量批量推理,LM Studio面向桌面用户提供图形化界面
75%Verified推理框架如 vLLM、llama.cpp、TGI 可用于开放权重模型的本地部署
75%VerifiedPagedAttention将KV缓存分成固定大小的页按需分配,显存利用率可提升2-4倍
65%VerifiedvLLM 是一个专为生产环境设计的高性能大语言模型推理与部署框架,针对高并发、高吞吐需求进行优化
65%VerifiedPagedAttention将KV Cache的内存利用率从不足40%提升至接近100%
65%VerifiedvLLM的PagedAttention借鉴操作系统虚拟内存分页思想管理KV缓存,将显存碎片化损耗从约30%降低至接近0
65%VerifiedvLLM实现了持续批处理(Continuous Batching)机制,允许在批次中部分请求完成后立即插入新请求,无需等待整个批次完成
65%Verified与传统方法相比,PagedAttention使vLLM能够将批处理大小提升2-4倍,并实现接近100%的内存利用率
65%Verified常见的本地推理框架包括Ollama、llama.cpp、vLLM
65%UnverifiedvLLM 在 GitHub 上已积累超过 90.9k Star 和 21.7k Fork
90%UnverifiedvLLM introduced PagedAttention as an optimization technique
90%UnverifiedThe mainstream AI inference stack (PyTorch, Transformers, vLLM) is built on Python and relies on extensive Python code and complex dependency chains
90%UnverifiedvLLM 发布了 v0.29.0rc1 版本(Release Candidate 1),这是面向下一个正式版的预发布候选版本
90%UnverifiedvLLM的吞吐量相比HuggingFace原生推理提升了2-24倍
80%UnverifiedOptimization techniques like PagedAttention, continuous batching, and speculative decoding boosted GPU utilization from 30-50% with traditional methods to over 90%
75%UnverifiedvLLM为GLM-5.3提供了Day-0(零日)支持,开发者在模型发布当天就能部署
70%Unverifiedrc 候选发布版通常意味着核心功能已经冻结,团队正进行最后阶段的稳定性测试与 Bug 修复
70%