vLLM v0.29.0发布:Model Runner V2成默认引擎,推理性能全面升级

vLLM v0.29.0以Model Runner V2转正为核心,带来多项推理性能与可观测性升级。
vLLM v0.29.0最重要的变化是将经过多版本验证的Model Runner V2正式设为所有模型的默认运行引擎,标志着底层架构走向成熟。版本还针对Kimi-K3和DeepSeek-V4进行了专项优化,后者通过MegaMoE结构融合共享专家以降低推理成本。技术层面,Mamba前缀缓存带来9%~25%的首token延迟改善,投机解码新增每请求接受率统计以支持精细化调优,RL权重同步引入P2P后端使worker仅拉取自身分片、显著降低分布式通信开销。此外,新增Hy4-preview、Qwen3.8-Flash-Next等多个模型的开箱即用支持。本次版本由277位贡献者贡献594次提交,社区活跃度持续增长。
vLLM v0.29.0核心变化:Model Runner V2转正
开源大模型推理框架vLLM迎来v0.29.0版本更新,最引人注目的变化是Model Runner V2正式成为所有模型的默认运行引擎。这一决定意味着经过多个版本的验证与迭代,V2架构已经足够稳定,能够替代原有的运行时框架承担全部推理任务。
本次版本汇聚了来自277位贡献者的594次代码提交,其中91位是首次参与项目的新贡献者。这样的社区活跃度在开源推理框架领域相当罕见,也从侧面反映出vLLM在生产环境部署中的广泛采用。

对于运维大规模推理服务的团队来说,默认运行引擎的切换是一个需要重点关注的信号。它通常伴随着底层调度逻辑、内存管理和批处理策略的调整,可能直接影响吞吐量与延迟表现。
模型专项优化:Kimi与DeepSeek的深度适配
本次更新对多个主流大模型做了针对性优化。在Kimi-K3上,团队进行了新一轮性能打磨,将latent tail进一步压缩到Mamba metadata层面——这类底层优化往往能在长上下文场景中带来可观的效率提升。
DeepSeek-V4的shared experts被融合进MegaMoE结构。混合专家(MoE)模型的共享专家融合是当前推理加速的重要方向,通过减少重复计算与内存搬运,能够在保持模型能力的同时降低推理成本。
这些优化并非泛泛而谈的"性能提升",而是针对特定模型架构的工程实践。它反映出vLLM正在从通用推理框架,向深度适配头部模型的方向演进,这对使用这些模型的开发者是直接利好。
三项关键技术升级
Mamba前缀缓存
Mamba架构的前缀缓存现在能够保留内部prefill检查点,实测带来9%~25%的首token延迟(TTFT)改善。TTFT是衡量交互式应用体验的核心指标,对于聊天机器人、实时问答等场景,这一区间的提升足以被终端用户直接感知。
投机解码的可观测性增强
投机解码(Speculative Decoding)现在能够通过API上报每个请求的接受率统计(per-request acceptance stats)。投机解码的实际加速效果高度依赖草稿模型与目标模型的匹配程度,接受率是评估其有效性的关键数据。将这一指标暴露到API层,让开发者能够精细化监控和调优,是可观测性上的实用改进。
RL权重同步的P2P后端
强化学习(RL)权重同步新增了sharded_rdt P2P后端。在这一机制下,每个worker只拉取属于自己的TP/EP(张量并行/专家并行)切片,而非全量同步。这对于RLHF等需要频繁更新权重的训练-推理一体化流程尤为重要,能显著降低分布式环境下的通信开销。
新增模型支持
v0.29.0新增了对多个模型的支持,包括Hy4-preview、Qwen3.8-Flash-Next、GraniteSWA以及NemotronH Omni Reasoning V3。模型覆盖面的持续扩展是vLLM保持竞争力的基础——推理框架的价值很大程度上取决于它能否第一时间支持社区关注的新模型。
从这份新增列表可以看出,vLLM覆盖了从Qwen系列的轻量化版本到具备Omni多模态推理能力的模型,说明其架构在应对不同模型类型时具备较好的通用性。
对开发者的实际意义
综合来看,v0.29.0是一次以性能和稳定性为核心的版本迭代。Model Runner V2转正标志着底层架构走向成熟;针对Kimi、DeepSeek等模型的专项优化,以及Mamba前缀缓存、投机解码可观测性、RL权重P2P同步等改进,则覆盖了推理效率、监控能力和训练一体化等多个维度。
对于正在生产环境使用vLLM的团队,建议在升级前评估默认引擎切换可能带来的行为变化,并在测试环境验证吞吐与延迟指标。而对于关注新模型部署的开发者,扩展的模型支持列表提供了更多开箱即用的选择。
相关推荐

分布式系统经典论文导读:从入门到精通的必读清单
一份在 Hacker News 走红的分布式系统经典论文清单,涵盖共识算法、逻辑时钟、CAP 定理等核心主题,为工程师提供系统化的学习路径与理论到实践的桥梁。

Valve仍在权衡Steam Deck 2的推出时机
Valve完成Steam Controller、Steam Machine和Steam Frame三款2026硬件产品线后,Steam Deck 2仍无明确时间表。Valve设计师表示仍在权衡"如何以及何时"推出,坚持不为单纯性能提升而做续作。

"Dario, Please":一封写给Anthropic CEO的公开呼吁引发热议
《Dario, Please》一文在Hacker News引发热议,累计247分与122条评论。这封写给Anthropic CEO Dario Amodei的公开呼吁,折射出AI社区对头部大模型公司决策方向的持续关切与话语生态变化。