Prime Inference 上线:vLLM 大规模服务 GLM-5.3 的工程实践

Prime Intellect 推出针对 Agent 工作负载优化的推理服务 Prime Inference,基于 vLLM 大规模部署 GLM-5.3。
Prime Intellect 发布 Prime Inference,以 vLLM 为底层引擎大规模服务 GLM-5.3 模型,核心差异化在于专门针对智能体(agent)工作负载进行优化。与传统对话场景不同,agent 应用中工具调用、长上下文记忆和多轮推理会产生高度不规则的 prefill/decode 混合负载,同时还对调度效率和结构化输出可靠性提出严苛要求。Prime Inference 在 prefill/decode 拓扑设计、减少调度器气泡和保障工具调用稳定性三个维度重点发力,代表了大模型推理基础设施从「对话优先」向「智能体优先」的演进方向。对开发者而言,选择推理服务时应更关注真实 agent 负载下的端到端表现,而非仅凭解码速度 benchmark 做判断。
Prime Intellect 推出 Prime Inference
Prime Intellect 团队近日宣布推出 Prime Inference,基于 vLLM 大规模部署 GLM-5.3 模型。这一发布的核心意义不在于又多了一个推理服务,而在于它针对智能体(agent)工作负载做了专门优化——而这恰恰是当前大模型推理基础设施中被低估的难点。

正如官方所言,把智能体工作负载做对,远不止「快速解码」这么简单。单纯追求 decode 阶段的 token 吞吐,并不能解决真实 agent 应用中的全部瓶颈。
为什么 Agent 推理比普通推理更难
传统的 LLM 推理服务往往以聊天对话为主要场景,优化目标集中在首 token 延迟和持续解码速度上。但智能体类应用引入了全新的复杂度。
Prefill / Decode 拓扑
agent 的请求模式与普通对话有显著差异。工具调用、长上下文记忆、多轮推理会产生大量不规则的 prefill(预填充)负载,与 decode(解码)阶段的资源需求此消彼长。Prime Inference 在 prefill/decode 拓扑上做了专门设计,意味着它在计算资源分配层面区分了这两个阶段,以避免二者相互抢占算力。
Prefill 和 Decode 两个阶段在计算特性上存在根本差异。Prefill 阶段需要一次性处理全部输入 token,属于计算密集型(compute-bound)操作,对矩阵乘法吞吐要求极高;Decode 阶段每步仅生成一个 token,属于内存带宽密集型(memory-bound)操作,瓶颈在于从显存读取庞大的 KV 缓存。在 agent 场景中,工具调用返回结果、长上下文注入等操作会频繁触发大规模 prefill,与正在进行的 decode 请求争抢同一套 GPU 资源,导致解码延迟抖动和整体吞吐下降。专门设计 prefill/decode 拓扑,通常意味着将这两类请求路由到不同的计算实例或在同一实例上做优先级隔离,从而让两个阶段各自在最适合的资源配置下运行。
调度器气泡(Scheduler Bubbles)
「调度器气泡」指的是 GPU 在等待调度决策或请求切换时产生的空闲时间片。在高并发、请求长度高度异构的 agent 场景下,这类气泡会显著拖累整体利用率。减少 scheduler bubbles 直接关系到服务的有效吞吐和成本效率,是 Prime Inference 工程工作的重点之一。
可靠的工具调用
agent 的灵魂在于能稳定地调用外部工具并解析结果。工具调用(tool calls)一旦出现格式错误或超时,会直接导致整个 agent 任务链断裂。官方强调「可靠的工具调用」,说明他们在推理层对结构化输出和函数调用的稳定性做了保障,而不仅仅追求速度。
vLLM 作为底层推理引擎
Prime Inference 选择 vLLM 作为底层服务框架。vLLM 以 PagedAttention 和连续批处理(continuous batching)闻名,能在高并发下高效管理 KV 缓存,是目前开源推理生态中最主流的选择之一。
用 vLLM「大规模」(at scale)服务 GLM-5.3,表明 Prime Intellect 的目标是生产级、可横向扩展的部署,而非实验性质的单机验证。将成熟的开源引擎与自研的调度、拓扑优化结合,是当前推理服务商普遍采用的技术路径。
PagedAttention 是 vLLM 的核心创新,借鉴操作系统虚拟内存的分页机制来管理 KV 缓存(Key-Value Cache)。传统推理框架会为每个请求预分配连续的显存块,导致大量内存碎片和浪费;PagedAttention 将 KV 缓存拆分为固定大小的非连续「页」,按需动态分配,使同一块显存能同时服务更多并发请求。连续批处理(Continuous Batching)则解决了另一个低效问题:传统静态批处理需要等待一批请求全部完成才能接入新请求,而连续批处理允许在每个解码步骤后动态替换已完成的序列,大幅提升 GPU 利用率。两者结合使 vLLM 在高并发场景下的吞吐量相比朴素实现提升数倍,这也是它成为开源推理生态主流选择的根本原因。
对行业的启示
这条发布虽然信息简短,却点出了大模型推理演进的方向:从「对话优先」转向「智能体优先」。随着越来越多应用从简单问答走向多步骤自主任务,推理基础设施必须重新审视 prefill/decode 平衡、调度效率和工具调用可靠性这三大要素。
对于正在搭建 agent 应用的开发者而言,这意味着选择推理服务时不能只看 benchmark 上的解码速度,而要关注其在真实 agent 负载下的端到端表现。Prime Inference 的发布正是对这一趋势的回应。
注:本文基于 Prime Intellect 官方社交媒体发布的简短信息整理,部分技术细节为基于公开框架特性的合理推断,具体性能数据以官方技术博客为准。
相关推荐

AI温和派的崛起:在狂热与末日论之间寻找中间地带
AI舆论正陷入加速主义与末日论的两极撕裂,但一群"AI温和派"正在崛起。本文梳理福山、"AI作为常规技术"作者及好莱坞制片人卡森伯格的最新观点,呈现在狂热与恐惧之间寻找中间地带的思潮。
我让Claude构建可漫步的物理精确O'Neill圆柱:AI生成3D模拟的边界
我让Claude构建可漫步的物理精确O'Neill圆柱:AI生成3D模拟的边界
一位开发者让Claude构建物理精确、可实时漫步的O'Neill圆柱太空栖息地模拟。本文解析其中的科里奥利力、重力梯度等物理挑战,以及AI生成交互式3D模拟的现实意义与局限。

破解数据锁定:用REGISTER与UNREGISTER API实现目录可移植性
湖仓架构下,开放表格式解决了存储可移植性,但目录锁定成为新难题。本文解析REGISTER与UNREGISTER API如何实现元数据松耦合,帮助企业避免厂商绑定、支持多目录协作并安全迁移数据。