概念Prefill/Decode分离架构 / 分离式推理部署 / 分布式推理分离架构
Disaggregated Serving
大模型推理领域的先进部署模式,将Prefill(预填充)阶段和Decode(解码)阶段分别部署在不同GPU节点上,避免两类工作负载互相干扰,提升GPU利用率,需要专用高速传输机制在节点间搬运KV Cache数据
时间轴 (近 90 天)
10月4日
分离式部署将 prefill 与 decode 两个阶段物理上拆开,分别交给量身定制的运行时处理,使每个阶段跑在各自最优点上
待验证50%
9月18日
传统推理将 Prefill 阶段和 Decode 阶段放在同一组 GPU 上串行执行,导致两类工作负载互相干扰,GPU 利用率难以最优化
待验证70%