Mooncake是面向大语言模型(LLM)分布式推理场景的KV Cache传输与管理系统。它通过在分布式节点间高效调度和传输KV Cache数据,优化推理吞吐量与延迟表现,支持prefill与decode阶段的解耦部署,并具备peer节点故障自动恢复能力,以提升推理集群的可靠性与资源利用效率。
Splitwise、DistServe、Mooncake等系统都是PD分离的代表性实践