[KongchangAI]
Product

Mooncake

Mooncake是面向大语言模型(LLM)分布式推理场景的KV Cache传输与管理系统。它通过在分布式节点间高效调度和传输KV Cache数据,优化推理吞吐量与延迟表现,支持prefill与decode阶段的解耦部署,并具备peer节点故障自动恢复能力,以提升推理集群的可靠性与资源利用效率。

Timeline (last 90 days)

Sep 10

Splitwise、DistServe、Mooncake等系统都是PD分离的代表性实践

Unverified50%

All Facts (1)

Source Articles