共 2 篇相关文章
企业GPU集群平均利用率不足30%,预留资源大量闲置。本文从真实案例出发,剖析僵尸Notebook、归属缺失等根因,提供资源标签、空闲超时回收、弹性调度等实用解决方案,帮助团队有效降低GPU成本。
详解如何在AMD GPU上部署PD分离式SGLang推理集群,通过单一配置文件实现Prefill-Decode解耦的多节点部署,提升大模型推理吞吐量与延迟表现,附架构原理与适用场景分析。