NIXL
NVIDIA提供的低延迟KV缓存传输库,专为LLM分离式推理场景设计,用于在预填充实例完成计算后将KV缓存高效传输至解码实例
时间轴 (近 90 天)
v0.30.0rc2 的关键改动是修复 NIXL 传输组件中仅用于通知的请求,避免其触发不必要的接收报告
NIXL(NVIDIA Inference Xfer Library)是用于加速推理数据传输的库
在 vLLM 中,NIXL 常被用于实现 Prefill/Decode 分离架构下的 KV cache 跨节点传输
NIXL 底层通常利用 NVLink、InfiniBand 或 RDMA 等高速互联技术,绕过 CPU 直接在 GPU 显存之间传输数据
验证环境使用八块NVIDIA A40 GPU,每块运行一个vLLM引擎,资源池之间通过NIXL传输KV缓存
NIXL是NVIDIA提供的低延迟KV缓存传输库,专为分离式推理场景设计
NVIDIA Dynamo基于NATS和etcd实现分布式请求路由与服务发现,支持基于NIXL的高效GPU间数据传输,并与TensorRT-LLM和vLLM等推理后端兼容
全部知识事实 (8)
NIXL是SGLang用于Prefill-Decode分离部署的关键通信组件,负责在Prefill节点和Decode节点之间传输KV Cache状态
85%待验证NIXL 底层通常利用 NVLink、InfiniBand 或 RDMA 等高速互联技术,绕过 CPU 直接在 GPU 显存之间传输数据
50%待验证v0.30.0rc2 的关键改动是修复 NIXL 传输组件中仅用于通知的请求,避免其触发不必要的接收报告
50%待验证NIXL(NVIDIA Inference Xfer Library)是用于加速推理数据传输的库
50%待验证在 vLLM 中,NIXL 常被用于实现 Prefill/Decode 分离架构下的 KV cache 跨节点传输
50%待验证验证环境使用八块NVIDIA A40 GPU,每块运行一个vLLM引擎,资源池之间通过NIXL传输KV缓存
50%待验证NIXL是NVIDIA提供的低延迟KV缓存传输库,专为分离式推理场景设计
50%待验证NVIDIA Dynamo基于NATS和etcd实现分布式请求路由与服务发现,支持基于NIXL的高效GPU间数据传输,并与TensorRT-LLM和vLLM等推理后端兼容
50%