[控场AI]
产品

NIXL

NVIDIA提供的低延迟KV缓存传输库,专为LLM分离式推理场景设计,用于在预填充实例完成计算后将KV缓存高效传输至解码实例

时间轴 (近 90 天)

9月18日

v0.30.0rc2 的关键改动是修复 NIXL 传输组件中仅用于通知的请求,避免其触发不必要的接收报告

待验证50%
9月18日

NIXL(NVIDIA Inference Xfer Library)是用于加速推理数据传输的库

待验证50%
9月18日

在 vLLM 中,NIXL 常被用于实现 Prefill/Decode 分离架构下的 KV cache 跨节点传输

待验证50%
9月18日

NIXL 底层通常利用 NVLink、InfiniBand 或 RDMA 等高速互联技术,绕过 CPU 直接在 GPU 显存之间传输数据

待验证50%
9月16日

验证环境使用八块NVIDIA A40 GPU,每块运行一个vLLM引擎,资源池之间通过NIXL传输KV缓存

待验证50%
9月16日

NIXL是NVIDIA提供的低延迟KV缓存传输库,专为分离式推理场景设计

待验证50%
9月10日

NVIDIA Dynamo基于NATS和etcd实现分布式请求路由与服务发现,支持基于NIXL的高效GPU间数据传输,并与TensorRT-LLM和vLLM等推理后端兼容

待验证50%

全部知识事实 (8)

来源文章