[KongchangAI]
Product

TensorRT-LLM

TensorRT-LLM是NVIDIA推出的开源推理优化库,专为大型语言模型(LLM)的高效部署而设计。它基于TensorRT推理引擎构建,提供图优化、量化、KV缓存管理等技术,支持在NVIDIA GPU上加速Transformer类模型的推理计算,适用于数据中心和云端大规模语言模型服务场景。

Timeline (last 90 days)

Aug 22

Ollama提供一键部署体验,vLLM和TensorRT-LLM面向需要高吞吐量的进阶用户

Unverified50%
Jul 13

NVIDIA的TensorRT-LLM针对其硬件架构深度优化推理速度

Unverified50%

All Facts (2)

Source Articles