Product
TensorRT-LLM
TensorRT-LLM是NVIDIA推出的开源推理优化库,专为大型语言模型(LLM)的高效部署而设计。它基于TensorRT推理引擎构建,提供图优化、量化、KV缓存管理等技术,支持在NVIDIA GPU上加速Transformer类模型的推理计算,适用于数据中心和云端大规模语言模型服务场景。
Timeline (last 90 days)
Aug 22
Ollama提供一键部署体验,vLLM和TensorRT-LLM面向需要高吞吐量的进阶用户
Unverified50%
Jul 13
NVIDIA的TensorRT-LLM针对其硬件架构深度优化推理速度
Unverified50%