[控场AI]
产品Dynamo / Triton Inference Server

Dynamo-Triton

NVIDIA面向生产级推理服务的框架,基于Triton Inference Server,结合Dynamo调度编排层,支持动态批处理、并发模型实例、多节点分布式推理场景下的请求路由与资源调度

时间轴 (近 90 天)

9月30日

NVIDIA发布了使用Dynamo-Triton推理框架部署基于HSTU架构生成式推荐模型的技术方案

待验证50%
9月21日

将TensorRT多设备推理集成进Dynamo-Triton后,开发者可获得从原始模型权重到对外提供HTTP/gRPC推理接口的完整标准化路径,并行切分、设备协调与服务编排均由框架托管

待验证50%

全部知识事实 (2)

来源文章