[控场AI]
产品TileRT_AI

TileRT

专注于大模型推理decode阶段优化的推理运行时工具,针对低延迟自回归生成场景做专项优化,可与vLLM等主流框架配合实现分离式推理部署

时间轴 (近 90 天)

10月4日

在 8 块 AMD Instinct MI355X 加速卡上,借助 vLLM 推理框架,GLM-5.3 模型实现了 469 tok/s 的单用户解码速度

待验证50%
10月4日

该推理部署采用分离式架构,prefill 阶段由 vLLM 负责,decode 阶段由 TileRT 接管

待验证50%
10月4日

TileRT 与 vLLM 之间通过 vLLM V1 的 connector 接口打通

待验证50%
10月4日

上述性能数据来自单一来源的公开展示,尚缺乏独立复现与完整测试细节(如 batch 配置、量化方案、序列长度等)

待验证50%

全部知识事实 (4)

来源文章