产品TileRT_AI
TileRT
专注于大模型推理decode阶段优化的推理运行时工具,针对低延迟自回归生成场景做专项优化,可与vLLM等主流框架配合实现分离式推理部署
时间轴 (近 90 天)
10月4日
在 8 块 AMD Instinct MI355X 加速卡上,借助 vLLM 推理框架,GLM-5.3 模型实现了 469 tok/s 的单用户解码速度
待验证50%
10月4日
该推理部署采用分离式架构,prefill 阶段由 vLLM 负责,decode 阶段由 TileRT 接管
待验证50%
10月4日
TileRT 与 vLLM 之间通过 vLLM V1 的 connector 接口打通
待验证50%
10月4日
上述性能数据来自单一来源的公开展示,尚缺乏独立复现与完整测试细节(如 batch 配置、量化方案、序列长度等)
待验证50%