dotwave.ai
专注于AI推理引擎研发的技术团队,致力于解决实时AI模型服务的成本与延迟问题,提出持续推理与常驻GPU内核等优化方案
时间轴 (近 90 天)
dotwave.ai团队声称当下服务实时AI模型的成本可能比它本应的高出多达56倍
dotwave.ai的引擎把整个模型作为一个常驻GPU程序运行,CPU每个节拍仅负责投入新音频和取走输出
将同一刻度到期的所有会话作为一个批次运行,可使模型权重只需为整组读取一次而非每会话各读一次
由于每个节拍工作完全相同,可用编译器在第一通电话之前固定调度和内存布局(AOT编译),消除运行时调度开销
在单块NVIDIA H100 SXM 80GB上,dotwave.ai引擎测得56个并发会话,而参考技术栈只能支撑1个
测试中每160毫秒节拍的p99延迟为147.4-147.5毫秒,跨三轮共84,000次会话节拍测量零次错过截止时间
从1路提升到56路会话意味着每通对话的GPU占用减少约98%
dotwave.ai的测量为服务器端数据,排除了网络与音频播放环节,使用相同录制输入和约两分钟上下文
上述所有数据与结论均来自dotwave.ai发布的技术笔记,为单一来源,尚未经第三方独立复现验证
全部知识事实 (9)
dotwave.ai团队声称当下服务实时AI模型的成本可能比它本应的高出多达56倍
50%待验证dotwave.ai的引擎把整个模型作为一个常驻GPU程序运行,CPU每个节拍仅负责投入新音频和取走输出
50%待验证将同一刻度到期的所有会话作为一个批次运行,可使模型权重只需为整组读取一次而非每会话各读一次
50%待验证由于每个节拍工作完全相同,可用编译器在第一通电话之前固定调度和内存布局(AOT编译),消除运行时调度开销
50%待验证在单块NVIDIA H100 SXM 80GB上,dotwave.ai引擎测得56个并发会话,而参考技术栈只能支撑1个
50%待验证测试中每160毫秒节拍的p99延迟为147.4-147.5毫秒,跨三轮共84,000次会话节拍测量零次错过截止时间
50%待验证从1路提升到56路会话意味着每通对话的GPU占用减少约98%
50%待验证dotwave.ai的测量为服务器端数据,排除了网络与音频播放环节,使用相同录制输入和约两分钟上下文
50%待验证上述所有数据与结论均来自dotwave.ai发布的技术笔记,为单一来源,尚未经第三方独立复现验证
50%