[控场AI]
公司

dotwave.ai

专注于AI推理引擎研发的技术团队,致力于解决实时AI模型服务的成本与延迟问题,提出持续推理与常驻GPU内核等优化方案

时间轴 (近 90 天)

10月3日

dotwave.ai团队声称当下服务实时AI模型的成本可能比它本应的高出多达56倍

待验证50%
10月3日

dotwave.ai的引擎把整个模型作为一个常驻GPU程序运行,CPU每个节拍仅负责投入新音频和取走输出

待验证50%
10月3日

将同一刻度到期的所有会话作为一个批次运行,可使模型权重只需为整组读取一次而非每会话各读一次

待验证50%
10月3日

由于每个节拍工作完全相同,可用编译器在第一通电话之前固定调度和内存布局(AOT编译),消除运行时调度开销

待验证50%
10月3日

在单块NVIDIA H100 SXM 80GB上,dotwave.ai引擎测得56个并发会话,而参考技术栈只能支撑1个

待验证50%
10月3日

测试中每160毫秒节拍的p99延迟为147.4-147.5毫秒,跨三轮共84,000次会话节拍测量零次错过截止时间

待验证50%
10月3日

从1路提升到56路会话意味着每通对话的GPU占用减少约98%

待验证50%
10月3日

dotwave.ai的测量为服务器端数据,排除了网络与音频播放环节,使用相同录制输入和约两分钟上下文

待验证50%
10月3日

上述所有数据与结论均来自dotwave.ai发布的技术笔记,为单一来源,尚未经第三方独立复现验证

待验证50%

全部知识事实 (9)

来源文章