[控场AI]
概念Tokens Per Second / 每秒生成token数

TPS

大模型推理性能核心指标之一,指模型每秒能够生成的token数量,决定长文本生成的总耗时和系统整体吞吐能力

核心事实

时间轴 (近 90 天)

10月4日

帕克探测器的碳复合隔热罩(TPS)厚约11.4厘米,由碳泡沫夹在两层碳纤维板之间构成

待验证50%
9月30日

官方宣传的7倍以上加速主要指向 TPS(每秒生成 token 数)即生成阶段吞吐提升,而非必然意味着 TTFT 同等幅度降低

待验证50%
9月17日

判断此次修复对工作负载是否有效可关注 GPU 利用率稳定性、首 token 延迟(TTFT)和每秒生成 token 数(TPS)等指标

待验证50%
9月16日

Fireworks 通过底层 GPU 调度优化和推理引擎定制,实现较低的首 token 延迟和更高的每秒 token 吞吐量

待验证50%
9月16日

批次大小(Batch Size)越大,单token均摊算力效率越高,TPS通常也越高,但延迟会上升

待验证50%
9月16日

TPS的解码(Decode)阶段是用户实际感知到的响应速度,硬件内存带宽往往是解码阶段的真正瓶颈而非纯粹浮点算力

待验证50%
9月6日

当模型生成速度超过15~20 TPS时用户在交互中已感受不到明显等待,因为人类阅读英文速度约为每秒4~5个token

待验证60%
9月5日

TPS(Tokens Per Second)是衡量大语言模型推理速度的核心指标,特指模型在生成阶段每秒输出的 token 数量

已验证75%

全部知识事实 (9)

来源文章