[KongchangAI]
ConceptTokens Per Second / 每秒生成token数

TPS

大模型推理性能核心指标之一,指模型每秒能够生成的token数量,决定长文本生成的总耗时和系统整体吞吐能力

Core Facts

Timeline (last 90 days)

Oct 6

更高的显存带宽意味着更低的首 token 延迟(TTFT)和更高的每秒生成 token 数(TPS)

Unverified50%
Oct 4

帕克探测器的碳复合隔热罩(TPS)厚约11.4厘米,由碳泡沫夹在两层碳纤维板之间构成

Unverified50%
Sep 30

官方宣传的7倍以上加速主要指向 TPS(每秒生成 token 数)即生成阶段吞吐提升,而非必然意味着 TTFT 同等幅度降低

Unverified50%
Sep 17

判断此次修复对工作负载是否有效可关注 GPU 利用率稳定性、首 token 延迟(TTFT)和每秒生成 token 数(TPS)等指标

Unverified50%
Sep 16

Fireworks 通过底层 GPU 调度优化和推理引擎定制,实现较低的首 token 延迟和更高的每秒 token 吞吐量

Unverified50%
Sep 16

批次大小(Batch Size)越大,单token均摊算力效率越高,TPS通常也越高,但延迟会上升

Unverified50%
Sep 16

TPS的解码(Decode)阶段是用户实际感知到的响应速度,硬件内存带宽往往是解码阶段的真正瓶颈而非纯粹浮点算力

Unverified50%
Sep 6

当模型生成速度超过15~20 TPS时用户在交互中已感受不到明显等待,因为人类阅读英文速度约为每秒4~5个token

Unverified60%
Sep 5

TPS(Tokens Per Second)是衡量大语言模型推理速度的核心指标,特指模型在生成阶段每秒输出的 token 数量

Verified75%

All Facts (10)

Source Articles