已验证75% 置信事实精确时间
TPS(Tokens Per Second)是衡量大语言模型推理速度的核心指标,特指模型在生成阶段每秒输出的 token 数量
3
来源数
75%
置信度
长期有效
时效性
2026/9/5
首次发现
来源
涉及实体
相关事实
待验证对于大语言模型推理,吞吐通常以 token 数为单位衡量,即 tokens/s 是评估 LLM 推理框架性能的核心指标69% 相似待验证每token生成时间(TPOT)衡量模型在自回归解码阶段逐个生成token的速度66% 相似已验证大语言模型的Token生成过程是串行的,基于自回归机制,每个Token的生成都依赖于前一个Token65% 相似待验证本地AI推理速度公式为 Token/s ≈ 内存带宽 / 每token需读取的数据量,大语言模型生成每个token采用自回归方式61% 相似待验证MoT(Mixture of Tokens)机制允许模型在处理不同模态输入时动态分配计算资源61% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/862243API
curl https://kongchang.com/api/v1/knowledge/claims/862243MCP
get_claim(id=862243)