Unverified50% confidenceFactExact time
Transformer 模型推理时,输入 token 可并行处理(prefill 阶段),输出 token 必须逐个自回归生成(decode 阶段),导致输出 token 的单价通常高于输入 token
1
Sources
50%
Confidence
Long-term
Relevance
9/4/2026
First Seen
Sources
Related Entities
Related Claims
UnverifiedTransformer 架构下模型在推理时仅处理当前输入的 token 序列,不存在跨请求的内部状态持久化76% similarVerified大语言模型的Token生成过程是串行的,基于自回归机制,每个Token的生成都依赖于前一个Token74% similarUnverified模型每次调用会同时计算输入Token和输出Token,两者共同决定单次调用成本73% similarUnverified在Transformer自回归推理模式下,输出Token数量与计算开销之间存在超线性关系73% similarUnverifiedLLM 的自回归生成特性决定其输出是逐 Token 的流式传输,源于 Transformer 架构的解码策略73% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/855688API
curl https://kongchang.com/api/v1/knowledge/claims/855688MCP
get_claim(id=855688)