Unverified50% confidenceFactExact time
输出Token定价高于输入Token是因为Prefill阶段可并行矩阵运算而Decode阶段必须串行自回归解码,Decode阶段GPU吞吐量约为Prefill阶段的1/6到1/10
1
Sources
50%
Confidence
Long-term
Relevance
7/23/2026
First Seen
Sources
Related Claims
UnverifiedPrefill阶段是计算密集型操作,Decode阶段是显存带宽密集型操作75% similarUnverified大语言模型推理的解码阶段GPU利用率远低于预填充阶段的矩阵并行计算,因为解码是逐步自回归生成75% similarUnverified受限解码(Constrained Decoding)在自回归生成的每个Token步骤上,根据有限状态机或上下文无关文法计算合法Token集合并重新归一化概率,从数学上保证输出符合目标schema69% similarUnverified自回归生成每个Token都需要完整的前向传播,而输入只需一次编码,这是输出比输入贵的成本结构原因68% similarVerified大语言模型推理分预填充和解码两阶段:预填充是计算密集型对GPU算力敏感,解码是内存带宽受限任务68% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/594429API
curl https://kongchang.com/api/v1/knowledge/claims/594429MCP
get_claim(id=594429)