Unverified50% confidenceFactExact time
在硬件层面,Prefill(输入)阶段可以并行读取所有Token并同时计算自注意力矩阵,而Decode(输出)阶段因自回归机制需逐字串行推理,导致GPU利用率骤降
1
Sources
50%
Confidence
Long-term
Relevance
9/2/2026
First Seen
Sources
Related Entities
Related Claims
Unverified输出Token定价高于输入Token是因为Prefill阶段可并行矩阵运算而Decode阶段必须串行自回归解码,Decode阶段GPU吞吐量约为Prefill阶段的1/6到1/1077% similarUnverified大语言模型推理的解码阶段GPU利用率远低于预填充阶段的矩阵并行计算,因为解码是逐步自回归生成76% similarVerified大语言模型推理分预填充和解码两阶段:预填充是计算密集型对GPU算力敏感,解码是内存带宽受限任务76% similarUnverifiedPrefill阶段是计算密集型操作,Decode阶段是显存带宽密集型操作71% similarUnverified大语言模型的推理过程分为预填充(Prefill)和解码(Decode)两个阶段,注意力机制的计算复杂度为O(n²)70% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/842317API
curl https://kongchang.com/api/v1/knowledge/claims/842317MCP
get_claim(id=842317)