待验证50% 置信事实精确时间
LLM 推理请求分为 Prefill(输入)和 Decode(输出)两个阶段,Prefill 可并行读取吞吐极高,Decode 需逐字串行推理占用 GPU 时间显著更长
1
来源数
50%
置信度
长期有效
时效性
2026/9/2
首次发现
来源
涉及实体
相关事实
待验证在硬件层面,Prefill(输入)阶段可以并行读取所有Token并同时计算自注意力矩阵,而Decode(输出)阶段因自回归机制需逐字串行推理,导致GPU利用率骤降77% 相似已验证大语言模型推理分预填充和解码两阶段:预填充是计算密集型对GPU算力敏感,解码是内存带宽受限任务77% 相似待验证Prefill阶段是计算密集型操作,Decode阶段是显存带宽密集型操作77% 相似待验证Decode阶段属于访存密集型操作,整体吞吐受制于显存带宽而非算力74% 相似待验证输出Token定价高于输入Token是因为Prefill阶段可并行矩阵运算而Decode阶段必须串行自回归解码,Decode阶段GPU吞吐量约为Prefill阶段的1/6到1/1073% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/842836API
curl https://kongchang.com/api/v1/knowledge/claims/842836MCP
get_claim(id=842836)