待验证50% 置信事实精确时间
Prefill阶段是计算密集型操作,Decode阶段是显存带宽密集型操作
1
来源数
50%
置信度
长期有效
时效性
2026/7/12
首次发现
来源
vLLM推理框架详解:吞吐优化核心原理与面试攻略
bilibiliAI大模型升升2026/6/9
相关事实
待验证Decode阶段属于访存密集型操作,整体吞吐受制于显存带宽而非算力83% 相似待验证输出Token定价高于输入Token是因为Prefill阶段可并行矩阵运算而Decode阶段必须串行自回归解码,Decode阶段GPU吞吐量约为Prefill阶段的1/6到1/1075% 相似待验证Disaggregated Inference架构将Prefill和Decode两个阶段分配到不同的硬件实例上执行74% 相似已验证大语言模型推理分预填充和解码两阶段:预填充是计算密集型对GPU算力敏感,解码是内存带宽受限任务71% 相似待验证PD分离将推理拆分为Prefill(计算密集、依赖内存容量)和Decode(串行、依赖内存带宽)两阶段,最早由学术界提出,后被字节跳动、微软落地70% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/489344API
curl https://kongchang.com/api/v1/knowledge/claims/489344MCP
get_claim(id=489344)