待验证50% 置信事实精确时间
LLM推理的Prefill阶段是计算密集型操作,主要瓶颈是GPU/NPU算力(FLOPS)
1
来源数
50%
置信度
长期有效
时效性
2026/9/23
首次发现
来源
涉及实体
相关事实
已验证LLM 推理分为预填充阶段(Prefill,计算密集型)和解码阶段(Decode,内存带宽密集型)两个阶段79% 相似待验证LLM推理的prefill阶段并行处理输入所有token并生成初始KV Cache,是计算密集型操作,是TTFT的直接决定因素76% 相似已验证在LLM推理场景中GPU显存容量往往比算力峰值更为关键73% 相似待验证LLM推理的Prefill阶段计算复杂度随上下文长度呈O(n²)增长,是旗舰模型单次请求成本远高于轻量模型的根本原因73% 相似待验证自回归模型推理的Prefill阶段一次性处理全部prompt,是标准GEMM操作,算术强度高,属于compute-bound73% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/945138API
curl https://kongchang.com/api/v1/knowledge/claims/945138MCP
get_claim(id=945138)