Prefill
大模型推理的第一阶段,GPU并行处理全部输入token并建立KV Cache,决定首Token延迟(TTFT),是Prompt Cache主要优化的计算环节
核心事实
时间轴 (近 90 天)
Prefill 阶段需要一次性处理全部输入 token,属于计算密集型操作;Decode 阶段每步仅生成一个 token,属于内存带宽密集型操作
Prefill阶段的计算复杂度与序列长度呈二次方关系(O(n²))
LLM推理的Prefill阶段是计算密集型操作,主要瓶颈是GPU/NPU算力(FLOPS)
Neural Accelerator对Prefill的加速效果约3-5倍,远超对Decode的加速效果,后者更多受益于内存带宽提升
自回归模型推理的Prefill阶段一次性处理全部prompt,是标准GEMM操作,算术强度高,属于compute-bound
Prefill阶段是大语言模型推理的第一步,模型对输入的所有token并行进行完整的前向计算,生成每一层的KV Cache
Prefill的计算量与输入长度呈近似线性到平方关系,是推理延迟的主要来源之一
将预填充(Prefill)与解码(Decode)分离到不同资源运行是当前大规模推理服务优化资源利用率的主流架构
在推理流程中,Prefill 阶段计算密集且耗时较长,Decode 阶段逐 token 自回归生成且对延迟敏感
大模型推理分为Prefill和Decode两个阶段,Prefill是首Token延迟(TTFT)的重要组成部分,Decode对应每Token生成时间(TPOT)
还有 8 条时间轴事件
全部知识事实 (20)
Transformer 推理的 prefill 阶段主要受计算能力(FLOPS)瓶颈制约,而 decode 阶段主要受内存带宽瓶颈制约
65%待验证传统混合部署中Prefill阶段的大批量计算会阻塞Decode阶段的token生成,导致TTFT波动剧烈
85%待验证预填充(Prefill)阶段是计算密集型任务,对算力要求高;解码(Decode)阶段是访存密集型任务,对显存带宽敏感
70%部分验证LLM 推理分为预填充阶段(Prefill,计算密集型)和解码阶段(Decode,内存带宽密集型)两个阶段
65%待验证大模型推理分为Prefill和Decode两个阶段,Prefill是首Token延迟(TTFT)的重要组成部分,Decode对应每Token生成时间(TPOT)
60%待验证Prefill 阶段需要一次性处理全部输入 token,属于计算密集型操作;Decode 阶段每步仅生成一个 token,属于内存带宽密集型操作
50%待验证Prefill阶段的计算复杂度与序列长度呈二次方关系(O(n²))
50%待验证LLM推理的Prefill阶段是计算密集型操作,主要瓶颈是GPU/NPU算力(FLOPS)
50%待验证Neural Accelerator对Prefill的加速效果约3-5倍,远超对Decode的加速效果,后者更多受益于内存带宽提升
50%待验证自回归模型推理的Prefill阶段一次性处理全部prompt,是标准GEMM操作,算术强度高,属于compute-bound
50%待验证Prefill阶段是大语言模型推理的第一步,模型对输入的所有token并行进行完整的前向计算,生成每一层的KV Cache
50%待验证Prefill的计算量与输入长度呈近似线性到平方关系,是推理延迟的主要来源之一
50%待验证将预填充(Prefill)与解码(Decode)分离到不同资源运行是当前大规模推理服务优化资源利用率的主流架构
50%待验证在推理流程中,Prefill 阶段计算密集且耗时较长,Decode 阶段逐 token 自回归生成且对延迟敏感
50%待验证预填充阶段是计算密集型(compute-bound),需一次性处理全部输入token并生成KV Cache,注意力矩阵计算复杂度为O(n²)
50%待验证Prefill阶段属于计算密集型任务,GPU利用率通常达60-80%
50%待验证Transformer自回归生成分为Prefill阶段(计算密集型,GPU利用率较高)和Decode阶段(带宽密集型,逐token生成)
50%待验证LLM 推理请求分为 Prefill(输入)和 Decode(输出)两个阶段,Prefill 可并行读取吞吐极高,Decode 需逐字串行推理占用 GPU 时间显著更长
50%待验证在硬件层面,Prefill(输入)阶段可以并行读取所有Token并同时计算自注意力矩阵,而Decode(输出)阶段因自回归机制需逐字串行推理,导致GPU利用率骤降
50%待验证超大的prompt在prefill阶段可能会完全占用GPU数分钟,导致多用户满窗口任务时队列拥堵
50%