[控场AI]
概念预填充阶段

Prefill

大模型推理的第一阶段,GPU并行处理全部输入token并建立KV Cache,决定首Token延迟(TTFT),是Prompt Cache主要优化的计算环节

核心事实

时间轴 (近 90 天)

10月4日

Prefill 阶段需要一次性处理全部输入 token,属于计算密集型操作;Decode 阶段每步仅生成一个 token,属于内存带宽密集型操作

待验证50%
10月1日

Prefill阶段的计算复杂度与序列长度呈二次方关系(O(n²))

待验证50%
9月23日

LLM推理的Prefill阶段是计算密集型操作,主要瓶颈是GPU/NPU算力(FLOPS)

待验证50%
9月23日

Neural Accelerator对Prefill的加速效果约3-5倍,远超对Decode的加速效果,后者更多受益于内存带宽提升

待验证50%
9月23日

自回归模型推理的Prefill阶段一次性处理全部prompt,是标准GEMM操作,算术强度高,属于compute-bound

待验证50%
9月18日

Prefill阶段是大语言模型推理的第一步,模型对输入的所有token并行进行完整的前向计算,生成每一层的KV Cache

待验证50%
9月18日

Prefill的计算量与输入长度呈近似线性到平方关系,是推理延迟的主要来源之一

待验证50%
9月12日

将预填充(Prefill)与解码(Decode)分离到不同资源运行是当前大规模推理服务优化资源利用率的主流架构

待验证50%
9月11日

在推理流程中,Prefill 阶段计算密集且耗时较长,Decode 阶段逐 token 自回归生成且对延迟敏感

待验证50%
9月11日

大模型推理分为Prefill和Decode两个阶段,Prefill是首Token延迟(TTFT)的重要组成部分,Decode对应每Token生成时间(TPOT)

待验证60%

还有 8 条时间轴事件

全部知识事实 (20)

已验证

Transformer 推理的 prefill 阶段主要受计算能力(FLOPS)瓶颈制约,而 decode 阶段主要受内存带宽瓶颈制约

65%
待验证

传统混合部署中Prefill阶段的大批量计算会阻塞Decode阶段的token生成,导致TTFT波动剧烈

85%
待验证

预填充(Prefill)阶段是计算密集型任务,对算力要求高;解码(Decode)阶段是访存密集型任务,对显存带宽敏感

70%
部分验证

LLM 推理分为预填充阶段(Prefill,计算密集型)和解码阶段(Decode,内存带宽密集型)两个阶段

65%
待验证

大模型推理分为Prefill和Decode两个阶段,Prefill是首Token延迟(TTFT)的重要组成部分,Decode对应每Token生成时间(TPOT)

60%
待验证

Prefill 阶段需要一次性处理全部输入 token,属于计算密集型操作;Decode 阶段每步仅生成一个 token,属于内存带宽密集型操作

50%
待验证

Prefill阶段的计算复杂度与序列长度呈二次方关系(O(n²))

50%
待验证

LLM推理的Prefill阶段是计算密集型操作,主要瓶颈是GPU/NPU算力(FLOPS)

50%
待验证

Neural Accelerator对Prefill的加速效果约3-5倍,远超对Decode的加速效果,后者更多受益于内存带宽提升

50%
待验证

自回归模型推理的Prefill阶段一次性处理全部prompt,是标准GEMM操作,算术强度高,属于compute-bound

50%
待验证

Prefill阶段是大语言模型推理的第一步,模型对输入的所有token并行进行完整的前向计算,生成每一层的KV Cache

50%
待验证

Prefill的计算量与输入长度呈近似线性到平方关系,是推理延迟的主要来源之一

50%
待验证

将预填充(Prefill)与解码(Decode)分离到不同资源运行是当前大规模推理服务优化资源利用率的主流架构

50%
待验证

在推理流程中,Prefill 阶段计算密集且耗时较长,Decode 阶段逐 token 自回归生成且对延迟敏感

50%
待验证

预填充阶段是计算密集型(compute-bound),需一次性处理全部输入token并生成KV Cache,注意力矩阵计算复杂度为O(n²)

50%
待验证

Prefill阶段属于计算密集型任务,GPU利用率通常达60-80%

50%
待验证

Transformer自回归生成分为Prefill阶段(计算密集型,GPU利用率较高)和Decode阶段(带宽密集型,逐token生成)

50%
待验证

LLM 推理请求分为 Prefill(输入)和 Decode(输出)两个阶段,Prefill 可并行读取吞吐极高,Decode 需逐字串行推理占用 GPU 时间显著更长

50%
待验证

在硬件层面,Prefill(输入)阶段可以并行读取所有Token并同时计算自注意力矩阵,而Decode(输出)阶段因自回归机制需逐字串行推理,导致GPU利用率骤降

50%
待验证

超大的prompt在prefill阶段可能会完全占用GPU数分钟,导致多用户满窗口任务时队列拥堵

50%

来源文章