大语言模型的核心生成机制,每个生成步骤基于前面所有已生成token预测下一个token,时间复杂度随序列长度呈O(n²)增长,是推理性能瓶颈的根源
自回归解码阶段GPU算力利用率往往不足10%,属于内存密集型操作
输入Token可以在prefill阶段并行处理,而输出Token必须在decode阶段逐个串行生成
大模型推理的自回归生成需要逐Token串行输出,生成N个Token需要N次前向传播