Unverified50% confidenceFactExact time
LLM推理的prefill阶段并行处理输入所有token并生成初始KV Cache,是计算密集型操作,是TTFT的直接决定因素
1
Sources
50%
Confidence
Long-term
Relevance
7/15/2026
First Seen
Sources
Related Claims
VerifiedLLM 推理分为预填充阶段(Prefill,计算密集型)和解码阶段(Decode,内存带宽密集型)两个阶段79% similarUnverified上下文缓存技术底层依赖KV Cache机制,是vLLM、TensorRT-LLM等主流推理框架的核心优化之一79% similarUnverifiedLLM自回归解码阶段每生成一个token都需从显存加载全量模型权重,批量较小时形成内存墙73% similarUnverifiedLLM的记忆依赖于上下文窗口,即模型在单次推理时能够处理的最大Token数量73% similarUnverifiedLLM推理成本主要由预填充(Prefill)阶段处理输入Token和解码(Decode)阶段生成输出Token两部分构成,代码理解场景中预填充占绝大部分开销73% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/511490API
curl https://kongchang.com/api/v1/knowledge/claims/511490MCP
get_claim(id=511490)