待验证60% 置信事实精确时间
大模型推理分为Prefill和Decode两个阶段,Prefill是首Token延迟(TTFT)的重要组成部分,Decode对应每Token生成时间(TPOT)
2
来源数
60%
置信度
长期有效
时效性
2026/9/11
首次发现
来源
涉及实体
相关事实
已验证LLM 推理分为预填充阶段(Prefill,计算密集型)和解码阶段(Decode,内存带宽密集型)两个阶段76% 相似待验证LLM推理的prefill阶段并行处理输入所有token并生成初始KV Cache,是计算密集型操作,是TTFT的直接决定因素75% 相似待验证LLM推理成本主要由预填充(Prefill)阶段处理输入Token和解码(Decode)阶段生成输出Token两部分构成,代码理解场景中预填充占绝大部分开销70% 相似已验证推测解码(Speculative Decoding)是目前最主流的大模型推理加速路径之一,使用小型草稿模型快速生成候选token再由主模型并行验证68% 相似待验证Outlines 采用约束式解码(Constrained Decoding)思路,在生成的每一步约束模型的采样行为68% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/908129API
curl https://kongchang.com/api/v1/knowledge/claims/908129MCP
get_claim(id=908129)