待验证50% 置信事实精确时间
Prefill 阶段需要一次性处理全部输入 token,属于计算密集型操作;Decode 阶段每步仅生成一个 token,属于内存带宽密集型操作
1
来源数
50%
置信度
长期有效
时效性
2026/10/4
首次发现
来源
涉及实体
相关事实
待验证预填充(Prefill)阶段是计算密集型任务,对算力要求高;解码(Decode)阶段是访存密集型任务,对显存带宽敏感75% 相似已验证连续批处理(Continuous Batching)采用迭代级别的调度粒度,每完成一个 token 生成便可移出已完成请求并插入新请求74% 相似待验证Prefix Cache 优化是指当多轮对话中系统提示词保持不变时,API 服务端可缓存该前缀的 KV 计算结果供后续请求复用,减少重复计算、降低延迟和 Token 成本72% 相似待验证由于自回归特性,每个decode step都需要访问之前所有token的KV Cache68% 相似待验证vLLM的前缀缓存(Prefix Caching)对KV Cache块计算哈希值,当新请求输入前缀与已缓存请求重叠时直接复用物理缓存块,跳过该部分prefill计算67% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/972253API
curl https://kongchang.com/api/v1/knowledge/claims/972253MCP
get_claim(id=972253)