Unverified50% confidenceFactExact time
Prompt Cache操作的是Prefill阶段的计算,砍掉重复的前缀计算,但无法省略Decode的生成
1
Sources
50%
Confidence
Long-term
Relevance
9/11/2026
First Seen
Sources
Related Entities
Related Claims
Unverified输入Token可以在prefill阶段并行处理,而输出Token必须在decode阶段逐个串行生成72% similarUnverifiedP/D 分离(Prefill/Decode Disaggregation)将 Prefill 和 Decode 两阶段部署在不同节点,以针对各自计算特性独立扩容,同时优化吞吐量和首 token 延迟(TTFT)72% similarVerifiedPrefill阶段是计算密集型操作,Decode阶段是显存带宽密集型操作71% similarUnverified前缀缓存通过缓存常见的提示词前缀来减少重复计算,从而提升推理效率70% similarUnverifiedLLM 推理请求分为 Prefill(输入)和 Decode(输出)两个阶段,Prefill 可并行读取吞吐极高,Decode 需逐字串行推理占用 GPU 时间显著更长67% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/908130API
curl https://kongchang.com/api/v1/knowledge/claims/908130MCP
get_claim(id=908130)