Unverified85% confidenceFactExact time
传统混合部署中Prefill阶段的大批量计算会阻塞Decode阶段的token生成,导致TTFT波动剧烈
1
Sources
85%
Confidence
Long-term
Relevance
5/21/2026
First Seen
Sources
AMD GPU部署PD分离式SGLang多节点推理集群教程
twitterlmsysorg5/21/2026
Related Entities
Related Claims
UnverifiedTTFT由Prefill阶段决定受算力约束,TPOT对应Decode阶段受内存带宽约束77% similarUnverified推理延迟通常分解为首token延迟(TTFT)和后续token生成吞吐量两个核心指标76% similarUnverifiedLLM推理的prefill阶段并行处理输入所有token并生成初始KV Cache,是计算密集型操作,是TTFT的直接决定因素73% similarUnverified缓存命中时prefill阶段可跳过已缓存部分,TTFT可从数秒压缩至毫秒级69% similarUnverifiedPrefill阶段是计算密集型操作,Decode阶段是显存带宽密集型操作68% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/557API
curl https://kongchang.com/api/v1/knowledge/claims/557MCP
get_claim(id=557)