Unverified50% confidenceSolutionExact time
PD分离将推理拆分为Prefill(计算密集、依赖内存容量)和Decode(串行、依赖内存带宽)两阶段,最早由学术界提出,后被字节跳动、微软落地
1
Sources
50%
Confidence
Long-term
Relevance
7/6/2026
First Seen
Sources
GLM-4系列开源逆袭:AI战争蔓延至内存争夺与太空算力
bilibili智灵Shaw7/3/2026
Related Claims
UnverifiedPrefill阶段是计算密集型操作,Decode阶段是显存带宽密集型操作70% similarVerified大语言模型推理分预填充和解码两阶段:预填充是计算密集型对GPU算力敏感,解码是内存带宽受限任务66% similarUnverifiedDisaggregated Inference架构将Prefill和Decode两个阶段分配到不同的硬件实例上执行65% similarUnverifiedDecode阶段属于访存密集型操作,整体吞吐受制于显存带宽而非算力61% similarUnverified文本生成阶段是memory-bound问题,速度受限于内存带宽;预填充阶段是compute-bound场景,可高度并行化59% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/114158API
curl https://kongchang.com/api/v1/knowledge/claims/114158MCP
get_claim(id=114158)