Unverified50% confidenceFactExact time
Decode 阶段属于访存密集型操作,每生成一个新 token 需从显存读取全部历史 token 的 KV Cache
1
Sources
50%
Confidence
Long-term
Relevance
7/22/2026
First Seen
Sources
Related Claims
UnverifiedDecode阶段属于访存密集型操作,整体吞吐受制于显存带宽而非算力71% similarUnverifiedKV Cache机制可以缓存重复的前缀内容,越简洁的系统提示词缓存命中率越高71% similarUnverified生成式AI推理中的自回归解码本质上是内存带宽受限(Memory-Bound)的操作,每次生成Token需读取全部KV Cache67% similarUnverified受限解码(Constrained Decoding)在自回归生成的每个Token步骤上,根据有限状态机或上下文无关文法计算合法Token集合并重新归一化概率,从数学上保证输出符合目标schema67% similarUnverified输出Token定价高于输入Token是因为Prefill阶段可并行矩阵运算而Decode阶段必须串行自回归解码,Decode阶段GPU吞吐量约为Prefill阶段的1/6到1/1065% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/585471API
curl https://kongchang.com/api/v1/knowledge/claims/585471MCP
get_claim(id=585471)