待验证50% 置信事实精确时间
Decode 阶段属于访存密集型操作,每生成一个新 token 需从显存读取全部历史 token 的 KV Cache
1
来源数
50%
置信度
长期有效
时效性
2026/7/22
首次发现
来源
相关事实
待验证Decode阶段属于访存密集型操作,整体吞吐受制于显存带宽而非算力71% 相似待验证KV Cache机制可以缓存重复的前缀内容,越简洁的系统提示词缓存命中率越高71% 相似待验证生成式AI推理中的自回归解码本质上是内存带宽受限(Memory-Bound)的操作,每次生成Token需读取全部KV Cache67% 相似待验证受限解码(Constrained Decoding)在自回归生成的每个Token步骤上,根据有限状态机或上下文无关文法计算合法Token集合并重新归一化概率,从数学上保证输出符合目标schema67% 相似待验证输出Token定价高于输入Token是因为Prefill阶段可并行矩阵运算而Decode阶段必须串行自回归解码,Decode阶段GPU吞吐量约为Prefill阶段的1/6到1/1065% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/585471API
curl https://kongchang.com/api/v1/knowledge/claims/585471MCP
get_claim(id=585471)