Unverified70% confidenceFactExact time
推测解码通过轻量级草稿模型生成候选 token,主模型一次前向传播并行验证,接受符合分布的 token 并从第一个被拒绝处重新生成
2
Sources
70%
Confidence
Long-term
Relevance
9/24/2026
First Seen
Sources
Related Entities
Related Claims
Verified投机解码用一个小型快速的草稿模型先行预测多个token,再由大模型一次性并行验证75% similarUnverified在一次单步去噪步骤中,模型对每个答案槽位直接读出概率分布,而不是逐 token 采样生成74% similarUnverified推测解码技术通过小模型预测草稿、大模型验证的方式加速生成,KV Cache共享机制降低重复请求的计算冗余72% similarUnverifiedTransformer 模型推理时,输入 token 可并行处理(prefill 阶段),输出 token 必须逐个自回归生成(decode 阶段),导致输出 token 的单价通常高于输入 token71% similarUnverified推理 Token(Reasoning Token)概念源自 OpenAI o 系列模型,模型在输出可见答案前会先消耗 Token 进行内部推导,这些中间步骤对用户不可见但消耗真实算力71% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/945476API
curl https://kongchang.com/api/v1/knowledge/claims/945476MCP
get_claim(id=945476)