待验证70% 置信事实精确时间
推测解码通过轻量级草稿模型生成候选 token,主模型一次前向传播并行验证,接受符合分布的 token 并从第一个被拒绝处重新生成
2
来源数
70%
置信度
长期有效
时效性
2026/9/24
首次发现
来源
涉及实体
相关事实
已验证投机解码用一个小型快速的草稿模型先行预测多个token,再由大模型一次性并行验证75% 相似待验证在一次单步去噪步骤中,模型对每个答案槽位直接读出概率分布,而不是逐 token 采样生成74% 相似待验证推测解码技术通过小模型预测草稿、大模型验证的方式加速生成,KV Cache共享机制降低重复请求的计算冗余72% 相似待验证Transformer 模型推理时,输入 token 可并行处理(prefill 阶段),输出 token 必须逐个自回归生成(decode 阶段),导致输出 token 的单价通常高于输入 token71% 相似待验证推理 Token(Reasoning Token)概念源自 OpenAI o 系列模型,模型在输出可见答案前会先消耗 Token 进行内部推导,这些中间步骤对用户不可见但消耗真实算力71% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/945476API
curl https://kongchang.com/api/v1/knowledge/claims/945476MCP
get_claim(id=945476)