Speculative Decoding
一种大模型推理加速技术,通过小模型提前预测多个Token,再由主模型批量验证,从而提升推理速度
核心事实
时间轴 (近 90 天)
投机解码(Speculative Decoding)用一个更小的草稿模型快速猜测后续 token,再由主模型批量验证,可显著提升整体吞吐量;MTP 是其一种实现变体,Qwen 等模型原生支持
与投机解码相比,MTP 的预测能力内置于模型本身,无需额外的草稿模型
投机解码在不改变输出质量的前提下提升生成速度
根据英伟达官方测试,Qwen3 27B在Jetson上的最优解码组合是NVFP4量化叠加投机解码
主模型并行验证N个token的耗时与验证1个token几乎相同,整体吞吐量随草稿模型命中率线性提升
推理速度提升200倍的常见技术路径包括模型蒸馏、专用推理芯片/NPU加速、推测解码和量化压缩
投机解码在带宽已成硬性瓶颈或模型超过200B时加速比不如中小模型理想
云服务商可通过推测性解码、KV 缓存优化或专用推理硬件缩小大模型的延迟差距,但改善幅度有限
JEF 的设计思路来源于 LLM 推理加速领域的推测解码(Speculative Decoding)和模型级联(Model Cascading)概念
投机解码的实际加速效果高度依赖草稿模型与目标模型的匹配程度,接受率是评估其有效性的关键数据
还有 31 条时间轴事件
全部知识事实 (20)
推理优化技术包括量化(Quantization)、批处理(Batching)、KV缓存(Key-Value Cache)和推测解码(Speculative Decoding)
90%已验证MTP(Multi-Token Prediction)辅助训练目标让模型在推理时可配合投机解码提升吞吐量
90%已验证投机解码用一个小型快速的草稿模型先行预测多个token,再由大模型一次性并行验证
90%已验证推测解码(Speculative Decoding)范式由Google Brain和DeepMind团队于2023年几乎同期提出
90%已验证MTP 是一种让模型在单次前向传播中预测多个后续 token 的技术,能减少推理计算轮次
80%已验证投机解码通过拒绝采样协议保证最终输出分布与纯主模型生成完全一致
80%已验证大模型从平台语境主动推断设计规范的能力在技术上属于上下文推理(Contextual Reasoning),不依赖硬编码规则而是从海量数据中内化行业常识
75%已验证INT8量化、通道剪枝等模型压缩技术可在精度损失低于1% mAP的前提下将推理速度提升2-4倍
70%已验证投机解码(Speculative Decoding)技术相比逐Token串行生成可带来3-5倍的速度提升
70%已验证Speculative Decoding在草稿模型预测准确率达到60-80%时,整体推理速度可提升2-3倍
70%已验证与投机解码相比,MTP 的预测能力内置于模型本身,无需额外的草稿模型
65%已验证Flash系列通过MoE架构、推测性解码等技术,在每次推理时只激活部分参数以降低计算量
65%已验证多Token预测与投机解码结合可在不损失生成质量的情况下实现2-4倍的推理速度提升
65%已验证推测解码(Speculative Decoding)是目前最主流的大模型推理加速路径之一,使用小型草稿模型快速生成候选token再由主模型并行验证
65%待验证MTP与DFlash在架构上有本质不同,但都属于投机解码技术谱系
85%部分验证接受率越高意味着草稿模型猜测越准,大模型返工次数越少,直接决定投机解码的实际加速效果
80%待验证MTP和Speculative Decoding两项技术理论上可以叠加使用
75%待验证投机解码是一种无损的LLM推理加速技术,由Leviathan等人于2023年正式提出
70%待验证传统推测解码的验证过程对草稿提出的token以min(1, p(x)/q(x))的概率接受,被拒绝则从修正分布norm(max(0, p(x)-q(x)))重新采样,可证明产生的token分布与直接从目标模型采样完全一致(lossless)
70%待验证投机解码技术最早由Google DeepMind在论文《Fast Inference from Transformers via Speculative Decoding》中系统化提出
60%