投机解码
由Google Brain团队于2023年正式提出的LLM推理加速技术,通过引入小型草稿模型快速生成候选Token序列,再由主模型并行验证,理论上可将生成速度提升2-4倍
核心事实
时间轴 (近 90 天)
将水印与投机解码打通解决了加速时丢失水印的痛点
v0.29.1rc0 为投机解码引入了双密钥 Gumbel-Max 水印(Dual-key gumbel-max watermarking)机制
投机解码是一种无损加速技术,其输出在数学上与原始目标模型完全等价,因为所有token都经过了大模型验证
接受率越高意味着草稿模型猜测越准,大模型返工次数越少,直接决定投机解码的实际加速效果
投机解码在保证输出与原模型完全一致的前提下提升生成吞吐量
投机解码适合在对准确性要求严苛的场景中部署,例如医疗文本生成、法律文档处理等领域
投机解码是NVIDIA AI模型协同设计(Co-Design)系列文章的第三篇内容的核心主题
DeepSeek官方DSpark本质是投机解码/多token预测技术,需要drafter模型和两套KV Cache驻留高速内存才能发挥最佳效果
投机解码在候选token接受率较高时每次前向传播有效输出token可达2~4个,整体生成速度提升1.5x~3x
投机解码的草稿接收率每提升10%,整体吞吐量可提升15%-25%
还有 13 条时间轴事件
全部知识事实 (20)
投机解码用一个小型快速的草稿模型先行预测多个token,再由大模型一次性并行验证
90%已验证投机解码实际应用中通常能带来2-3倍的加速效果
65%已验证推测解码(Speculative Decoding)是目前最主流的大模型推理加速路径之一,使用小型草稿模型快速生成候选token再由主模型并行验证
65%待验证推测解码、模型蒸馏、KV Cache优化等推理优化技术的持续进步正在使单位推理成本快速下降
85%部分验证MTP 是一种让模型在单次前向传播中预测多个后续 token 的技术,能减少推理计算轮次
75%待验证接受率越高意味着草稿模型猜测越准,大模型返工次数越少,直接决定投机解码的实际加速效果
70%待验证推测解码(Speculative Decoding)通过使用小模型预测大模型的输出token来减少计算量
60%待验证将水印与投机解码打通解决了加速时丢失水印的痛点
50%待验证投机解码是NVIDIA AI模型协同设计(Co-Design)系列文章的第三篇内容的核心主题
50%待验证投机解码适合在对准确性要求严苛的场景中部署,例如医疗文本生成、法律文档处理等领域
50%待验证投机解码是一种无损加速技术,其输出在数学上与原始目标模型完全等价,因为所有token都经过了大模型验证
50%待验证投机解码在保证输出与原模型完全一致的前提下提升生成吞吐量
50%待验证DeepSeek官方DSpark本质是投机解码/多token预测技术,需要drafter模型和两套KV Cache驻留高速内存才能发挥最佳效果
50%待验证投机解码在候选token接受率较高时每次前向传播有效输出token可达2~4个,整体生成速度提升1.5x~3x
50%待验证投机解码的草稿接收率每提升10%,整体吞吐量可提升15%-25%
50%待验证投机解码的草稿模型推理成本通常仅为主模型的1/5-1/10
50%待验证统一自回归框架使得LLM生态的优化工具链(包括KV-cache管理、张量并行策略、投机解码等)可以直接复用于图像生成
50%待验证投机解码通过小型草稿模型生成候选token由主模型并行验证以提升推理速度;稀疏注意力将计算复杂度从O(n²)降至接近O(n)
50%待验证投机解码使用轻量级草稿模型生成候选 token 后由大模型并行验证,是严格无损的加速,通常能带来 2-3 倍加速效果
50%待验证缓解推理墙的技术手段包括模型量化(FP16降至INT8或INT4)、投机解码(用小模型预测大模型输出加速生成)以及KV Cache优化
50%