[KongchangAI]
ConceptSpeculative Decoding / 投机采样

投机解码

由Google Brain团队于2023年正式提出的LLM推理加速技术,通过引入小型草稿模型快速生成候选Token序列,再由主模型并行验证,理论上可将生成速度提升2-4倍

Core Facts

Timeline (last 90 days)

Sep 12

将水印与投机解码打通解决了加速时丢失水印的痛点

Unverified50%
Sep 12

v0.29.1rc0 为投机解码引入了双密钥 Gumbel-Max 水印(Dual-key gumbel-max watermarking)机制

Unverified50%
Sep 11

投机解码是一种无损加速技术,其输出在数学上与原始目标模型完全等价,因为所有token都经过了大模型验证

Unverified50%
Sep 11

接受率越高意味着草稿模型猜测越准,大模型返工次数越少,直接决定投机解码的实际加速效果

Unverified70%
Sep 11

投机解码在保证输出与原模型完全一致的前提下提升生成吞吐量

Unverified50%
Sep 11

投机解码适合在对准确性要求严苛的场景中部署,例如医疗文本生成、法律文档处理等领域

Unverified50%
Sep 11

投机解码是NVIDIA AI模型协同设计(Co-Design)系列文章的第三篇内容的核心主题

Unverified50%
Sep 11

DeepSeek官方DSpark本质是投机解码/多token预测技术,需要drafter模型和两套KV Cache驻留高速内存才能发挥最佳效果

Unverified50%
Sep 6

投机解码在候选token接受率较高时每次前向传播有效输出token可达2~4个,整体生成速度提升1.5x~3x

Unverified50%
Sep 6

投机解码的草稿接收率每提升10%,整体吞吐量可提升15%-25%

Unverified50%

13 more timeline events

All Facts (20)

Verified

投机解码用一个小型快速的草稿模型先行预测多个token,再由大模型一次性并行验证

90%
Verified

投机解码实际应用中通常能带来2-3倍的加速效果

65%
Verified

推测解码(Speculative Decoding)是目前最主流的大模型推理加速路径之一,使用小型草稿模型快速生成候选token再由主模型并行验证

65%
Unverified

推测解码、模型蒸馏、KV Cache优化等推理优化技术的持续进步正在使单位推理成本快速下降

85%
Partially Verified

MTP 是一种让模型在单次前向传播中预测多个后续 token 的技术,能减少推理计算轮次

75%
Unverified

接受率越高意味着草稿模型猜测越准,大模型返工次数越少,直接决定投机解码的实际加速效果

70%
Unverified

推测解码(Speculative Decoding)通过使用小模型预测大模型的输出token来减少计算量

60%
Unverified

将水印与投机解码打通解决了加速时丢失水印的痛点

50%
Unverified

投机解码是NVIDIA AI模型协同设计(Co-Design)系列文章的第三篇内容的核心主题

50%
Unverified

投机解码适合在对准确性要求严苛的场景中部署,例如医疗文本生成、法律文档处理等领域

50%
Unverified

投机解码是一种无损加速技术,其输出在数学上与原始目标模型完全等价,因为所有token都经过了大模型验证

50%
Unverified

投机解码在保证输出与原模型完全一致的前提下提升生成吞吐量

50%
Unverified

DeepSeek官方DSpark本质是投机解码/多token预测技术,需要drafter模型和两套KV Cache驻留高速内存才能发挥最佳效果

50%
Unverified

投机解码在候选token接受率较高时每次前向传播有效输出token可达2~4个,整体生成速度提升1.5x~3x

50%
Unverified

投机解码的草稿接收率每提升10%,整体吞吐量可提升15%-25%

50%
Unverified

投机解码的草稿模型推理成本通常仅为主模型的1/5-1/10

50%
Unverified

统一自回归框架使得LLM生态的优化工具链(包括KV-cache管理、张量并行策略、投机解码等)可以直接复用于图像生成

50%
Unverified

投机解码通过小型草稿模型生成候选token由主模型并行验证以提升推理速度;稀疏注意力将计算复杂度从O(n²)降至接近O(n)

50%
Unverified

投机解码使用轻量级草稿模型生成候选 token 后由大模型并行验证,是严格无损的加速,通常能带来 2-3 倍加速效果

50%
Unverified

缓解推理墙的技术手段包括模型量化(FP16降至INT8或INT4)、投机解码(用小模型预测大模型输出加速生成)以及KV Cache优化

50%

Source Articles