概念Speculative Decoding
推测解码
由Google DeepMind于2023年正式提出的LLM推理加速技术,利用小模型快速生成草稿token后由大模型并行验证,可显著降低推理延迟和成本
时间轴 (近 90 天)
6月1日
MTP技术可以将推理速度提升约2倍
待验证70%
6月1日
推测解码、模型蒸馏、KV Cache优化等推理优化技术的持续进步正在使单位推理成本快速下降
待验证85%
由Google DeepMind于2023年正式提出的LLM推理加速技术,利用小模型快速生成草稿token后由大模型并行验证,可显著降低推理延迟和成本
MTP技术可以将推理速度提升约2倍
推测解码、模型蒸馏、KV Cache优化等推理优化技术的持续进步正在使单位推理成本快速下降