[控场AI]
概念Speculative Decoding

推测解码

由Google DeepMind于2023年正式提出的LLM推理加速技术,利用小模型快速生成草稿token后由大模型并行验证,可显著降低推理延迟和成本

时间轴 (近 90 天)

6月1日

MTP技术可以将推理速度提升约2倍

待验证70%
6月1日

推测解码、模型蒸馏、KV Cache优化等推理优化技术的持续进步正在使单位推理成本快速下降

待验证85%

全部知识事实 (2)

来源文章