ConceptSpeculative Decoding
推测解码
由Google DeepMind于2023年正式提出的LLM推理加速技术,利用小模型快速生成草稿token后由大模型并行验证,可显著降低推理延迟和成本
Timeline (last 90 days)
Jun 1
MTP技术可以将推理速度提升约2倍
Unverified70%
Jun 1
推测解码、模型蒸馏、KV Cache优化等推理优化技术的持续进步正在使单位推理成本快速下降
Unverified85%
由Google DeepMind于2023年正式提出的LLM推理加速技术,利用小模型快速生成草稿token后由大模型并行验证,可显著降低推理延迟和成本
MTP技术可以将推理速度提升约2倍
推测解码、模型蒸馏、KV Cache优化等推理优化技术的持续进步正在使单位推理成本快速下降