[KongchangAI]
ConceptSpeculative Decoding

推测解码

由Google DeepMind于2023年正式提出的LLM推理加速技术,利用小模型快速生成草稿token后由大模型并行验证,可显著降低推理延迟和成本

Timeline (last 90 days)

Jun 1

MTP技术可以将推理速度提升约2倍

Unverified70%
Jun 1

推测解码、模型蒸馏、KV Cache优化等推理优化技术的持续进步正在使单位推理成本快速下降

Unverified85%

All Facts (2)

Source Articles