一种大模型推理加速技术,通过小模型提前预测多个Token,再由主模型批量验证,从而提升推理速度
推理优化技术包括量化(Quantization)、批处理(Batching)、KV缓存(Key-Value Cache)和推测解码(Speculative Decoding)
INT8量化、通道剪枝等模型压缩技术可在精度损失低于1% mAP的前提下将推理速度提升2-4倍