一种推理加速技术,在一次前向传播中同时预测多个未来Token,通过验证机制确认接受哪些预测,大幅提升Token生成速度,与Speculative Decoding理念相近
MTP 层作为草稿模型集成在主模型架构中,共享底层表示,接受长度越长每次前向传播产出的有效 token 越多
GLM-5.2 对 MTP 层(Multi-Token Prediction)的改进将投机解码的接受长度最高提升了 20%
MTP技术可以将推理速度提升约2倍
Qwen3.6在训练时加入了MTP头,模型本身具备一次预测多个未来token的能力