MTP
一种推理加速技术,在一次前向传播中同时预测多个未来Token,通过验证机制确认接受哪些预测,大幅提升Token生成速度,与Speculative Decoding理念相近
核心事实
时间轴 (近 90 天)
Strata集成MTP投机解码提升生成速度,其解码器权重约0.71GB(Q2两位量化)
MTP草稿Token数量在接受率和计算开销之间做权衡,数值太大可能因草稿频繁被拒绝而得不偿失
Strata使用MTP层进行投机解码,报告平均每次验证能通过2.4到3.2个token
该模型核心125B参数,外加510亿参数的n-gram查找表和40亿参数的MTP(多token预测)draft层,总和约180B
在5070 12G显卡加64G内存配置下开启MTP后,生成速度能达到50 tokens/s以上,官方测试可达60~95 tokens/s
Strata集成的MTP投机解码技术命中率高于普通推理框架,整体带来1.6到1.8倍提速
Strata采用MTP(多Token预测)投机解码,一次推理猜测多个Token以摊薄每Token生成成本
Strata 会额外下载一个约 6GB 多的 data 目录,包含 MTP(多 token 预测)相关内容
部署时需要单独下载并覆盖RT文件才能真正激活MTP加速效果,缺少该步骤模型仍可运行但速度明显低于宣传数值
Qwen3.8-Flash-Next采用Strata推理引擎配合MTP(多Token预测)加速技术
还有 40 条时间轴事件
全部知识事实 (20)
MTP(Multi-Token Prediction)辅助训练目标让模型在推理时可配合投机解码提升吞吐量
90%已验证投机解码用一个小型快速的草稿模型先行预测多个token,再由大模型一次性并行验证
90%已验证多 Token 预测(MTP)是 Meta 在 2024 年提出的训练与推理加速技术,并在 DeepSeek-V3 等模型中应用
85%已验证MTP 是一种让模型在单次前向传播中预测多个后续 token 的技术,能减少推理计算轮次
80%已验证MTP通过在模型输出层增加多个预测头,使模型在一次前向传播中同时预测未来N个token的概率分布,可在不损失生成质量的前提下实现2-4倍推理加速
80%已验证DeepSeek的MTP基础版本草稿模型在主模型训练时协同优化,使草稿模型输出分布对齐目标模型,区别于事后蒸馏方案
75%已验证DeepSeek早在V3版本就引入了MTP技术
75%已验证与投机解码相比,MTP 的预测能力内置于模型本身,无需额外的草稿模型
65%已验证MTP(Multi-Token Prediction,多令牌预测)是一个在大多数主流推理工具中默认关闭的配置标志,可加速推理
65%已验证MTP(多Token预测)技术由Meta在2024年的研究中系统提出,并被Qwen、DeepSeek等主流开源模型采用
65%待验证MTP一次前向传播可同时产出多个token:主头输出token+1,第一个MTP头输出token+2,第二个MTP头输出token+3
90%待验证MTP的额外预测头直接复用Transformer的隐藏状态表示,因此额外的计算开销极小
90%待验证MTP(多令牌预测)最初由Meta在研究论文《Better & Faster Large Language Models via Multi-token Prediction》中系统提出
85%待验证MTP与DFlash在架构上有本质不同,但都属于投机解码技术谱系
85%待验证加载MTP层后额外浮点运算会导致数值产生微小变化,可能导致模型走不同推理路径产生不同结果,即使温度设为0也会出现
85%待验证Google在Gemma 4中实际应用了MTP技术
80%待验证Meta在LLaMA 3的技术报告中首次将MTP作为训练目标引入
80%待验证MTP和Speculative Decoding两项技术理论上可以叠加使用
75%待验证通过 MTP(多令牌预测)技术,Qwen3.8-Flash-Next 和 GLM-5.3-Flash 的推理速度提升最高达 2 倍
70%待验证Qwen3系列原生支持MTP
60%