MTP
一种推理加速技术,在一次前向传播中同时预测多个未来Token,通过验证机制确认接受哪些预测,大幅提升Token生成速度,与Speculative Decoding理念相近
Core Facts
Timeline (last 90 days)
GLM-5.3直接从checkpoint中读取Multi-Token Prediction(MTP)配置
MTP已对Qwen3.8-Flash-Next和GLM-5.3-Flash默认启用,但用户可手动关闭
MTP在几乎所有主流推理工具中默认处于关闭状态
Qwen3.8-Flash-Next原生支持MTP,说明该能力在模型训练阶段就已内置
Qwen 3.8在M5 Max上基础速度为22 token/s,开启MTP后可提升到34甚至56 token/s
开启MTP不改变输出质量,输出结果与原始完全一致
MTP(Multi-Token Prediction,多令牌预测)是一个在大多数主流推理工具中默认关闭的配置标志,可加速推理
吞吐量在草稿令牌数为5左右达到约每秒115令牌峰值,然后回落,不随接受率线性变化
在Blackwell工作站显卡上,草稿令牌数为2时接受率81%,5时56%,8时40%
这批 Qwen3 去审查模型全部提供 GGUF 格式支持并保留了原生 MTP(多 Token 预测)能力
20 more timeline events
All Facts (20)
MTP(Multi-Token Prediction)辅助训练目标让模型在推理时可配合投机解码提升吞吐量
75%VerifiedMTP通过在模型输出层增加多个预测头,使模型在一次前向传播中同时预测未来N个token的概率分布,可在不损失生成质量的前提下实现2-4倍推理加速
75%VerifiedQwen3.6在训练时加入了MTP头,模型本身具备一次预测多个未来token的能力
65%UnverifiedQwen3.6 35B模型原生支持MTP,与oMLX结合可直接激活加速能力,无需额外配置独立的草稿模型
85%Partially VerifiedMTP 是一种让模型在单次前向传播中预测多个后续 token 的技术,能减少推理计算轮次
75%Partially Verified多 Token 预测(MTP)是 Meta 在 2024 年提出的训练与推理加速技术,并在 DeepSeek-V3 等模型中应用
75%UnverifiedMTP技术可以将推理速度提升约2倍
70%UnverifiedDeepSeek早在V3版本就引入了MTP技术
60%UnverifiedGLM-5.3直接从checkpoint中读取Multi-Token Prediction(MTP)配置
50%UnverifiedMTP已对Qwen3.8-Flash-Next和GLM-5.3-Flash默认启用,但用户可手动关闭
50%UnverifiedMTP在几乎所有主流推理工具中默认处于关闭状态
50%UnverifiedQwen3.8-Flash-Next原生支持MTP,说明该能力在模型训练阶段就已内置
50%UnverifiedQwen 3.8在M5 Max上基础速度为22 token/s,开启MTP后可提升到34甚至56 token/s
50%Unverified吞吐量在草稿令牌数为5左右达到约每秒115令牌峰值,然后回落,不随接受率线性变化
50%UnverifiedMTP(Multi-Token Prediction,多令牌预测)是一个在大多数主流推理工具中默认关闭的配置标志,可加速推理
50%Unverified开启MTP不改变输出质量,输出结果与原始完全一致
50%Unverified在Blackwell工作站显卡上,草稿令牌数为2时接受率81%,5时56%,8时40%
50%Unverified这批 Qwen3 去审查模型全部提供 GGUF 格式支持并保留了原生 MTP(多 Token 预测)能力
50%Unverified在微调过程中保留 MTP 能力是技术难点,因为如果训练流程未正确处理额外的预测头参数,MTP 模块的权重会被破坏或重置
50%Unverified该配置实现了262K超长上下文、KV Cache Q4量化和MTP投机采样三项优化,将24GB显存利用率压榨到99%
50%