[KongchangAI]
ConceptMulti-Token Prediction / 多Token预测

MTP

一种推理加速技术,在一次前向传播中同时预测多个未来Token,通过验证机制确认接受哪些预测,大幅提升Token生成速度,与Speculative Decoding理念相近

Core Facts

Timeline (last 90 days)

Sep 12

GLM-5.3直接从checkpoint中读取Multi-Token Prediction(MTP)配置

Unverified50%
Sep 11

MTP已对Qwen3.8-Flash-Next和GLM-5.3-Flash默认启用,但用户可手动关闭

Unverified50%
Sep 10

MTP在几乎所有主流推理工具中默认处于关闭状态

Unverified50%
Sep 10

Qwen3.8-Flash-Next原生支持MTP,说明该能力在模型训练阶段就已内置

Unverified50%
Sep 10

Qwen 3.8在M5 Max上基础速度为22 token/s,开启MTP后可提升到34甚至56 token/s

Unverified50%
Sep 10

开启MTP不改变输出质量,输出结果与原始完全一致

Unverified50%
Sep 10

MTP(Multi-Token Prediction,多令牌预测)是一个在大多数主流推理工具中默认关闭的配置标志,可加速推理

Unverified50%
Sep 10

吞吐量在草稿令牌数为5左右达到约每秒115令牌峰值,然后回落,不随接受率线性变化

Unverified50%
Sep 10

在Blackwell工作站显卡上,草稿令牌数为2时接受率81%,5时56%,8时40%

Unverified50%
Sep 7

这批 Qwen3 去审查模型全部提供 GGUF 格式支持并保留了原生 MTP(多 Token 预测)能力

Unverified50%

20 more timeline events

All Facts (20)

Verified

MTP(Multi-Token Prediction)辅助训练目标让模型在推理时可配合投机解码提升吞吐量

75%
Verified

MTP通过在模型输出层增加多个预测头,使模型在一次前向传播中同时预测未来N个token的概率分布,可在不损失生成质量的前提下实现2-4倍推理加速

75%
Verified

Qwen3.6在训练时加入了MTP头,模型本身具备一次预测多个未来token的能力

65%
Unverified

Qwen3.6 35B模型原生支持MTP,与oMLX结合可直接激活加速能力,无需额外配置独立的草稿模型

85%
Partially Verified

MTP 是一种让模型在单次前向传播中预测多个后续 token 的技术,能减少推理计算轮次

75%
Partially Verified

多 Token 预测(MTP)是 Meta 在 2024 年提出的训练与推理加速技术,并在 DeepSeek-V3 等模型中应用

75%
Unverified

MTP技术可以将推理速度提升约2倍

70%
Unverified

DeepSeek早在V3版本就引入了MTP技术

60%
Unverified

GLM-5.3直接从checkpoint中读取Multi-Token Prediction(MTP)配置

50%
Unverified

MTP已对Qwen3.8-Flash-Next和GLM-5.3-Flash默认启用,但用户可手动关闭

50%
Unverified

MTP在几乎所有主流推理工具中默认处于关闭状态

50%
Unverified

Qwen3.8-Flash-Next原生支持MTP,说明该能力在模型训练阶段就已内置

50%
Unverified

Qwen 3.8在M5 Max上基础速度为22 token/s,开启MTP后可提升到34甚至56 token/s

50%
Unverified

吞吐量在草稿令牌数为5左右达到约每秒115令牌峰值,然后回落,不随接受率线性变化

50%
Unverified

MTP(Multi-Token Prediction,多令牌预测)是一个在大多数主流推理工具中默认关闭的配置标志,可加速推理

50%
Unverified

开启MTP不改变输出质量,输出结果与原始完全一致

50%
Unverified

在Blackwell工作站显卡上,草稿令牌数为2时接受率81%,5时56%,8时40%

50%
Unverified

这批 Qwen3 去审查模型全部提供 GGUF 格式支持并保留了原生 MTP(多 Token 预测)能力

50%
Unverified

在微调过程中保留 MTP 能力是技术难点,因为如果训练流程未正确处理额外的预测头参数,MTP 模块的权重会被破坏或重置

50%
Unverified

该配置实现了262K超长上下文、KV Cache Q4量化和MTP投机采样三项优化,将24GB显存利用率压榨到99%

50%

Source Articles