待验证50% 置信基准精确时间
在2944 token输入、1024 token输出条件下,普通模式达到每秒29.9 token,开启MTP2后提升到48.4 token/s
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/10/5
首次发现
有效期至:2027/1/3
来源
涉及实体
相关事实
待验证启用多token预测(MTP)草拟深度为2时,R9700 从 27.1 升到 46.2 tokens/s(+70%),B70 从 21.4 升到 28.4 tokens/s(+33%)74% 相似待验证在Gemma 4 12B模型的Token生成测试中,Spark达26.4 tokens/s、Halo 24.6 tokens/s、M4 Pro最快33.8 tokens/s73% 相似待验证Qwen 3.8在M5 Max上基础速度为22 token/s,开启MTP后可提升到34甚至56 token/s71% 相似待验证据Artificial Analysis测试,Grok 4.6在MXX High档位约消耗38k tokens每任务,而Grok 4.7飙升至81k tokens70% 相似待验证投机采样中当候选 token 的接受率较高时,每次前向传播的有效输出 token 数量可达 2~4 个,从而将整体生成速度提升 1.5x~3x69% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/978643API
curl https://kongchang.com/api/v1/knowledge/claims/978643MCP
get_claim(id=978643)