待验证50% 置信基准精确时间
启用多token预测(MTP)草拟深度为2时,R9700 从 27.1 升到 46.2 tokens/s(+70%),B70 从 21.4 升到 28.4 tokens/s(+33%)
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/10/5
首次发现
有效期至:2027/1/3
来源
涉及实体
相关事实
待验证Qwen 3.8在M5 Max上基础速度为22 token/s,开启MTP后可提升到34甚至56 token/s71% 相似待验证投机采样中当候选 token 的接受率较高时,每次前向传播的有效输出 token 数量可达 2~4 个,从而将整体生成速度提升 1.5x~3x68% 相似待验证据Artificial Analysis测试,Grok 4.6在MXX High档位约消耗38k tokens每任务,而Grok 4.7飙升至81k tokens68% 相似待验证在Gemma 4 12B模型的Token生成测试中,Spark达26.4 tokens/s、Halo 24.6 tokens/s、M4 Pro最快33.8 tokens/s67% 相似待验证把上下文从256 token扩展到2,048 token后,在FEVEROUS上固定答案条件下的证据增益分别提升了3.84(Qwen)和3.10(Llama)个百分点66% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/977978API
curl https://kongchang.com/api/v1/knowledge/claims/977978MCP
get_claim(id=977978)