待验证50% 置信基准精确时间
Qwen 3.8在M5 Max上基础速度为22 token/s,开启MTP后可提升到34甚至56 token/s
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/10
首次发现
有效期至:2026/12/9
来源
涉及实体
相关事实
待验证Qwen3.7 Max已支持百万Token级别的上下文长度70% 相似待验证在Gemma 4 12B模型的Token生成测试中,Spark达26.4 tokens/s、Halo 24.6 tokens/s、M4 Pro最快33.8 tokens/s70% 相似待验证在Mac M3 Ultra上运行Qwen3系列量化模型,Q8量化下推理速度达到约34 tokens/s69% 相似待验证Qwen2.5-Max-0902最大输出为13万Token,推理模式下上限可达26万Token68% 相似待验证Qwen3.6 34B 80层模型在LM Studio上的MTP推测解码接受率约为78%,而原版27B仅约57-58%67% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/887804API
curl https://kongchang.com/api/v1/knowledge/claims/887804MCP
get_claim(id=887804)