待验证80% 置信事实时间未知
Qwen3.6 MTP-GGUF版本在单GPU上将35B-A3B模型的推理速度推到220 token/s,比原版GGUF快超过1.4倍,且精度零损失
1
来源数
80%
置信度
中期 (~90 天)
时效性
2026/6/1
首次发现
有效期至:2026/8/30
来源
Qwen3.6 MTP加速实测:单GPU推理飙到220 token/s
bilibili普通鱼学家呀
涉及实体
相关事实
待验证Qwen3.6 35B模型借助MTP技术在oMLX上达到了86.7 tokens/s的生成速度,prompt处理速度为1735 tokens/s74% 相似待验证Qwen3.5在32K上下文下比上一代Qwen3 Max快8.6倍,在256K上下文下快19倍74% 相似待验证实测中Qwen3 27B在未开启NVLink的4张魔改2080Ti上生成速度约为40多token/秒73% 相似待验证在24GB显存的显卡上运行Qwen3.6 27B模型,未经优化可达每秒约40个Token的生成速度,优化后可达50-60 Token/s73% 相似待验证RTX 5090上Qwen3.6 27B模型Q4量化不开MTP解码速度约63 token/s,开启MTP后跳到105 token/s72% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/18049API
curl https://kongchang.com/api/v1/knowledge/claims/18049MCP
get_claim(id=18049)