待验证75% 置信事实时间未知
Qwen3.6 35B模型借助MTP技术在oMLX上达到了86.7 tokens/s的生成速度,prompt处理速度为1735 tokens/s
1
来源数
75%
置信度
中期 (~90 天)
时效性
2026/6/1
首次发现
有效期至:2026/8/30
来源
oMLX+MTP+Qwen3.6:本地AI编程速度突破新极限
bilibili安得广厦千万间678
涉及实体
相关事实
待验证RTX 5090上Qwen3.6 27B模型Q4量化不开MTP解码速度约63 token/s,开启MTP后跳到105 token/s85% 相似待验证在24GB显存的显卡上运行Qwen3.6 27B模型,未经优化可达每秒约40个Token的生成速度,优化后可达50-60 Token/s78% 相似待验证在Mac上使用MTP-LX 4bit量化运行Qwen3.6-27B,生成速度达到43.6 tok/s78% 相似待验证Qwen3-0.6B 经 INT4 量化后模型文件仅约 400MB,保留约 95% 基准能力,普通笔记本 CPU 即可实现每秒 10-30 token 生成速度76% 相似待验证RTX 5090上Qwen3.6 27B模型预填充速度从174提升到253 token/s,显存占用约18GB75% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/36176API
curl https://kongchang.com/api/v1/knowledge/claims/36176MCP
get_claim(id=36176)