Qwen3 Flash Next
阿里巴巴通义千问系列推出的大型MoE语言模型,总参数约1250亿,每次推理仅激活约60亿参数,支持本地GGUF格式部署,具备较强的编程能力
时间轴 (近 90 天)
Qwen3 Flash Next在本地运行中开发者Primitive报告的生成速度达到142.6 tokens/s
unsloth发布了Qwen3 Flash Next的GGUF量化版本,可通过Unsloth桌面版的Model Hub下载
开发者Primitive报告:关闭推测时为91.2 tokens/s,开启3个推测token后达到142.6 tokens/s,同一配置下约提速56%
即便是最激进的量化,177B总参数量的模型也要占用约72.5GB
UP主用两块廉价显卡(合计24GB显存)加32GB系统内存(总可用约50GB)在本地运行了占用约85GB的177B参数模型
Qwen3 Flash Next被视为新一代开源权重旗舰模型,智能指数能与前沿闭源模型相当
部署使用llama.cpp服务器,采用4-bit KV缓存、上下文长度设为100,000、将32层卸载到系统内存、启用惰性模式强制从SSD读取Ngram表
Windows上运行该模型比Linux慢约20%,短上下文约16 tokens/s,长上下文约10 tokens/s
全部知识事实 (8)
开发者Primitive报告:关闭推测时为91.2 tokens/s,开启3个推测token后达到142.6 tokens/s,同一配置下约提速56%
50%待验证Qwen3 Flash Next在本地运行中开发者Primitive报告的生成速度达到142.6 tokens/s
50%待验证unsloth发布了Qwen3 Flash Next的GGUF量化版本,可通过Unsloth桌面版的Model Hub下载
50%待验证即便是最激进的量化,177B总参数量的模型也要占用约72.5GB
50%待验证Qwen3 Flash Next被视为新一代开源权重旗舰模型,智能指数能与前沿闭源模型相当
50%待验证部署使用llama.cpp服务器,采用4-bit KV缓存、上下文长度设为100,000、将32层卸载到系统内存、启用惰性模式强制从SSD读取Ngram表
50%待验证Windows上运行该模型比Linux慢约20%,短上下文约16 tokens/s,长上下文约10 tokens/s
50%待验证UP主用两块廉价显卡(合计24GB显存)加32GB系统内存(总可用约50GB)在本地运行了占用约85GB的177B参数模型
50%