Qwen Flash Next
阿里巴巴Qwen系列中的轻量高效模型,定位于在较小参数规模下实现高推理性能,支持多种量化格式部署
时间轴 (近 90 天)
官方在 Hugging Face 上提供了对应的 GGUF 量化模型文件,仓库地址为 ggml-org/Qwen3.8-Flash-Next-GGUF
具体的性能提升数据、兼容硬件范围和 MTP 实际加速比仍需官方文档和后续社区实测确认
围绕 Qwen Flash Next 模型的 MTP(多 token 预测)支持工作已经重新启动
开发者已为 Qwen Flash Next 准备好可切换使用的量化模型,并在 llama.cpp 仓库提交了对应的 Pull Request
该 MTP 支持工作目前仍处于 WIP(进行中)状态,尚未稳定
Qwen Flash Next 的量化模型托管于 Hugging Face 的 ggml-org/Qwen3.8-Flash-Next-GGUF 仓库,提供 GGUF 格式权重文件
一位Reddit用户使用Codex完成了Qwen Flash Next IQ4_XS量化版本与Qwen3 27B FP8版本的对比评测
在MMLU-Pro基准上Flash-Next IQ4_XS得分83.8%,Qwen3 27B FP8得分75.0%
在GSM8K上Flash-Next得97.5%对FP8的90.0%,德语MGSM上92.5%对90.0%,IFEval两者均为89.6%打平
完成250案例测试,FP8 27B用时36分27秒,Flash-Next IQ4_XS用时2小时05分47秒,相差约3.5倍
还有 2 条时间轴事件
全部知识事实 (12)
具体的性能提升数据、兼容硬件范围和 MTP 实际加速比仍需官方文档和后续社区实测确认
50%待验证该 MTP 支持工作目前仍处于 WIP(进行中)状态,尚未稳定
50%待验证完成250案例测试,FP8 27B用时36分27秒,Flash-Next IQ4_XS用时2小时05分47秒,相差约3.5倍
50%待验证测试者建议单用户场景选低量化的Flash Next以获得更高精度,需要并发处理则选FP8 27B因其速度约为QFN的4倍
50%待验证AMD的RX 9700系列GPU对mxfp4有硬件级加速支持,升级至128GB内存后使用mxfp4量化版Flash Next可使QFN速度提升约2倍
50%待验证在MMLU-Pro基准上Flash-Next IQ4_XS得分83.8%,Qwen3 27B FP8得分75.0%
50%待验证在GSM8K上Flash-Next得97.5%对FP8的90.0%,德语MGSM上92.5%对90.0%,IFEval两者均为89.6%打平
50%待验证官方在 Hugging Face 上提供了对应的 GGUF 量化模型文件,仓库地址为 ggml-org/Qwen3.8-Flash-Next-GGUF
50%待验证围绕 Qwen Flash Next 模型的 MTP(多 token 预测)支持工作已经重新启动
50%待验证开发者已为 Qwen Flash Next 准备好可切换使用的量化模型,并在 llama.cpp 仓库提交了对应的 Pull Request
50%待验证Qwen Flash Next 的量化模型托管于 Hugging Face 的 ggml-org/Qwen3.8-Flash-Next-GGUF 仓库,提供 GGUF 格式权重文件
50%待验证一位Reddit用户使用Codex完成了Qwen Flash Next IQ4_XS量化版本与Qwen3 27B FP8版本的对比评测
50%