[控场AI]
模型QFN / Flash Next

Qwen Flash Next

阿里巴巴Qwen系列中的轻量高效模型,定位于在较小参数规模下实现高推理性能,支持多种量化格式部署

时间轴 (近 90 天)

10月1日

官方在 Hugging Face 上提供了对应的 GGUF 量化模型文件,仓库地址为 ggml-org/Qwen3.8-Flash-Next-GGUF

待验证50%
10月1日

具体的性能提升数据、兼容硬件范围和 MTP 实际加速比仍需官方文档和后续社区实测确认

待验证50%
10月1日

围绕 Qwen Flash Next 模型的 MTP(多 token 预测)支持工作已经重新启动

待验证50%
10月1日

开发者已为 Qwen Flash Next 准备好可切换使用的量化模型,并在 llama.cpp 仓库提交了对应的 Pull Request

待验证50%
10月1日

该 MTP 支持工作目前仍处于 WIP(进行中)状态,尚未稳定

待验证50%
10月1日

Qwen Flash Next 的量化模型托管于 Hugging Face 的 ggml-org/Qwen3.8-Flash-Next-GGUF 仓库,提供 GGUF 格式权重文件

待验证50%
9月25日

一位Reddit用户使用Codex完成了Qwen Flash Next IQ4_XS量化版本与Qwen3 27B FP8版本的对比评测

待验证50%
9月25日

在MMLU-Pro基准上Flash-Next IQ4_XS得分83.8%,Qwen3 27B FP8得分75.0%

待验证50%
9月25日

在GSM8K上Flash-Next得97.5%对FP8的90.0%,德语MGSM上92.5%对90.0%,IFEval两者均为89.6%打平

待验证50%
9月25日

完成250案例测试,FP8 27B用时36分27秒,Flash-Next IQ4_XS用时2小时05分47秒,相差约3.5倍

待验证50%

还有 2 条时间轴事件

全部知识事实 (12)

来源文章