Qwen3 Next Flash实测:Qwen4架构预览模型深度评测

阿里巴巴近日发布了通义千问系列的重磅预览模型——Qwen3 Next Flash。这不仅仅是又一次常规迭代,而是即将到来的Qwen4系列模型底层架构的首次公开预览。YouTube科技博主Bijan Bowen第一时间对其进行了深度实测,涵盖了从视觉理解到复杂3D游戏生成的多项高难度任务。本文将结合这次实测,剖析Qwen3 Next Flash的能力边界与技术亮点。
Qwen3 Next Flash的混合专家架构:Ngram嵌入如何降低显存压力
Qwen3 Next Flash采用了混合专家(MoE)架构,其参数配置相当有意思:主模型为1250亿参数,其中激活参数仅60亿,此外还额外挂载了一个510亿参数的Ngram嵌入表。
混合专家架构是近年来大模型领域最重要的效率突破之一。传统的稠密(Dense)模型在推理时会激活全部参数,而MoE模型将前馈网络层拆分为多个并行的"专家"子网络,每次推理时通过一个门控(Gating)机制只激活其中少数几个专家。这意味着模型可以拥有极大的总参数量——赋予其更强的知识容量和表达能力——但实际计算量仅与被激活的专家数成正比。Google的Switch Transformer(2021年)是早期代表,而Mistral的Mixtral 8x7B则让MoE架构在开源社区真正流行起来。Qwen3 Next Flash的1250亿总参数与60亿激活参数之间约20:1的比例,是一个相当激进的稀疏度设计,意味着推理成本被压缩到了极致。
这里最值得关注的技术创新在于Ngram嵌入的处理方式。Ngram(N元语法)是自然语言处理中的经典概念,指连续出现的N个词或字符的组合。Qwen3 Next Flash创新性地将Ngram嵌入表作为模型的辅助组件——模型根据当前上下文中的局部词组合直接检索预存的向量表示,而非通过神经网络层逐步计算。由于查表操作本质上是内存访问而非矩阵乘法,它几乎不消耗GPU算力,却能显著扩展模型的词汇和语义覆盖面。模型通过这种本地上下文查表来扩展模型容量,而这部分几乎不需要额外的计算开销。更关键的是,这个嵌入表可以被卸载到主机内存(CPU RAM),并通过异步预取与模型计算重叠执行。
所谓异步预取(Asynchronous Prefetching),是一种经典的计算机系统优化技术:在当前计算任务执行的同时,提前将下一步所需的数据从较慢的存储层(如CPU内存)加载到较快的存储层(如GPU显存)。这样数据传输的延迟就被"隐藏"在计算时间内,不会造成GPU空转等待。在Qwen3 Next Flash的设计中,510亿参数的Ngram嵌入表驻留在CPU RAM中,模型在GPU上执行当前层计算的同时,异步地将下一步需要查询的嵌入向量预取到GPU显存——这种流水线式的设计使得巨大的嵌入表不占用宝贵的GPU显存,却几乎不影响推理速度。
这意味着什么?表面上看,1760亿参数的MoE模型对普通用户而言几乎是天方夜谭。但由于Ngram嵌入部分明确设计为可卸载到CPU内存,实际对GPU显存的压力大大减轻。用博主的话说,这是一种既减轻了大GPU负担、又提升了模型能力的巧妙设计——当然你依然需要足够大的系统内存来承载。
从可访问性来看,该模型已在Hugging Face上开放权重,Unsloth更是提供了零日(day-zero)支持。Unsloth团队专注于提供高质量的量化转换和推理优化,其"零日支持"意味着模型发布当天即可获得优化的量化版本,这对开源社区的快速采用至关重要。其4-bit量化版本(Q4K XL)约111GB——Q4K是llama.cpp生态中的一种分组量化方案,对不同层根据重要性采用不同的量化精度,在压缩率和精度损失之间取得了良好的平衡。API定价也颇具竞争力:输入每百万token仅0.16美元,输出0.47美元,属于相当便宜的价位区间。
视觉能力实测:像素级复刻精准度令人震撼
博主首先进行的是经典的"浏览器操作系统"测试,但这次加入了多模态元素——给模型一张参考截图,要求它进行像素级复刻,同时还要实现GTA克隆游戏、程序化壁纸、邮件客户端等一整套功能。

结果令博主直呼"难以置信"。他表示这是迄今为止见过的最清晰的图像复刻,没有之一。为了完成这个任务,模型甚至将源图像切片、生成热力图、进行并排对比,以确保能够更精准地实现像素级还原。
生成的桌面系统充满了细节彩蛋:邮件客户端里藏着关于游戏、meta信息的创意文案("记得多买几张软盘"这样的自嘲式便签),日历、计算器、屏保设置等应用一应俱全。屏保的视觉风格甚至刻意做成了与参考图同时代的复古效果,而非现代UI,这种对时代美学的把握相当细腻。
C++ 3D赛车游戏生成:禁用Raylib仍媲美GPT-5.2 Pro
在C++ 3D低多边形拉力赛游戏测试中,博主特意禁止模型使用Raylib库,以增加难度并避免"刷分"的可能性——因为这个任务几乎没有现成参考。
Raylib是一个轻量级的跨平台游戏开发库,以C语言编写并提供C++绑定,封装了OpenGL图形渲染、音频播放、输入处理等底层功能。在AI编程能力评测中,Raylib因其简洁直观的API设计,常常成为模型的"拐杖"——大量训练数据中包含Raylib示例代码,模型可以轻松组合这些模式生成看似完整的游戏。禁用Raylib意味着模型必须直接操作更底层的图形API(如原生OpenGL),或从零实现渲染管线、物理模拟等模块,这对代码生成能力的考验要严苛得多。
结果堪称惊艳:生成的赛车游戏可以漂移、可以撞车,赛道有水面、有地形起伏,看台上甚至有观众在观看比赛,还配备了小地图和速度表。博主注意到一个有趣的细节:赛车在一档时会撞到转速限制器而"发抖",因为它没有换挡——这种物理拟真度相当到位。
为了凸显这一成绩的含金量,博主直接对比了GPT-5.2 Pro(其Pro版本性能明显更强)的同类C++赛车游戏结果。说个细节,GPT-5.2 Pro还用了Raylib库,而Qwen3 Next Flash是在禁用Raylib的更难条件下完成的,两者对比之下Qwen的表现"完全令人印象深刻"。博主强调,这对于"可在本地系统合理运行的智能民主化"不能忽视。
主动调用Blender+Godot:AI工具链选择的自主意识
在1980年代美学风格的3D摔跤游戏测试中,Qwen3 Next Flash展现了惊人的主动性。提示词并未指定技术栈,但模型主动检测系统中是否安装了Godot和Blender,随后决定用Blender制作资产、用Godot搭建游戏,而非选择更省事的Three.js方案。
Blender是全球最流行的开源3D建模、动画和渲染软件,广泛用于游戏资产制作、影视特效和建筑可视化。Godot则是一个开源的跨平台游戏引擎,支持2D和3D游戏开发,以其轻量级和MIT许可证著称。AI模型主动选择Blender+Godot而非Three.js(一个基于WebGL的JavaScript 3D库),意味着它识别到了任务的复杂度——Three.js适合快速的浏览器内3D演示,但对于需要精细建模、骨骼绑定和完整游戏逻辑的项目,Blender制作资产+Godot组装游戏是更专业的工作流。这种"工具选择的自主判断"反映了模型对软件工程实践的深层理解。

博主偷看了模型在Blender中生成的角色渲染图后,形容其"绝对令人震惊"——模型认真地为摔跤手建模肌肉、服装,甚至摆出战斗姿势,还包括了裁判角色和完整的选手名单。尽管这些模型看起来有些"惊悚",但其投入的工作量确实令人印象深刻。
然而理想丰满、现实骨感。当真正运行游戏时,问题浮现:擂台中央出现巨大的白色色块难以调试,摔跤手在擂台启动时会穿过地板掉落。博主坦言"潜力巨大,但目前还不到100%"。这也印证了预览模型的定位——架构方向清晰,但细节仍需打磨。
空间理解仍是短板:3D房间渲染暴露Qwen系列弱点
在"根据房间参考照片用Blender创建等距视角场景"的测试中,Qwen3 Next Flash暴露了一个一贯的弱点。

模型聪明地将源照片切片,直接用作场景中的贴图纹理——比如墙上的画作和苹果历史海报,都是复用了照片贴图,甚至捕捉到了角落中不易察觉的紫色光效、PC机的RGB灯光、CPU散热器上的光点等细节。
但整体场景的空间组织却相当混乱:整个场景被"翻转"了,PC的位置放错了墙面,线缆垂到了地上。博主指出:"Qwen模型在空间理解方面似乎一直存在某种问题。"这里的"空间理解"指的是模型从2D图像中推断3D空间布局的能力——包括物体之间的相对位置关系、深度排列、遮挡关系以及房间的整体几何结构。这种能力要求模型不仅能识别图像中"有什么",更要理解"在哪里"以及"如何排列",属于计算机视觉中较为高阶的推理任务。相比之下,DeepSeek V4 Flash在这项任务上虽然单个元素细节不如Qwen,但整体空间还原更准确。
本地4-bit量化运行实测:Unsloth Q4K M版Subway FPS验证
博主还在本地硬件上运行了Unsloth的Q4K M量化版本进行Subway FPS测试。运行环境为RTX Pro 6000显卡搭配Threadripper处理器和128GB DDR5内存。
RTX Pro 6000是NVIDIA面向专业工作站的旗舰GPU,拥有96GB GDDR7显存,基于Blackwell架构。AMD Threadripper是面向高端工作站的多核处理器平台,通常提供64-96核心和8通道DDR5内存支持。128GB DDR5内存在这个场景中至关重要——前文提到的510亿参数Ngram嵌入表需要卸载到CPU内存,加上4-bit量化后的主模型约111GB,以及操作系统和推理框架本身的内存开销,128GB已接近运行极限。

本地运行的原生上下文被限制在262K token,而通过Qwen Cloud则可达100万token。KV Cache(键值缓存)随上下文长度线性增长,更长的上下文意味着更多的显存和内存消耗,这也是本地部署的主要瓶颈之一。测试过程中系统一度因内存膨胀(进程占用达12GB导致系统冻结)而崩溃,但重启后模型仍能恢复并产出可运行的成果。生成的FPS游戏有手电筒、地铁车厢、涂鸦等场景元素,虽然武器音效"弱得可笑"、敌人移动方向有些诡异,但对于一个预览模型的4-bit量化版本而言,已属难得。
总结:从Qwen3 Next Flash看Qwen4的未来潜力
作为Qwen4架构的首次预览,Qwen3 Next Flash给出了一份令人振奋的答卷:
- 视觉能力极其强大,像素级复刻的精准度前所未见;
- 复杂代码生成实力惊人,禁用库的条件下仍能媲美GPT-5.2 Pro的赛车游戏;
- 主动工具调用意识出色,会自主选择Blender+Godot等专业工具链;
- 空间理解仍是短板,多代Qwen模型在3D空间组织上表现较弱。
博主对这款预览模型给出了"非常非常兴奋"的评价。在他看来,最令人激动的并非当下的具体表现,而是这一系列尺寸适中、能力强大的开放权重模型密集发布,正在推动"非订阅制AI"和本地可运行智能的普及。随着GLM 5.3 Flash等竞品的陆续登场,本地AI的未来确实值得期待。
相关推荐

Hermes多智能体系统搭建教程:主控调度+子Agent协作实战
详细介绍如何从零搭建Hermes多智能体系统,采用Qwen模型实现主控Orchestrator调度Coder、Researcher、Task Manager三个子Agent协作,涵盖环境安装、配置文件详解及多Agent协作实战演示。

Qwen2.5-Max-0902发布:1691分登顶编程榜首,定价仅5美元
阿里云Qwen2.5-Max-0902以1691分登顶LiveCodeBench编程榜单第一,较前版暴涨22分,超越GPT-4.5。每百万Token综合成本仅5美元,支持100万上下文窗口,详解核心升级与定价策略。

Qwen3.8-Flash-Next深度解析:静态嵌入表架构如何硬刚DeepSeek
深度解析阿里通义千问Qwen3.8-Flash-Next模型,详解181.5B参数、51B静态嵌入表架构创新、6B激活参数高效推理原理,以及FP8/BF16显存需求与部署方案,全面对比DeepSeek V4 Flash。