Qwen3.5技术解析:5%激活参数如何超越千亿级SOTA模型

阿里最新发布的Qwen3.5(千问3.5)在技术圈引发热议。这个总参数量达3970亿、每次仅激活170亿参数的MoE模型,以不到5%的激活率实现了对上一代千亿级模型的性能超越。本文基于B站技术UP主的实测分享,深入拆解其背后的三大核心技术:混合注意力、极致稀疏MoE与多Token预测。
Qwen3.5模型概览:小激活撬动大能力
Qwen3.5是一个视觉语言模型(VLM),支持图像、图片、视频作为输入,输出文字,能力对标此前的VL系列模型。从参数结构上看,它是一个总量397B、每次激活17B的MoE架构,激活率约4.3%——这是它最引人注目的特点。
对比过去大多数MoE模型10%左右的激活率,Qwen3.5的稀疏程度堪称激进。而它最大的卖点在于:在极大提升效率的前提下,几乎不牺牲性能。据UP主实测,这一模型在Coding(编程)、Math(数学)、长文本三大关键维度上均处于领先水平。
为什么是这三个维度?编程是当前AI落地最广、最容易变现的场景;数学考验模型是否能突破人类智力极限;而长文本则是智能体应用的必备能力——尤其在Claude这类以工具调用见长的Agent体系中,长上下文处理至关重要。此外,Qwen3.5将语言支持扩展到201种,包括菲律宾语、印度小语种等冷门语言,展现出明确的国际化野心。

Qwen3.5三大核心技术拆解
混合注意力机制:三层线性配一层传统
Qwen3.5并非首次提出混合注意力,这一架构在此前的"Qwen NAS"研究中已有铺垫(NAS即暗示下一代架构)。所谓混合注意力,是在传统Transformer的基础上引入线性注意力(Linear Attention)。
传统注意力的计算复杂度为N²,随Token长度平方级增长;而线性注意力仅为N,速度直接提升一个量级。但线性注意力会造成一定信息损失,因此Qwen3.5采用了折中方案:三层线性注意力配一层传统注意力。
这种设计带来几个关键收益:
- 推理省显存:线性注意力只需缓存当前状态,KV Cache占用与序列长度无关,而传统注意力的缓存是线性增长的。
- 对NPU友好:传统注意力是"动态图",计算量随Token增长动态变化,芯片需频繁切换调度;线性注意力则是固定计算量的"静态图",天然适配NPU这类计算密集型芯片。NPU成本更低,这是重要优势。
- 长文本外推增强:模型还引入了门控(Gating)机制,这是去年顶会最佳论文的技术,用于对注意力结果做二次过滤。它增加了非线性能力,并消除了"Attention Sink"现象——即Token莫名与前几个Token相似度过高的保守策略问题。消除后,长文本外推能力显著增强。

需要注意的是,线性注意力"看场景":文本很短时,N与N²差异不大,传统注意力经过极致优化后未必输;但文本一长,线性注意力的优势瞬间爆发。UP主用"电车与油车"比喻——传统注意力如同优化极致的油车,混合注意力暂时干不过,但作为新事物,其成长空间巨大。
极致稀疏MoE:软件反向拉动硬件发展
17B/397B的激活比意味着不到5%的激活率,这在工程上极难实现。传统MoE维持10%激活率的原因在于:激活量太低会导致路由难度增大(选错专家代价高)、计算过于稀疏不密集(GPU/NPU都偏好密集计算),以及通信压力增大(频繁交换数据)。
Qwen3.5敢于做到如此低的激活率,很可能会催生专为稀疏MoE设计的推理芯片。这也解释了为何阿里自研平头哥芯片——通过软件模型的发展反向拉动专用硬件,形成"以软件拉硬件"的战略闭环。
多Token预测(MTP):为智能体场景而生
传统模型解码时逐个预测Token(T1-T4预测T5),而Qwen3.5引入了多Token预测(MTP):在预测出T5后,用一个很小的模块(而非完整走一遍大模型)直接同时预测出T6、T7。
这符合人类直觉——当你说"中国的首都是……",其实"北京"两个字可以一次性预测出来,无需逐字生成。这一技术DeepSeek、Meta、谷歌都已采用,MTP正成为大模型的标配能力。据介绍,这一优化主要为智能体场景服务,显著提升解码速度。
Qwen3.5性能与成本:19倍推理加速从何而来

在259k吞吐量下,Qwen3.5的速度提升约19倍。这一数字的来源拆解如下:
- 混合注意力(线性注意力)贡献约 5倍
- MoE稀疏化贡献约 2倍
- 多Token预测贡献约 1.5倍
5 × 2 × 1.5 ≈ 15,再加上其他工程优化,最终约19倍。这意味着推理成本大约只有此前的1/19。
更关键的是"有效成本"——光快没用,还得对。UP主打了个比方:一个人高考700分但每天学12小时,Qwen3.5则是每天只学2小时却能考680分,虽然低20分,但显然更聪明、更高效。尽管MoE、MTP、混合注意力三项优化理论上都可能降低准确率,但实测其成功率依然很高。
训练框架创新:训推分离与原生FP8
Qwen3.5的能力背后还有强大的训练框架支撑。它通过千问智能体持续收集数据,放入任务队列,训练时直接取用,实现了训推分离的强化学习框架,能支持数万亿Token的回放系统,让新技术得以快速跟进。
此外,它采用了原生FP8流水线。去年DeepSeek率先将FP8半精度训练玩成功,一年后千问3.5也复现了这一能力,可节省近50%显存,进一步压低训练成本。

一个有趣的产业规律是:千问系偏爱用"优美的数学"降本,DeepSeek则擅长用"工程能力"降本(如各种底层优化)。两条路径并无高下之分,未来很可能互相借鉴融合。而中国能同时出现千问和DeepSeek这两个降本导向的模型,某种程度上是被芯片限制"逼"出来的——没有充足算力,只能在效率上做到极致。
阿里AI全栈布局的战略野心
从更宏观的视角看,Qwen3.5折射出阿里的战略布局。阿里正在搭建完整的"AI栈":上层以千问模型为主,中层是阿里云平台,底层则是平头哥为代表的芯片体系。这与腾讯、字节仅做上层应用的策略截然不同,野心明显更大。
对普通开发者而言,最直接的好处是"便宜且快"。Qwen模型尺寸齐全、上生产方便,基于Qwen3.5搭建的多智能体股票舆情与因子分析系统,速度甚至比7B小模型还快。当前AI行业已从"刷榜"转向"降本增效"——智能体应用让成本压力空前,谁能在保持能力的同时把成本压下来,谁就掌握了话语权。
结语
Qwen3.5用不到5%的激活参数超越千亿级SOTA,本质上是一场关于"参数利用率"的胜利。它证明了:模型不必越做越大,通过混合注意力、极致稀疏MoE、多Token预测三管齐下,用聪明的架构设计而非蛮力堆参数,同样能实现性能与成本的双赢。对于正在爆发的智能体应用浪潮而言,这种高效、低成本、支持长文本的模型,或许正是最务实的选择。
相关推荐

OpenAI Astra即将发布:多智能体协作与AI行业最新动态全解析
深度解析OpenAI下一代模型Astra的多智能体协作能力、神秘代号Mew4线索,以及Cursor Origin平台、Qwen 3.8本地模型、GPT-5.6降价等AI行业重磅动态。

AI编程工具全景图:从Claude Code到Cursor的选型指南
系统对比ChatGPT、Gemini、Claude、Cursor、Claude Code及Codex等AI编程工具的定位与优劣,涵盖定价方案、安装配置及国内访问方案,帮助开发者高效选择适合自己的AI编程工具组合。

LLM记忆系统如何演变为程序分析工具:一次意外的技术发现
一位开发者在为大语言模型构建记忆系统时,意外发现LLM记忆管理与程序分析的本质相通性。本文深入解析从依赖追踪到数据流分析的技术演化路径,探讨程序分析方法论如何提升AI Agent记忆基础设施的可靠性。