智谱GLM-5.3-Flash开源320B模型,通义Qwen4架构预览版同日发布

国产大模型迎来重磅更新
8月27日,AI行业迎来两款重量级国产模型的发布:智谱开源了GLM-5系列首个原生多模态模型GLM-5.3-Flash,通义千问则推出了Qwen3.8-Flash-Next——这不仅是一款多模态MoE模型,更被官方定位为Qwen4架构的早期预览。两者都在参数效率、多模态能力和成本控制上实现了显著突破,标志着国产大模型在技术路线上迈入新阶段。
值得关注的是,这两款模型都采用了高度稀疏的混合架构设计,通过激活极少数参数实现顶尖性能,这一趋势正在重新定义大模型的效率标准。所谓"稀疏激活",是指模型虽然拥有庞大的总参数量,但在处理每个输入时只调用其中一小部分参与计算,其余参数保持静默。这种设计的核心优势在于:总参数量决定了模型的知识容量和能力上限,而激活参数量决定了实际推理成本。通过将两者解耦,模型可以在"知识丰富"和"计算节约"之间取得最佳平衡。
GLM-5.3-Flash:320B参数的原生多模态开源模型
GLM-5.3-Flash是GLM-5系列的首个原生多模态模型,总参数量高达320B,但激活参数仅18B。这种稀疏激活设计使模型在保持强大能力的同时大幅压低了推理成本。模型采用MIT许可证开源,支持图像、Token等多模态输入。所谓"原生多模态",是指模型从预训练阶段就同时接受文本、图像等多种模态数据的联合训练,而非在纯文本模型基础上后接视觉编码器进行对齐微调。原生多模态架构使模型对不同模态信息的理解更加统一和深入,跨模态推理能力也更强。
在权威的Artificial Analysis综合智能指数评测中,GLM-5.3-Flash取得了57分,与Claude Opus 4.8持平,编程能力也相当接近。Artificial Analysis是一个独立的AI模型评测平台,其综合智能指数通过聚合多个主流基准测试(涵盖知识问答、推理、编程、数学、多语言理解等维度)的成绩来全面评估模型的通用智能水平。与单一基准相比,这种综合评估更能反映模型在真实场景中的整体表现。对于一款仅18B激活参数的开源模型来说,达到顶级闭源商业模型的水准,这一成绩的性价比极为突出。
该模型此前曾以"Oxalpha"等代号在OpenRouter平台预览,仅6天就处理了超过20万亿Token,成为OpenRouter有史以来处理量最大的模型,充分印证了其性能与实用性。
GLM-5.3-Flash的成本优势
在成本方面,GLM-5.3-Flash的价格仅为GLM-5.3的十分之一,实际折扣价甚至低至二十分之一,仅相当于Claude Opus 4.8价格的四十分之一。更关键的是,该模型完全运行于国产AI芯片集群之上,采用稀疏注意力与线性注意力的混合架构,展现了国产软硬件协同的成熟度。
标准Transformer的自注意力机制计算复杂度为O(n²),即随着输入序列长度的增长,计算量呈平方级膨胀,这是长上下文处理的核心瓶颈。稀疏注意力通过限制每个Token只关注序列中的部分关键位置(而非全部位置),将复杂度大幅降低。线性注意力则通过核函数近似或特征映射将注意力运算简化为线性操作,彻底将复杂度降至O(n)。GLM-5.3-Flash采用两者的混合架构,兼顾了稀疏注意力对关键信息的精准捕获能力和线性注意力在超长序列上的计算效率,这也是其能以18B激活参数处理复杂多模态任务的关键技术基础。
Qwen3.8-Flash-Next:Qwen4架构的技术预演
通义千问发布的Qwen3.8-Flash-Next同样备受瞩目。作为一款多模态MoE模型,它被明确定位为Qwen4架构的早期预览,目前已开放权重。

MoE(Mixture of Experts,混合专家)是一种通过条件计算实现高效推理的模型架构。其核心思想是将模型的前馈网络层拆分为多个独立的"专家"子网络,每次推理时通过一个可学习的"路由器"仅激活其中少数专家参与计算,其余专家保持静默。这使模型可以拥有极大的总参数量代表知识容量,但每次处理单个Token时实际运算的参数量很小。Google的Switch Transformer和Mistral AI的Mixtral是这一架构的早期成功实践。
该模型采用高度稀疏的MoE架构,使用GDN加QSA的混合注意力机制。GDN(Gated Delta Network)是一种结合门控机制和增量更新的高效序列建模方法,通过门控信号控制信息的选择性更新以减少冗余计算;QSA(Query-based Sparse Attention)则是一种基于查询的稀疏注意力变体,根据查询向量动态决定关注哪些位置,而非采用固定的稀疏模式。两者的混合使用使模型能够在不同层中灵活切换计算策略——对需要精细全局推理的部分使用QSA保证质量,对局部模式建模使用GDN提升效率。
总参数为125B外加51B的N-gram嵌入,但每个Token仅激活约6B参数。N-gram嵌入是一种将多个连续Token的组合信息编码进嵌入向量的技术,使模型在输入层就能捕获局部上下文的搭配模式和短语级语义。这51B参数本质上是一个巨大的查找表,在推理时通过简单的表查询即可获取,几乎不增加浮点运算量,却能显著扩展模型的知识容量。配合异步预取技术,这些嵌入可以在GPU计算其他层时提前从内存加载,进一步消除延迟开销。原生上下文窗口达262K,并可扩展至1兆Token。
Qwen3.8-Flash-Next的架构创新
Qwen3.8-Flash-Next的MoE层使用512个专家和Top-10路由(即每次从512个专家中选出10个参与计算,稀疏率高达98%),配合N-gram嵌入几乎不增加计算成本即可扩展模型容量,并可通过异步预取注入内存。这种设计在保持极低激活参数的同时,实现了容量的高效扩展。
据官方数据,该模型仅凭6B激活参数便在文本和多模态领域超越了Claude Opus 4.6 Max,训练成本仅为Qwen3.7-Plus的九分之一,在编码和办公任务上表现更优。
定价方面,生产版Qwen3.8-Flash API定价为每百万输入Token 0.16美元、输出Token 0.47美元。在SWE-bench 1.1和SWE-bench Pro测评中分别取得58.7和62.5的成绩,编程能力可圈可点。SWE-bench(Software Engineering Benchmark)是由普林斯顿大学等机构推出的软件工程能力评测基准,它从真实的GitHub开源项目中提取实际的Bug修复任务,要求AI模型理解代码库上下文、定位问题并生成正确的修复补丁。与简单的代码生成测试不同,SWE-bench测试的是模型在复杂工程环境中端到端的问题解决能力,因此被业界视为衡量AI编程实用性的最权威基准之一。
AI操纵舆论:一场隐蔽的信息战
技术进步之外,AI的滥用风险也浮出水面。一个打着"汉诺威公共政策研究所"旗号的亲以色列网站,在9天内发布了124篇、超56万字的报告,目的是优化内容以引导ChatGPT等AI聊天机器人引用其倾向性观点。

这一案例揭示了AI时代信息操纵的新形态——GAIO(Generative AI Optimization,生成式AI优化)。传统的SEO旨在提升网页在搜索引擎中的排名,而GAIO则瞄准AI聊天机器人这一新兴信息入口。大语言模型在回答用户问题时会引用训练数据和检索增强生成(RAG)中索引的网页内容,通过大量发布针对特定议题的结构化、高权威性文章,操纵者可以增加这些内容被AI模型引用的概率,从而间接影响数百万用户接收到的信息。
据披露,该网站由美国公司Piro Inc依据《外国代理人登记法》为以色列政府分发内容,背后是以色列政府数千万美元资助、经Havas Media等第三方转手的更广泛宣传行动。这一案例不仅暴露了国家级行为体利用AI进行信息战的可能性,也对AI公司如何防范训练数据和检索内容被蓄意污染提出了严峻挑战,值得整个行业警惕。
国产AI出海与云厂商合作新动向
在国际布局方面,多条消息值得关注。华为已向埃及政府提交AI数据中心项目投标方案,拟出口至少1408颗昇腾950系列芯片用于AI训练,另配600颗芯片建设两套推理集群,并提议12个月完成当地基建。华为昇腾(Ascend)系列AI加速器是中国目前最具竞争力的国产AI训练芯片,采用华为自研的达芬奇架构,其中昇腾910系列对标英伟达A100/H100。在美国对华芯片出口管制持续收紧的背景下,昇腾芯片承载着中国AI算力自主可控的战略意义。然而,昇腾的海外出口同样面临复杂的地缘政治博弈——美国不仅限制向中国出口先进芯片,也在试图阻止中国向第三国出口AI芯片以扩大算力影响力。若该项目落地,将成为华为一年多来尝试出口昇腾加速器后首个公开确认的出口案例,标志着中国AI基础设施方案在"全球南方"市场的实质性突破,方案还涉及与科大讯飞合作打包应用。
另一边,月之暗面(Moonshot AI)正与微软、亚马逊和谷歌洽谈收入分成协议,计划将其Kimi K3模型托管至Azure、AWS和Google Cloud平台,并向K3服务收取最高30%的收入分成。云厂商收入分成模式类似于应用商店的分成机制——AI公司将模型部署在云平台上,终端用户通过云平台的API调用服务,云平台负责基础设施运维、计费和全球分发,并从收入中抽取一定比例作为佣金。对AI公司而言,这意味着无需自建全球推理基础设施即可触达海外客户;对云厂商而言,则丰富了其AI服务生态。若达成,这将是首家与美国主要云厂商签署此类协议的中国AI公司,不过谈判仍处于早期阶段。
特斯拉数据中心风波与FSD进展
特斯拉中国回应了网传"上海数据中心人去楼空"的消息,称信息不实并已向公安机关报案,强调数据中心正常运转,辅助驾驶招聘工作也在加速推进。

不过,特斯拉官网近期更新的FSD监督版全球可用地区清单包含12个国家或地区,中国并不在其中。FSD(Full Self-Driving,完全自动驾驶)监督版是特斯拉最先进的辅助驾驶系统,基于端到端神经网络架构,能够在驾驶员监督下处理城市道路的复杂场景。其在中国落地面临数据合规(汽车行驶数据涉及地理信息安全)、高精地图审批以及本土化路况适配等多重挑战。特斯拉仍在推进FSD监督版在中国市场的数据合规及本土化适配,其上海数据中心已实现境内数据全留存,符合中国《数据安全法》和《个人信息保护法》的要求;临港AI训练中心也已投入运营,为基于中国道路数据的模型训练提供本地算力支持。
AI硬件生态持续繁荣
消费级AI硬件领域同样热闹。京东在第25届国际物联网展IoTe深圳展上展出了多款可下单的AI玩具,包括小鸡球球AI点读笔、凯米斯AI机器狗等,均接入了京东自研的"附身智能"系统Joyinside。

会上,京东Joyinside与涂鸦智能正式签约,将围绕AI硬件方案共建渠道资源协同与生态联合推广,为品牌客户提供整包方案。涂鸦智能是全球领先的IoT云平台,为智能硬件厂商提供从芯片模组到云端管理的一站式解决方案。此次与京东Joyinside的合作,意味着AI大模型能力将通过涂鸦的硬件生态快速渗透到更多消费级智能设备中,从智能玩具扩展到智能家居、穿戴设备等更广泛的品类。
此外,初创公司Legato获得1200万美元融资,首次展示其AI听力眼镜Legato Frames。该眼镜将专利听力辅助技术集成于镜架,通过AI系统区分背景噪音与人声,仅放大说话声,预计今年秋季晚些时候上市。这种选择性声音增强技术基于深度学习的语音分离模型,能够实时分析声学场景并将目标说话人的声音从复杂噪声环境中提取出来,其原理类似于"鸡尾酒会效应"的计算模拟。产品面向轻中度听力损失人群——据世界卫生组织数据,全球约15亿人受不同程度听力损失影响,但传统助听器价格高昂(通常数千至上万美元)且存在社交stigma。Legato Frames的售价将远低于传统助听器,并可能通过眼科诊所购买时享受视力保险报销,展现了AI在健康辅助领域的落地潜力,也代表着AI硬件从"信息娱乐"向"健康刚需"品类的重要延伸。
核心要点
相关推荐

NVIDIA与Hugging Face深化合作:开源AI生态迎来新机遇
NVIDIA与Hugging Face宣布深化合作,将通过性能优化、工具链完善和生态扩展推动开源AI发展。解读这一合作对开发者、企业和AI社区的深远影响,探讨开源模型生态的未来趋势。

7900XTX本地部署通义千问3实战:53TPS推理速度调优指南
详解AMD RX 7900XTX 24GB显卡本地部署Qwen3 27B模型全流程,通过KV Cache Q4量化、262K超长上下文、MTP投机采样三重优化,实现53TPS高速推理,附保姆级安装教程与量化精度对比。

AI早报:阿里开源Qwen3.8视觉旗舰,智谱GLM-5.3编程夺冠,SpaceX收购Cursor
阿里开源Qwen3.8-27B视觉多模态模型超越闭源前代,智谱GLM-5.3编程能力提升50%登顶开源榜单,SpaceX全资收购Cursor布局AI编程赛道,谷歌Gemini 3.7 Flash强化长程推理能力全面开放。