Nano Banana 2.1 发布,Mistral Large 4 拿下38分AI评测高分

本期梳理Google图像模型迭代、Mistral欧洲突破、国产大模型百亿融资及OpenAI数学手稿争议等AI前沿动态。
本文梳理了AI领域近期多条重要进展。Google发布Nano Banana 2.1图像生成模型,标志行业竞争焦点从审美质量转向工作流可用性;法国Mistral发布Large 4,凭借1万亿参数MoE架构在第三方评测拿下38分,成为中美之外首个进入第一梯队的模型;某国产大模型公司融资规模逼近1000亿元人民币,刷新单轮融资纪录;OpenAI一次性公开722篇数学手稿,但含三位菲尔兹奖得主的顾问组声明不认可其结果,暴露AI产出速度与学界审核能力之间的根本矛盾。此外,Google还发布了轻量多模态嵌入模型EmbeddingGemma 2,将多模态本地RAG的工程门槛压缩进单一开源模型,并将AI助手深度嵌入Workspace办公套件。整体来看,模型能力、算力供给与安全治理正成为本轮AI竞争的三条核心主线。
AI行业的更新节奏仍在加速。本期梳理从图像生成模型迭代、开源大模型评测突破,到国产大模型创纪录融资、OpenAI数学手稿争议等多条值得关注的进展,并对背后的趋势做一点拆解。
Google 发布 Nano Banana 2.1:图像生成重心转向「可用物料」
Google 正式推出 Gemini Nano Banana 2.1 模型,定位高效图像生成与对话式编辑。作为 Nano Banana 2 的升级版,它在保持 Flash 级速度的同时,重点提升了实际交付质量。目前该模型已接入 Gemini API、AI Studio、Gemini App、Google Flow 和 Stitch 等共 7 个 Google 产品线。
随着新模型上线,上一代 Gemini Flash Image 将于本月 29 日正式停用。这个节点值得关注的信号是:图像生成的竞争焦点,正从「画得好看」转向「直接交付可用的设计物料」。换句话说,模型评价标准正在从审美质量,转向能否无缝嵌入真实的设计与生产工作流。
Mistral Large 4:中美之外首个拿出硬成绩的模型
法国 Mistral 发布 Mistral Large 4,在第三方智能指数评测中拿下 38 分,与 GPT 系列高端模型处于同一梯队,被评测机构称为「中美之外最智能的模型」。
从架构看,它采用 1 万亿总参数、490 亿激活参数的 MoE 设计,原生多模态,上下文窗口 51.2 万 tokens,最高可扩展至 25.6 万 tokens。官方计划在 10 月底开源这批权重,目前已在公开平台开放公测。价格方面,前两周输入每百万 tokens 0.68 美元、输出 2.09 美元,成本相当有竞争力。

这是非中美阵营第一次拿出可量化的硬成绩。长期以来,前沿大模型的叙事几乎被美国和中国厂商主导,Mistral 的这次表现,为欧洲 AI 生态提供了一个难得的参照点,也说明开源路线依然能够逼近闭源第一梯队。
MoE(Mixture of Experts,混合专家)是一种模型架构范式:将神经网络分成多个「专家」子网络,每次推理时只激活其中一小部分,而非全部参数。Mistral Large 4 的 1 万亿总参数中,实际每次推理只调用约 490 亿激活参数,这意味着它能在保持大模型表达能力的同时,大幅降低单次推理的计算成本。这也解释了为何它的价格具备竞争力——MoE 架构天然在「模型规模」和「推理开销」之间取得平衡,是当前前沿大模型降低运营成本的主流路线之一,GPT-4 和 Gemini 系列也被普遍认为采用了类似设计。
国产大模型融资刷新纪录
据彭博社报道,某国产大模型公司新一轮融资接近敲定,规模至少 800 亿元人民币(约合 120 亿美元),大幅超出原本约 500 亿元的目标,最终可能达到 1000 亿元。知情人士称,宁德时代和腾讯是本轮出资金额最高的投资方,交易很快就会完成。
这轮融资将为其计划在 2027 年初启动的 IPO 铺路。值得关注的是,仅仅一个月前该公司才刚完成首轮约 74 亿美元的外部融资——国产大模型的单轮融资规模再次被刷新,资本对算力与大模型的押注强度仍在持续走高。
OpenAI 公开722篇数学手稿引发学界争议
OpenAI 一次性公开了 722 篇数学手稿,出自一个尚未发布的内部模型,整理为 372 组结果,涉及多项前沿数学猜想。论文源码与部分证明已上传 GitHub。官方称模型共尝试约 4000 个研究问题,平均每项结果消耗的算力约等于 ChatGPT 思考 3 小时。

不过,一个由 9 位学者组成的独立顾问组(其中包括 3 位菲尔兹奖得主)随即声明,这并不代表他们认可这些结果或过程。这一分歧耐人寻味:当 AI 产出数学结果的速度已经超过人类的阅读与审核速度,学界的验证机制正面临前所未有的压力。质量与可信度,而非产量,才是真正的瓶颈。
菲尔兹奖(Fields Medal)是数学领域的最高荣誉,通常被称为「数学界的诺贝尔奖」,每四年颁发一次,且仅授予40岁以下的数学家。顾问组中有3位得主参与审议,本身代表了当代数学界极高的权威背书资格。他们选择公开声明「不认可结果或过程」,而非沉默,说明学界对AI产出数学结论的可信度持审慎甚至怀疑态度。核心争议在于:形式上看起来正确的证明步骤,是否等同于真正意义上的数学证明?人类数学家的验证不只是检查符号推导,还涉及对论证思路、概念边界和反例的深度判断——而这些恰恰是目前AI大模型最难被外部快速核实的部分。
EmbeddingGemma 2:轻量多模态嵌入模型降低端侧 RAG 门槛
Google 发布了一个参数量 7.4 亿的轻量多模态嵌入模型,基于 Gemma 架构,采用 Apache 2.0 商用友好许可开源。它首次把文本、代码、图像、视频和音频统一映射到同一个嵌入空间,并与主模型共享文本分词器和音频编码器,可以在同一条推理流水线里组合运行。

模型针对端侧做了优化,开发者可以在本地硬件上搭起完整的 RAG 流程,数据全程不离开设备。这意味着多模态检索的工程门槛被压缩进了一个轻量开源模型中——对注重数据隐私、需要本地部署的场景来说,这是一个实用的进步。
RAG(Retrieval-Augmented Generation,检索增强生成)是一种让大语言模型在回答问题前先检索外部知识库的技术框架:先将文档、图片等内容转换为向量(即「嵌入」),存入向量数据库,查询时找出与问题最相关的片段,再连同原始问题一起送入生成模型。嵌入模型的质量直接决定检索准确率。EmbeddingGemma 2 的价值在于把文本、图像、音频等不同模态统一映射到同一个向量空间——以往多模态 RAG 往往需要为不同模态分别部署编码器,工程复杂度高。将整个流程压缩进一个 7.4 亿参数的轻量模型,并允许在本地硬件运行,大幅降低了对算力和网络连接的依赖,对医疗、法律等对数据隐私敏感的场景尤为实用。
AI 助手搬进文档:Workspace 内嵌能力公测
Google 还宣布面向 Workspace 的 AI 能力进入公开测试,覆盖 Docs、Sheets 和 Slides。AI 会以侧边栏形式出现在文档旁边,读取当前打开的文件并直接编辑,所有改动都会记录在版本历史里。

在表格里,它能写公式、建数据透视表;在幻灯片里,能按原有版式新建页面,还能检查元素重叠或文字过小的问题。这项能力面向所有付费计划开放。可以看到,AI 助手正从独立对话框搬进文档内部,深度嵌入日常办公流程。
结尾
除此之外,有厂商启动了扩展版的网络安全验证计划,为合格安全专业人员提供分档的前沿模型访问权限——随着前沿模型双用途能力增强,安全能力分级授权正在成为头部厂商的默认做法。另有招股书显示,某 AI 基础设施公司计划未来十年至少支出 5180 亿美元,其中约八成属于「照付不议」的刚性承诺,用确定性支出换取算力产能。这些动向共同指向一个判断:模型能力、算力供给与安全治理,正成为这一轮 AI 竞争的三条核心主线。
相关推荐

拆解华硕ROG 20周年限定全家桶:史上最稀有PC装机实录
LTT拆解华硕ROG 20周年纪念版全套硬件:镀金主板、256GB内存、RTX 5090 Astral显卡与骨架机箱。深度观察顶级旗舰的过度工程、品牌营销与真实装机困境。

OpenAI SDK v3.27.0 发布:新增预热托管环境
OpenAI 官方 SDK 发布 v3.27.0 版本,核心新增预热托管环境(prewarmed hosted environments)特性,有助于降低托管推理的冷启动延迟。本文解读该版本更新内容与开发者升级建议。

AI长期记忆新思路:5000万Token窗口能否比重算更快更省
一则 Reddit 讨论提出构建 5000 万 Token 的 AI 长期记忆窗口,声称比传统重算更快更便宜。本文解析其技术意涵、可能实现路径及对 AI 应用的影响,并对相关宣称保持审慎分析。