[控场AI]
· 7 分钟阅读· 3,930 字

AI资讯速递:ChatGPT四项更新、Mistral Large 4与Nano Banana 2.1齐发

AI资讯速递:ChatGPT四项更新、Mistral Large 4与Nano Banana 2.1齐发

10月7日AI密集更新:OpenAI、Mistral、Google多线出击,覆盖API架构、开源大模型、图像生成与端侧嵌入。

10月7日,AI行业迎来集中发布潮。OpenAI在三条线同步推进:将API付费层级从5个压缩为3个以降低开发者门槛,公开测试速度比旗舰模型快10倍的Decisions API以补足高频低延迟场景,并开源722篇由内部模型产出的数学手稿,验证AI批量产出可验证科研成果的范式可行性。Mistral AI发布Mistral Large 4,以49B激活参数的MoE架构主打网安、法律和视觉定位专项能力,但综合智能指数仅列开源第六,性价比不敌DeepSeek等竞品。Google则双线出击:Nano Banana 2.1将图像生成成本压低至前代四分之一,Embedding Gemma 2以7.4亿参数实现跨模态统一嵌入,1GB内存即可在端侧完成本地RAG全流程,兼顾隐私与响应速度。

10月7日的AI行业迎来密集更新。OpenAI在API层级、ChatGPT功能、开源数学成果上多点出击,Mistral AI抛出号称"最强开源模型"的Mistral Large 4,Google则同步发布图像模型Nano Banana 2.1与端侧嵌入模型Embedding Gemma 2。本文梳理这些发布背后的技术要点与实际价值。

OpenAI密集更新:API层级精简与决策API

OpenAI对API付费层级做了简化,将原本的5个付费层级压缩为3个——Build、Launch和Grow,对应5美元、100美元、500美元三档金额门槛。这一调整的核心目的是降低用户获得更高速率限制的门槛,让开发者更容易根据实际需求升级。

ChatGPT端新增了Meetings插件,可代为记录会议纪要,并基于ChatGPT对用户及已有协作的理解,在ChatGPT Space中保存个性化摘要和后续步骤。该功能目前以测试版形式面向macOS桌面应用中的Pro和Business用户开放,Enterprise版本即将推出。

更值得关注的是公开测试的Decisions API。它由内部前沿模型驱动,决策速度最高比旗舰模型快10倍,支持文本和图像输入,输出包括概率、选择、分数三种形式。典型用途涵盖模型路由、工具或代理选择、大批量输入的分类排名打分,以及视觉内容分析对比。这类"轻量快速决策"接口,正好补足了大模型在高频低延迟场景下的短板。

Decisions API所代表的"轻量决策层"是一种在大模型生态中逐渐成形的架构思路。在传统调用链中,所有任务都会被送往同一个旗舰模型处理,而实际上大量任务(如分类、路由、打分)并不需要完整的推理能力,却同样消耗高延迟与高费用。决策API将这类"选择性判断"从通用生成任务中剥离,专门优化推理速度和吞吐量,本质上是将模型能力按复杂度分层调度。概率、选择、分数三种输出形式,分别对应置信度估计、多选一、连续评分三类典型决策需求,这在构建多智能体系统或大规模内容审核管线时尤为实用。

Mistral Large 4:欧洲最强开源模型的成色几何

Mistral AI发布了Mistral Large 4(又名Le Troncet),采用49B激活参数、原生多模态架构,官方称其为美国或欧洲的最强开源模型,在网络防御、制造和金融等关键工作负载上达到SOTA,视觉定位能力更是超越了闭源前沿模型。该模型现已可通过API使用,开放权重计划于10月底发布。

官方称其为美国或欧洲的最强开源模型

从榜单成绩看,这款模型表现分化明显。在DeepSWE基准上拿到62分,仅次于Kimi K3,与GLM 5.3仅差1分;在Artificial Analysis Cyber Index上领先一众开源和闭源前沿模型;视觉定位能力在相关测试中超过了GPT级闭源模型。在哈维埃的法律智能体基准测试中,ML4优于所有开源模型。

不过在Artificial Analysis的综合智能指数上,它仅得38分,剔除闭源模型后位列开源第六,次于DeepSeek广告 V4.1 Flash等多款模型。价格方面为每百万输入1.36美元、输出4.18美元,前两周享50%折扣,但每任务成本仍远高于DSV 4.1 Flash、GLM 5.3 Flash等竞品。换言之,除了网安、法律、视觉定位这几个强项,它在性价比上并无太多优势——这是开源模型内卷格局下的典型困境:专精能力突出,综合性价比却难敌后发者。

Mistral Large 4采用的MoE(混合专家)架构是理解"49B激活参数"这一表述的关键。MoE模型的总参数量远大于每次推理实际激活的参数量——49B指的是每个token前向传播时调用的参数规模,而模型的总参数量通常是这一数字的数倍。这种设计使模型在推理时的计算成本接近一个中等规模密集模型,但知识容量和专项能力却可以通过更多专家模块来扩展。激活参数数量直接影响推理延迟和显存占用,是评估开源模型部署门槛的核心指标之一,也是Mistral宣传性价比时着重强调的维度。

Nano Banana 2.1:更便宜四倍的图像生成

Google发布了最新图像生成与编辑模型Nano Banana 2.1,官方称其在各项能力上超越前代,尤其在视觉设计、基于蒙版的编辑和主体一致性上提升明显,可生成更自然的图像。

NanoBanana 2.1

最吸引人的是价格——比前代便宜4倍,每张图仅0.034美元(约合0.23元人民币)。在Arena文生图竞技场中排名第五,相比2.0版本提升显著。对于高频图像生成的商业应用而言,成本下降一个量级往往比能力微升更有实际意义,这也是Google在图像赛道持续加码的信号。

端侧多模态:Embedding Gemma 2

Google还发布了Embedding Gemma 2,这是首个面向端侧嵌入向量的原生多模态开放模型,基于Gemma 4构建、以Apache 2.0开源。它将代码、图像、音频和视频统一到一个嵌入空间中,可在移动端和桌面端本地运行。

基于Gemma 4构建

模型以7.4亿参数在同规模中表现最佳,性能超越部分参数量超其两倍的模型,而运行时动态内存仅需约191MB至567MB。它由270M文本、170M视觉与300M音频编码器组成,270M版本最低0.5GB内存即可运行,完整多模态版1GB内存可本地运行。与Gemma 4搭配时,可实现低内存占用的高效端侧RAG。现已在Hugging Face和Kaggle上提供下载。这类端侧嵌入模型的意义在于,让检索增强生成真正下沉到设备本地,兼顾隐私与响应速度。

嵌入模型(Embedding Model)的核心作用是将不同模态的内容(文本、图像、音频等)转化为高维向量,使语义相似的内容在向量空间中距离更近。RAG(检索增强生成)正是依赖嵌入模型完成"查询向量化→相似度检索→召回上下文→喂给生成模型"这一流程。传统RAG管线中,嵌入步骤通常在云端完成,存在数据上传的隐私风险和网络延迟。Embedding Gemma 2将这一步骤推到设备本地,意味着敏感文档(如医疗记录、私人笔记)可以在完全离线的环境中完成检索索引和查询匹配,生成模型再本地调用Gemma 4响应,全链路无需数据出境。191MB至567MB的动态内存占用,使其具备在主流手机芯片上运行的实际可行性。

OpenAI开源数学成果:AI做科研的大规模实验

OpenAI发布了一批由内部前沿模型产出的数学结果,在GitHub上以Apache 2.0开源。发布前,团队咨询了普林斯顿高等研究院的数学与人工智能独立顾问组,并据其建议决定发布方式。

这批成果共包含722篇手稿,分为372个系列和17个领域,还将发布模型推理过程的简要总结。绝大多数结果通过相同流程、经未发布的内部模型获得——团队向该模型提出了约4000个问题,平均每个结果消耗该模型在ChatGPT Pro上约3小时的思考算力。例外包括对黎曼Zeta函数部分区域的研究以及某猜想证明,其中部分成果经过人工编辑以提高可读性。这是AI大规模参与数学研究的一次公开实验,其意义不在单个结论,而在于验证"模型批量产出可验证科研成果"这一范式的可行性。

这批数学成果的发布方式本身也有方法论上的意义。咨询普林斯顿高等研究院独立顾问组,反映出AI生成科研成果在学术共同体中面临的合法性与验证问题——数学与其他科学领域不同,结论的正确性原则上可通过形式化证明独立验证,这使其成为测试AI科研能力的理想沙盒。"722篇手稿、4000个问题、平均3小时算力"的量化披露,也提供了一套衡量AI科研效率的参照系:单个结果的算力成本约等于一个ChatGPT Pro用户3小时的配额,这对于判断工业界或学界大规模复制此类实验的可行性具有参考价值。黎曼Zeta函数等经典难题的涉及,也意味着这批成果并非仅针对基础练习题,而是在真正的研究前沿进行了探测。

其他值得关注的更新

Google方面,Gemini在Gemini Live中推出Guided Vision功能,为盲人和低视力社区共同开发,用户可共享摄像头获得动态音频描述和实时口头提示来探索环境。

在Google Workspace中

Anthropic的Claude现可在Google Docs、Sheets和Slides中以侧边栏形式工作,读取当前内容并实时编辑;同时Cloud Code支持在全新虚拟机上为每个任务运行、同时启动多任务,Pro或Max订阅用户可在截止前领取云绘画奖励额度。Anthropic还在扩展网络安全验证计划,经验证的安全专业人员可访问更高层级模型,支持渗透测试和红队演练等授权攻击性安全工作。

此外,Agent Mail推出Agent ID,定位为"AI智能体版的Sign in with Google",让智能体用专属登录和收件箱访问应用,无需用户密码;Cursor宣布可通过iOS应用在手机上控制电脑端智能体,查看进度、回复或发起新任务。这些工具层面的进展,正逐步构建起AI智能体的身份、权限与协作基础设施。

分享:

相关推荐