[控场AI]
· 8 分钟阅读· 4,388 字

AI早报:Nano Banana 2.1与Mistral Large 4同日上线

AI早报:Nano Banana 2.1与Mistral Large 4同日上线

旗舰模型、决策API与Agent协议标准密集落地,AI产业重心从造模型转向规模化Agent运转。

本文梳理了近期AI领域的密集动态:Mistral发布千亿参数MoE旗舰模型Large 4,Google推出4K图像编辑模型与端侧多模态嵌入模型;亚马逊发布扩散语言模型,复旦等团队开源音视频联合生成框架。决策模型成为新趋势,OpenAI、Perplexity和Empiro Labs相继发布决策API或模型。Agent生态方面,Codex Auto Review免费开放双层审查架构,Personal Agent Protocol由多家巨头联合制定,GitHub重建Git基础设施以支撑AI Agent并发读写。资本层面,OpenAI洽谈300亿美元融资估值1.4万亿美元,DeepSeek近千亿元融资收尾,可灵AI筹备港股上市。整体来看,AI产业正从「造更强模型」快速转向「让Agent安全可靠地规模化运转」。

旗舰模型密集更新:Mistral与Google同台竞技

新一轮基础模型发布潮再度袭来。Mistral AI 推出旗舰模型 Mistral Large 4 的公开预览版,官方昵称 Led Trunk,目前已通过 API 向所有用户开放。这是一款原生多模态的混合专家(MoE)模型,总参数约 1 万亿,每个 Token 激活 490 亿参数——这种稀疏激活设计在控制推理成本的同时保留了超大模型的能力上限。官方称其在网络安全等关键负载上处于开源权重模型前沿,并计划在月底开放完整模型权重。

同时,Google 发布图像生成与对话式编辑模型 Nano Banana 2.1,已在 Gemini API 正式可用,并陆续推送到 Gemini 应用、搜索 AI Mode、AI Studio 以及 Google Ads 等多个产品线。官方强调新模型在视觉设计、蒙版编辑和主体一致性上超越上一代,最高输出分辨率达到 4K。第三方 Arena 榜单显示,该模型在纹身图、图像编辑和多图编辑三个细分榜单上分别排名第五、第六和第四,表现稳健但尚未登顶,侧面反映出图像生成赛道的竞争已相当激烈。

混合专家(MoE,Mixture of Experts)是一种稀疏激活的神经网络架构:模型由多个"专家"子网络组成,每次推理时只有少数几个专家被激活处理当前输入,其余参数保持静默。这使得模型可以在不线性增加推理算力的前提下大幅扩展总参数量。以 Mistral Large 4 为例,1 万亿总参数中每个 Token 只激活约 490 亿,实际计算量接近一个 490 亿参数的稠密模型,却保留了千亿规模参数带来的知识容量与能力上限。MoE 架构的挑战在于路由机制的稳定性——如何让每个专家获得均衡的训练样本、避免某些专家被过度使用而另一些近乎闲置,是训练阶段的核心难题。

嵌入与扩散:模型架构的两条新路径

Google 还发布了面向设备端场景优化的轻量级多模态嵌入模型 Embedding Gemma 2,可将文本、代码、图像、视频和音频映射到统一嵌入空间。模型采用 740M 参数的模块化编码器,支持灵活的向量维度,全部权重已以 Apache 2.0 许可开放下载。对需要在端侧做检索、语义匹配的开发者而言,这类小而全的嵌入模型意义不小。

扩散语言模型

架构创新方面,亚马逊 AGI 团队发布了扩散语言模型,同时公开 17 亿和 80 亿参数两档权重以及训练推理代码。这类模型在并行生成的同时按难度分配计算——有把握的 Token 提前确定并作为上下文,较难的 Token 则最多循环精炼四轮。这种「按难度分配算力」的思路,是对自回归生成范式的一次有价值的补充。

学术界同样活跃:复旦大学、腾讯混元和浙江大学团队开源了音视频联合生成框架 Prism,可在 720P、1080P 到 2K 分辨率下原生生成并训练带声音的视频。而 OpenAI 则公开了一批由内部前沿模型产出的数学成果,共 722 份手稿,模型在评测中被提出约 4000 个开放研究问题,平均每个成果耗费约 3 小时的 ChatGPT Pro 思考算力。官方坦承这批成果处于不同验证阶段,未形式化的部分可能存在问题——这种对不确定性的如实披露值得肯定。

嵌入模型(Embedding Model)的核心作用是将不同模态的原始数据(文本、图像、音频等)映射到同一高维向量空间,使语义相近的内容在空间中距离相近。这一特性是检索增强生成(RAG)、语义搜索和跨模态匹配等应用的基础。统一多模态嵌入空间意味着可以用一段文字检索相关视频片段,或用一张图片检索相似音频——无需为每对模态单独训练匹配模型。Embedding Gemma 2 支持灵活的向量维度,开发者可在精度与存储成本之间权衡取舍:维度越高语义区分能力越强,但索引占用空间和检索延迟也随之上升。端侧部署场景对模型体积和延迟要求严格,740M 参数的量级在功能完整性与资源占用之间取得了相对务实的平衡。

扩散语言模型(Diffusion Language Model)借鉴了图像生成领域扩散模型的思想:传统自回归模型逐个 Token 从左到右串行生成,而扩散模型从全部位置同时"去噪",在多轮迭代中逐步将随机噪声精炼为连贯文本。亚马逊团队的实现引入了按难度分配计算轮次的机制——模型置信度高的位置提前锁定并作为后续轮次的上下文锚点,置信度低的位置则继续迭代,最多精炼四轮。这种并行生成+动态算力分配的组合,理论上在长序列生成时可获得比自回归更低的端到端延迟,同时对全局一致性的把控也更灵活。

决策模型与 Agent 生态的快速扩张

决策类(Decision)模型成为本轮的一个明显趋势。OpenAI 宣布 Decisions API 向所有开发者开放公开测试,可让应用在近实时条件下选择合适的模型、工具或动作,该接口由 GPT-6 Luna 驱动,支持文本和图像输入。Perplexity 更新了开放权重多模态决策模型 Decider,官方称其在新版 Hugging Face Decision Index 基准上得分最高,且 Decision API 价格降为此前一半。Empiro Labs 也发布了首个决策模型 Aplomb-E,支持将文本、图像、视频和音频放入同一请求。

各档都能使用Cloud Opus 5.5

编程 Agent 领域持续加码:Codex 负责人 Teebo 宣布 Auto Review 功能对所有通过 ChatGPT 账号登录的用户免费开放,且不消耗订阅额度。该功能让第二个 Agent 审查主 Agent 的每一项操作,拦截高风险和偏离用户意图的动作——这种「Agent 监督 Agent」的双层架构,正成为提升自动化安全性的通行做法。Anthropic 则将 Project Glasswing 与原有 CVP 整合为扩展版网络安全验证计划,按防御、红队、专项三档向通过审核的安全从业者开放。

OpenAI 还将 API 付费用量层级从 5 档合并为 Build、Launch、Grow 三档,新最高档 Grow 只需累计 500 美元 API 付款即可获得资格,现有组织将自动迁移。

决策模型(Decision Model)是一类专门为「选择下一步动作」场景优化的模型,区别于通用语言模型在生成流畅文本方面的优化目标。其核心任务是在给定当前上下文、可用工具列表和目标的情况下,快速输出结构化的动作指令,而非生成自然语言段落。这类模型通常对延迟要求极高——Agent 流水线中每一步决策的等待时间会被累乘放大,毫秒级的响应速度对用户体验至关重要。「Agent 监督 Agent」的双层架构则是对单一 Agent 容易产生幻觉或执行偏差问题的工程解法:主 Agent 负责规划与执行,审查 Agent 专注于评估每步操作是否符合用户意图和安全策略,两者职责分离,降低了单点失误的风险。

协议标准与基础设施:为 Agent 时代铺路

随着 Agent 走向规模化,底层标准和基础设施成为新焦点。Sierra 与 Meta 联合 Shopify、Stripe、沃尔玛等公司宣布开发开放标准 Personal Agent Protocol,为个人 Agent 与企业的交互定义统一方式:消费者决定授予个人 Agent 哪些权限,企业自行设定 Agent 能做什么,首版 V0.1 规范计划本月晚些时候公布。多家行业巨头联手制定标准,意味着个人 Agent 代用户与商家交易的场景正在逼近。

协议让消费者决定授予个人Agent哪些权限

GitHub 宣布正在重建其 Git 基础设施,以支撑开发者和大量 AI Agent 并发读写仓库的负载,官方称新架构的写入吞吐量最高可达原来的 35 倍。当 Agent 成为代码仓库的高频访问者,传统为人类设计的基础设施已难以承载,这项重建颇具风向标意义。

Personal Agent Protocol 试图解决的是「身份与授权」这一根本问题:当一个 AI Agent 代表用户在电商平台下单、在银行查询余额或在医疗平台预约挂号时,企业需要一套统一的方式验证该 Agent 是否获得了用户的合法授权、授权范围边界在哪里。缺乏标准会导致每家企业各自定义接口,Agent 与商家之间的互操作成本极高,且容易出现授权模糊的安全漏洞。V0.1 规范的设计思路将控制权交给消费者端(决定给 Agent 哪些权限)和企业端(决定 Agent 能触发哪些操作),这种双向声明式授权模型与 OAuth 2.0 的设计哲学有相似之处,但需要在机器对机器交互场景下进一步扩展身份证明和动作粒度的表达能力。

资本与地缘:巨额融资与国防争议

但知情人士向BBC透露

资本层面消息密集。据报道,OpenAI 正与阿联酋多家投资基金洽谈,拟完成一轮至少 300 亿美元的融资,MGX 等基金可能合计出资最高 100 亿美元,贝莱德也在商谈参与,本轮对应估值约 1.4 万亿美元。国内方面,据彭博社报道,DeepSeek广告 新一轮融资即将收尾,金额至少 800 亿元人民币,腾讯和宁德时代出资居前,最终总额或近千亿元,为 2027 年初的 IPO 铺路。快手旗下视频生成服务可灵 AI 也已选定中金、高盛和瑞银筹备香港上市,拟募资至少 10 亿美元。

争议同样存在。据 BBC 报道,美国国防部确认已停止使用 Anthropic 的全部产品,该部门早前将 Anthropic 列为国家安全供应链风险,但知情人士透露直到上周 Cloud 仍被用于情报分析和对伊朗的军事行动——AI 在国防场景的应用边界,依旧充满张力。

结语

从旗舰模型到决策 API,从嵌入模型到 Agent 协议标准,这一轮更新呈现出清晰的方向:模型能力继续向多模态、稀疏激活演进,而产业重心正快速从「造更强的模型」转向「如何让 Agent 安全、可靠地规模化运转」。无论是 GitHub 的基础设施重建,还是 Personal Agent Protocol 的多方共建,都在为一个 Agent 密集交互的未来打地基。

分享:

相关推荐