GPT-7预览、Mistral Large 4与Claude Code更新全解析

OpenAI、Mistral、Google、Anthropic单日密集更新,AI从回答问题加速迈向参与科研与创造。
本文梳理了AI领域一天内的多项重要进展:OpenAI疑似泄露的前沿模型(社区称"Bell")在数学领域测试4000个问题,公开722篇手稿,部分含可机械验证的Lean形式化证明;Mistral发布万亿参数MoE模型Large 4,在CTF夺旗赛和恶意软件逆向工程上表现突出,12分钟完成人类研究员需一天的分析任务;Google推出性价比更优的图像生成模型Nanobanana 2.1,以及仅7.4亿参数即支持端侧多模态检索的Embedding Gemma 2;Anthropic则将Claude嵌入Google办公套件,并为Claude Code引入子智能体推理努力程度分级控制。整体趋势指向AI能力从单点问答向并行科研、专业安全分析和个人软件开发快速渗透。
AI领域再次迎来密集更新。OpenAI疑似未发布的前沿模型在数学研究上展现惊人实力,Mistral推出万亿参数的Large 4主攻网络安全,Google升级图像与嵌入模型,Anthropic则在Claude Code与办公集成上持续加码。本文梳理这些关键进展,并给出理性判断。
OpenAI神秘模型:722篇数学手稿背后的信号
OpenAI被认为再次泄露了一款未发布模型的能力——社区称之为"Bell",可能是GPT-6.5或GPT-7。真正引发关注的,是OpenAI公开发布了722篇AI生成的数学手稿,覆盖372个结果族,这些成果来自对该内部模型约4000个数学研究问题的测试。

与以往的基准测试不同,这些问题触及黎曼ζ函数、霍奇猜想、自旋玻璃、量子磁性、自由群因子等前沿数学领域。据介绍,平均每个成功结果只需要约三小时的ChatGPT Pro等效思考算力。更关键的是,部分成果来自Lean形式化证明,意味着这些结论可以由形式化证明系统验证,而非仅凭AI的文字表述。
OpenAI还就成果如何发布咨询了高等研究院、独立数学家及AI顾问团体。需要强调的是,这并不意味着每条结果都是已验证的数学突破——比如关于黎曼ζ函数某区域外无零点的"进展",或霍奇猜想特例的工作,都还需要独立的严格审查。真正值得警惕的信号不是某条定理,而是"规模":当4000个研究问题被同时抛给一个模型并产出数百项结果,科学研究本身正在变得可并行化。
Lean形式化证明是一种基于类型论的交互式定理证明语言,由微软研究院开发。与自然语言描述的数学证明不同,Lean要求每一个推导步骤都能被计算机内核机械地验证——只要程序编译通过,证明的逻辑正确性就有严格保障,不依赖人工审查。这使得Lean成为目前数学界验证复杂证明的黄金标准之一,菲尔兹奖得主陶哲轩等数学家已将其用于正式化自己的研究成果。AI生成的证明若能通过Lean验证,意味着其正确性不再仅凭模型的"说法",而是经过了可机械复现的逻辑核查,这是与此前AI数学能力展示的本质区别。
OpenAI"28天连更":四项实用更新
作为"28天连续发布"承诺的第二天,OpenAI一口气推出四项更新。Auto-review(自动审查)现对所有登录ChatGPT账户的用户免费开放,它通过第二个智能体自动审查主智能体的操作,专门拦截高风险或偏离初始需求的动作,尤其适合长时间运行的智能体任务。此前该功能会占用约2%-10%的用量额度,如今不再消耗套餐额度。

API用量层级被简化,从原来的五个付费层压缩为build、launch、grow三档,达到最高grow层只需累计500美元API消费(此前为1000美元)。会议记录(Meetings)插件进入beta,可在会议中记笔记、生成个性化摘要和后续步骤,并直接保存进ChatGPT空间,结合记忆功能还能让它更新项目计划或把上下文传给Codex启动开发。最后是Decision API,这是一个实时分类器,让应用快速决定下一步调用哪个模型、工具或动作,官方称决策速度最高可比GPT-6 Luna通过Response API快10倍。社区投票要求重置用量,OpenAI坦言投票可能被操纵但"规则就是规则",最终重置了所有人的用量,且未撤回任何已发布功能。
Mistral Large 4:网络安全是最大亮点
Mistral发布了代号"LeChunk"的Mistral Large 4,这是一款万亿参数、原生多模态的MoE模型,激活参数约490亿。Mistral称其为美国或欧洲产出的最强开放权重模型(按综合基准),并主打网络防御、制造、金融等严肃工作负载。模型端到端在欧洲开发,可通过Mistral自有的欧洲云基础设施部署,对关注数据主权的欧洲企业颇具吸引力。API已上线,开放权重预计月底放出。

在网络安全领域,Large 4的表现确实突出:在19项夺旗(CTF)挑战中解决了18项,并且在恶意软件逆向工程测试中,面对一个未知二进制文件,它识别出Cobalt Strike、提取配置与入侵指标、生成完整调查报告(含用于检测类似事件的Yara规则),整个过程仅用12分钟,而人类安全研究员通常需要一整天。不过需客观看待:它在部分网络安全基准上领先Opus 5.5和GPT-6 Ashera,部分原因是其安全任务更少——而Opus和Ashera约有40%的任务被自家安全过滤器拦截。
在创意编程、Web开发等常规软件开发场景,结果则明显参差。一位开发者用同一3D提示词一次性测试八个模型:在埃菲尔铁塔提示上Mistral是开源模型中最佳(但GPT-6 Astra综合最优),在水族箱提示上却接近垫底(Opus 5.5最佳)。模型推理速度偏慢,定价约为每百万输入token 68美分、输出2.09美元,前两周五折。整体而言,它并非最佳日常开发模型,但在网络安全、恶意软件分析等专业领域值得一用。
MoE(Mixture of Experts,专家混合)架构是当前大模型扩展的主流方案之一。其核心思想是将模型参数分成若干"专家"子网络,每次推理时由一个轻量级路由器动态选择少数几个专家参与计算,而非激活全部参数。Mistral Large 4拥有万亿总参数,但每次推理仅激活约490亿参数,这意味着其推理计算量远低于同等规模的稠密模型,在保持强大能力的同时显著降低了推理成本。GPT-4、DeepSeek广告等知名模型也采用类似架构。Cobalt Strike则是网络安全领域广泛使用的渗透测试框架,因功能强大常被攻击者滥用于真实入侵,其配置文件和通信特征的识别是威胁情报分析的重要环节;Yara规则是一种用于恶意软件模式匹配的描述语言,安全团队用它对文件或进程特征编写检测规则,是SOC(安全运营中心)日常工作的基础工具。
Google:Nanobanana 2.1与Embedding Gemma 2
Google发布了Nanobanana 2.1,在视觉设计、基于遮罩的编辑、主体一致性和图像自然度上全面提升。遮罩编辑尤其实用,可精准修改图像局部而不破坏整体,角色、人物或物体在多次迭代中能保持更高一致性。

成本与速度是Nanobanana的强项:在相同提示生成5张图的对比中,它约4美分/张、11秒出图,而GPT image 2.5约7美分/张、50秒。虽然图像质量不及OpenAI的image 2.5,但速度快约4.5倍、价格更低,适合规模化场景。
另一款Embedding Gemma 2是Google首个面向端侧的原生多模态开放嵌入模型,仅7.4亿参数,却能在同一共享空间理解文本、代码、图像、音频和视频,甚至超越部分规模两倍以上的专用模型,采用Apache 2.0许可证开放权重。在NVIDIA DGX Spark上的本地测试中,它为300张动物照片建立索引,再用20张独立图片检索最相似的10张,最终200次检索中命中165次,精度达82.5%,斑马、老虎、熊猫、北极熊等类别甚至满分。
**嵌入模型(Embedding Model)**的核心作用是将文本、图像、音频等异构内容映射到同一高维向量空间,使得语义相近的内容在空间中距离更近。这是语义搜索、跨模态检索、RAG(检索增强生成)等应用的底层基础。传统嵌入模型往往针对单一模态(如纯文本),多模态场景需要分别调用不同模型再对齐向量空间,增加了工程复杂度。Embedding Gemma 2的意义在于,它将文本、代码、图像、音频、视频的嵌入统一到单一共享空间,意味着可以直接用图片检索相关文档、用文字描述检索音频片段,而无需额外的对齐层。7.4亿参数的体量使其可在边缘设备或个人电脑上本地运行,对隐私敏感场景(如医疗、法律文档处理)尤具价值。
Anthropic:Claude Code升级与办公集成
Anthropic方面,Claude现已可直接在Google Docs、Sheets和Slides中工作,以侧边栏形式理解当前文件内容并就地编辑,用户可在应用前审批修改;反向也支持将这些文件直接在Claude中打开。这是Claude从聊天机器人向真正生产力工具迈进的一步。
Claude Code的另一项更新允许为每个子智能体单独设定推理"努力程度",较低努力用于加速、较高努力留给困难环节,可显著节省token,需升级至2.1.292或更新版本,桌面端支持即将到来。此外,社区发现了名为Mythos 5.1的模型,据称与Fable 5.1使用相同底层权重,但大幅放宽了网络安全和生物安全限制,仅向通过验证的安全专业人员分级开放(防御、红队、高度受限专业三类层级),普通用户仍使用公开模型。
一个颇具冲击力的案例是:有开发者用Claude Opus 5.5重建了包括Photoshop在内的七款Adobe核心应用,全部用Rust编写、开源免费,其中类Photoshop的工具据称已完成约90%的核心能力。尽管开发者承认它尚不能完全替代专业场景的Photoshop,但过去需要庞大团队、数百万美元和数年开发的软件,如今个人开发者借助前沿AI即可逼近——软件构建的门槛正在快速坍塌。
CTF(Capture The Flag,夺旗赛)是网络安全领域的标准竞技形式,参与者需通过逆向工程、漏洞利用、密码分析等手段找到隐藏的"旗标"字符串以证明成功攻破目标。CTF题目通常模拟真实攻击场景,被广泛用于评估安全工具和人员能力。Mistral Large 4在19项CTF中完成18项,是目前公开报告中AI模型在该类测试上的较高成绩,但也需注意CTF题目难度差异悬殊,具体题目集的选取对结果影响显著。另外,文中提到的Mythos 5.1采用"分级开放"策略,是AI安全领域"差异化访问控制"的早期实践——即对同一底层模型按用户身份和用途授予不同的能力边界,试图在安全研究可用性与滥用风险之间寻求平衡,这一模式未来可能成为高风险能力模型的标准部署范式。
结语
这一天的更新密度折射出当前AI竞赛的节奏:OpenAI用数学成果释放前沿模型的信号,Mistral在网络安全细分领域找到差异化定位,Google主打性价比与端侧多模态,Anthropic则深耕编程与办公生产力。需要保持理性的是,无论是722篇数学手稿还是网络安全基准,都需独立验证;但这些进展共同指向一个趋势——AI正从"回答问题"走向"参与创造"。
相关推荐

AI+SRC自动化挖洞实战:用AI智能体重构漏洞挖掘三步法
本文详解AI+SRC自动化漏洞挖掘的完整思路,对比传统挖洞三步法与AI智能体加持后的变化,涵盖资产盘点、误报筛选、报告生成及AI Agent选型要点,助你高效入门SRC漏洞挖掘。

实测DeepSeek桌面Agent:0.35美元自动生成视频
海外博主实测DeepSeek桌面Agent(DeepSeek Harness):仅0.35美元自动生成完整视频,设置每日自动简报,两分钟从大白话构建可运行App。三项任务全部完成仅花0.59美元,附详细表现与成本分析。

Antigravity 2.0 保姆级教程:MCP、Skill与自动化全解析
Antigravity 2.0 保姆级教程,详解项目/会话/Agent 三大核心概念、消息队列与权限设置、自动化任务、MCP 连接 Figma、Skill 专业技能,并演示设计稿转代码、Android 应用生成、产品页 1:1 复刻等 6 个实战案例。