Gemini 4 Argon发布:谷歌凭多项基准测试重回第一梯队

谷歌Gemini 4 Argon在办公流程、长视频理解、长流程编程三项基准上压过GPT-6 Astra和Claude Opus 5.5,但三家仍各有擅场。
谷歌发布的Gemini 4 Argon在三项关键基准测试中正面领先两大对手:Automation Bench办公流程测试得分51.3%,领先GPT-6 Astra和Claude Opus 5.5近10个百分点;LVBench长视频理解达91.7%;Deep SWE长流程编程测试77.9%,并以让视频解码软件提速至Rust版本2.7倍的真实案例加以佐证。这些测试的共同特点是模拟真实工作场景,而非孤立的单题问答。不过竞争格局并未一边倒——GPT-6 Astra在Frontier SWE测试中领先,Claude Opus 5.5在终端操作上更强。Argon目前先向网络安全合作伙伴开放,后续逐步扩大。谷歌这次把具体成绩单摆上桌,意味着"三强鼎立"的格局进入了更细粒度的任务级竞争阶段。
谷歌最新发布的Gemini 4 Argon,在多个关键基准测试中正面压过了GPT-6 Astra和Claude Opus 5.5两大对手。据B站UP主朱家乐的分析,这一代模型让人有理由重新把三家顶级AI拿到同一张桌子上比较——而理由不是泛泛而谈,而是具体到一项工作、一组成绩、一个真实工程案例。
办公流程:把散落的信息接起来
最贴近日常工作的能力,体现在谷歌公布的Automation Bench办公流程测试中。Gemini 4 Argon拿到51.3%,GPT-6 Astra为41.4%,Claude Opus 5.5为42.5%。谷歌在这一项上同时超过了两家竞品,且领先幅度接近10个百分点。
这个测试考的是什么?可以理解成把AI放进一个模拟公司,检查它能不能跨软件找资料、更新记录、把事情真正办完。比如客户发来新的采购要求,旧报价在一张表格里,新的优惠条件写在另一份文件中——AI需要先找对客户,再核对条件,更新数据,最后通知对应的人。只写一段「建议你这样做」不算完成,信息得找对,操作也得做对。

这与普通用户的关系在于:当我们让AI处理一批客户资料、整理报价、推进项目时,真正需要的就是这种把散落在不同地方的信息接起来、让工作继续往前走的能力。
长视频理解:看懂藏在画面里的细节
谷歌这次打得漂亮的另一项是长视频理解。在LVBench测试中,Gemini 4 Argon拿到91.7%,GPT-6 Astra为87.5%,Claude Opus 5.5为83.7%。
想象拿到一段很长的产品培训视频,想知道某个功能怎么设置、哪里有限制,答案可能藏在几秒钟的操作画面里,也可能出现在一张图表或一行小字中。只看字幕未必能把细节找全。如果AI能看懂画面、把前后信息联系起来,整理课程、研究产品、查找视频素材就能省下反复拖进度条的时间。对内容创作者而言,这项能力的实际价值在于:它能找到真正有用的片段,讲清楚画面里到底发生了什么。
长流程编程:从做小样到改真实软件
GPT和Claude一直在编程上表现凶猛,但这次谷歌在长流程软件工程测试Deep SWE中也赢下一局。Gemini 4 Argon拿到77.9%,GPT-6 Astra为74.9%,Claude Opus 5.5为74.2%。

更有说服力的是谷歌拿出的真实工程案例:在一次视频解码软件优化中,Argon反复运行测试、分析结果、修改代码,最终让程序达到此前Rust版本2.7倍的运行速度,同时视频输出保持一致。
这个例子值得停下来想想。从零做一个演示网页,和接手一套已经存在的软件,难度完全不同。后者需要读懂原有代码、找到影响速度的地方、修改之后还要保证输出不变。这类能力继续进步,意味着AI参与的工作会从「帮我做个小样」走向「维护和改造真正运行中的软件」。
Deep SWE(Deep Software Engineering)测试与常见的编程基准有本质区别。传统编程测试往往只要求AI根据描述写出一段函数或解决一道算法题,而Deep SWE模拟的是真实软件工程环境:AI需要在一个已有代码库中理解现有架构、定位问题、迭代修改,并通过自动化测试验证结果的正确性。这更接近真实开发者的日常工作——接手别人写的代码,在不破坏现有功能的前提下完成改动。视频解码优化案例中提到的"2.7倍于Rust版本的速度"尤为值得关注,Rust以内存安全和高性能著称,是系统级编程的主流选择之一,能在保持输出一致的前提下超越其性能,意味着AI的优化能力已进入系统级软件的竞争区间,而非仅停留在脚本或应用层。
竞争没有一边倒:三家各有擅场
这场竞争并没有变成谷歌的独角戏。在同一张官方成绩表里,GPT-6 Astra在Frontier SWE软件工程测试中领先,Claude Opus 5.5在终端操作测试中更强。

这个局面反而更有火药味:办公流程、长视频理解、长流程编程,谷歌拿出了领先成绩;换到其他工程任务,GPT和Claude又有各自的优势。换句话说,「把所有难题交给同一个AI」的习惯可能要变了——处理复杂资料、分析长视频,Gemini又成了值得认真考虑的选择。
文中提到的Frontier SWE与Deep SWE虽然都考察软件工程能力,但侧重点不同。Frontier SWE更多考察模型在前沿、开放式工程问题上的边界能力,通常包含更高复杂度的代码推理与系统设计;而Deep SWE如上文所述,强调在真实代码库中的长流程迭代。两项测试的分项差异说明,当前没有任何一个模型在"软件工程"这个宽泛领域全面领先——选择哪个AI辅助编程,仍需根据具体任务类型来判断,而非简单依赖单一榜单排名。
开放节奏与真正的较量
目前Argon先向受邀的网络安全合作伙伴开放,后续再逐步扩大到开发者、企业和普通用户。

真正的检验要等用户上手之后:同一段产品录屏谁找得准关键细节,同一批客户资料谁能理清条件,同一个软件项目谁能改好还不破坏原有功能。谷歌这次要赢回来的,正是这些具体任务里的「第一选择」地位。上一次外界讨论的是谷歌准备绝地反击,这一次它已经把成绩单摆到了桌上——GPT和Claude想继续留住用户,这回得认真应对谷歌这个对手了。
相关推荐

AI温和派的崛起:在狂热与末日论之间寻找中间地带
AI舆论正陷入加速主义与末日论的两极撕裂,但一群"AI温和派"正在崛起。本文梳理福山、"AI作为常规技术"作者及好莱坞制片人卡森伯格的最新观点,呈现在狂热与恐惧之间寻找中间地带的思潮。
我让Claude构建可漫步的物理精确O'Neill圆柱:AI生成3D模拟的边界
我让Claude构建可漫步的物理精确O'Neill圆柱:AI生成3D模拟的边界
一位开发者让Claude构建物理精确、可实时漫步的O'Neill圆柱太空栖息地模拟。本文解析其中的科里奥利力、重力梯度等物理挑战,以及AI生成交互式3D模拟的现实意义与局限。

破解数据锁定:用REGISTER与UNREGISTER API实现目录可移植性
湖仓架构下,开放表格式解决了存储可移植性,但目录锁定成为新难题。本文解析REGISTER与UNREGISTER API如何实现元数据松耦合,帮助企业避免厂商绑定、支持多目录协作并安全迁移数据。