[控场AI]
· 4 分钟阅读· 2,389 字

Gemini 4 Argon发布:谷歌凭多项基准测试重回第一梯队

Gemini 4 Argon发布:谷歌凭多项基准测试重回第一梯队

谷歌Gemini 4 Argon在办公流程、长视频理解、长流程编程三项基准上压过GPT-6 Astra和Claude Opus 5.5,但三家仍各有擅场。

谷歌发布的Gemini 4 Argon在三项关键基准测试中正面领先两大对手:Automation Bench办公流程测试得分51.3%,领先GPT-6 Astra和Claude Opus 5.5近10个百分点;LVBench长视频理解达91.7%;Deep SWE长流程编程测试77.9%,并以让视频解码软件提速至Rust版本2.7倍的真实案例加以佐证。这些测试的共同特点是模拟真实工作场景,而非孤立的单题问答。不过竞争格局并未一边倒——GPT-6 Astra在Frontier SWE测试中领先,Claude Opus 5.5在终端操作上更强。Argon目前先向网络安全合作伙伴开放,后续逐步扩大。谷歌这次把具体成绩单摆上桌,意味着"三强鼎立"的格局进入了更细粒度的任务级竞争阶段。

谷歌最新发布的Gemini 4 Argon,在多个关键基准测试中正面压过了GPT-6 Astra和Claude Opus 5.5两大对手。据B站UP主朱家乐的分析,这一代模型让人有理由重新把三家顶级AI拿到同一张桌子上比较——而理由不是泛泛而谈,而是具体到一项工作、一组成绩、一个真实工程案例。

办公流程:把散落的信息接起来

最贴近日常工作的能力,体现在谷歌公布的Automation Bench办公流程测试中。Gemini 4 Argon拿到51.3%,GPT-6 Astra为41.4%,Claude Opus 5.5为42.5%。谷歌在这一项上同时超过了两家竞品,且领先幅度接近10个百分点。

这个测试考的是什么?可以理解成把AI放进一个模拟公司,检查它能不能跨软件找资料、更新记录、把事情真正办完。比如客户发来新的采购要求,旧报价在一张表格里,新的优惠条件写在另一份文件中——AI需要先找对客户,再核对条件,更新数据,最后通知对应的人。只写一段「建议你这样做」不算完成,信息得找对,操作也得做对。

把散落在不同地方的信息接起来

这与普通用户的关系在于:当我们让AI处理一批客户资料、整理报价、推进项目时,真正需要的就是这种把散落在不同地方的信息接起来、让工作继续往前走的能力。

长视频理解:看懂藏在画面里的细节

谷歌这次打得漂亮的另一项是长视频理解。在LVBench测试中,Gemini 4 Argon拿到91.7%,GPT-6 Astra为87.5%,Claude Opus 5.5为83.7%。

想象拿到一段很长的产品培训视频,想知道某个功能怎么设置、哪里有限制,答案可能藏在几秒钟的操作画面里,也可能出现在一张图表或一行小字中。只看字幕未必能把细节找全。如果AI能看懂画面、把前后信息联系起来,整理课程、研究产品、查找视频素材就能省下反复拖进度条的时间。对内容创作者而言,这项能力的实际价值在于:它能找到真正有用的片段,讲清楚画面里到底发生了什么。

长流程编程:从做小样到改真实软件

GPT和Claude一直在编程上表现凶猛,但这次谷歌在长流程软件工程测试Deep SWE中也赢下一局。Gemini 4 Argon拿到77.9%,GPT-6 Astra为74.9%,Claude Opus 5.5为74.2%。

Gemini 4 Argon在Deep SWE拿到77.9%

更有说服力的是谷歌拿出的真实工程案例:在一次视频解码软件优化中,Argon反复运行测试、分析结果、修改代码,最终让程序达到此前Rust版本2.7倍的运行速度,同时视频输出保持一致。

这个例子值得停下来想想。从零做一个演示网页,和接手一套已经存在的软件,难度完全不同。后者需要读懂原有代码、找到影响速度的地方、修改之后还要保证输出不变。这类能力继续进步,意味着AI参与的工作会从「帮我做个小样」走向「维护和改造真正运行中的软件」。

Deep SWE(Deep Software Engineering)测试与常见的编程基准有本质区别。传统编程测试往往只要求AI根据描述写出一段函数或解决一道算法题,而Deep SWE模拟的是真实软件工程环境:AI需要在一个已有代码库中理解现有架构、定位问题、迭代修改,并通过自动化测试验证结果的正确性。这更接近真实开发者的日常工作——接手别人写的代码,在不破坏现有功能的前提下完成改动。视频解码优化案例中提到的"2.7倍于Rust版本的速度"尤为值得关注,Rust以内存安全和高性能著称,是系统级编程的主流选择之一,能在保持输出一致的前提下超越其性能,意味着AI的优化能力已进入系统级软件的竞争区间,而非仅停留在脚本或应用层。

竞争没有一边倒:三家各有擅场

这场竞争并没有变成谷歌的独角戏。在同一张官方成绩表里,GPT-6 Astra在Frontier SWE软件工程测试中领先,Claude Opus 5.5在终端操作测试中更强。

同一张官方成绩表

这个局面反而更有火药味:办公流程、长视频理解、长流程编程,谷歌拿出了领先成绩;换到其他工程任务,GPT和Claude又有各自的优势。换句话说,「把所有难题交给同一个AI」的习惯可能要变了——处理复杂资料、分析长视频,Gemini又成了值得认真考虑的选择。

文中提到的Frontier SWE与Deep SWE虽然都考察软件工程能力,但侧重点不同。Frontier SWE更多考察模型在前沿、开放式工程问题上的边界能力,通常包含更高复杂度的代码推理与系统设计;而Deep SWE如上文所述,强调在真实代码库中的长流程迭代。两项测试的分项差异说明,当前没有任何一个模型在"软件工程"这个宽泛领域全面领先——选择哪个AI辅助编程,仍需根据具体任务类型来判断,而非简单依赖单一榜单排名。

开放节奏与真正的较量

目前Argon先向受邀的网络安全合作伙伴开放,后续再逐步扩大到开发者、企业和普通用户。

后续逐步扩大开放范围

真正的检验要等用户上手之后:同一段产品录屏谁找得准关键细节,同一批客户资料谁能理清条件,同一个软件项目谁能改好还不破坏原有功能。谷歌这次要赢回来的,正是这些具体任务里的「第一选择」地位。上一次外界讨论的是谷歌准备绝地反击,这一次它已经把成绩单摆到了桌上——GPT和Claude想继续留住用户,这回得认真应对谷歌这个对手了。

分享:

相关推荐