谷歌Antigravity+Gemini 3.7 Flash:AI从写代码到自主交付的质变

Gemini 3.7 Flash 搭配 Antigravity 平台,让 AI 从「生成代码」升级为能自主完成任务、遇错自修的「执行智能体」。
Google 发布的 Gemini 3.7 Flash 距上一代仅隔三周,却在编程基准 Frontier Code 和业务自动化基准 Automation Bench 上分别取得显著提升,后者得分近乎翻倍。更关键的变化不在分数,而在工作方式:该模型被集成进 Antigravity 开发平台,以 Agent 模式运行——接到任务后自主规划、编写代码、执行测试,遇到错误会读取信息并自动修复,再在真实浏览器中验证结果,形成完整的闭环交付。Antigravity 2 还引入了 Sub-Agents 并行协作、定时任务和语音指令等系统级能力,使 AI 从被动的代码补全工具,向能被人类「布置任务、检查结果」的自主执行者转变。作者同时强调,现阶段仍需人类把控方向与目标,AI 是强力工具而非替代品。
从「写代码」到「干完活」的质变
长期以来,AI编程工具给人的印象是:它能帮你生成一段看起来不错的代码,然后就「跑路」了——测试要你自己跑,Bug要你自己修,浏览器里能不能正常显示也要你自己验证。据B站UP主Peep的实测演示,Google发布的新模型 Gemini 3.7 Flash,正试图打破这一局面。
它的核心定位不再是聊天陪伴,而是一个「主力干活模型」,专门面向编程和Agent(智能体)场景。更关键的是,Google没有把它孤立地塞进对话窗口,而是直接集成进了一个名为 Antigravity 的开发平台中。用去掉术语的白话说:AI能自己去把项目里的活干完——写代码、跑测试、遇到Bug读错误信息自动修复,还会在真实浏览器里再验证一遍结果,全程不需要你盯着。

这种「端到端交付」的能力,才是本次更新真正被低调隐藏、却极具分量的升级点。
Gemini 3.7 Flash性能实测:三周迭代带来多大提升
有意思的是,Gemini 3.7 Flash 距离上一代 3.6 Flash 的发布仅隔了三周——这个迭代节奏快得有些惊人。那么它到底是真升级,还是只换了个好看的版本号?基准测试给出了答案。
编程能力大幅提升
- 在 Frontier Code 编程基准上,旧模型得分 34.4%,新模型提升至 43.6%;
- 在 Deep Squeeze 测试中,旧模型仅 49%,新模型跃升至 65.3%。
这样的跨度,考虑到仅隔三周,确实相当罕见。Google强调,这种提升体现在每天真正重要的事情上:修复Bug、解决真实问题、以及写出第一次就能跑通的代码。
文中提到的几个基准测试名称对普通读者可能较为陌生。Frontier Code 是衡量模型解决复杂、前沿编程问题能力的基准,题目通常涉及算法设计、系统级代码或真实工程场景,得分从 34.4% 跃升至 43.6% 意味着模型在最难的一批题目上通过率提高了近三成。Automation Bench 则更接近真实办公场景,考察模型能否独立完成多步骤的业务流程任务,例如解析表格、填写表单、触发工作流等——这类任务既需要理解上下文,也需要稳定地操作外部工具,是衡量「实用性」而非单纯「智力」的指标。30.4% 的得分看起来绝对值不高,但相较旧模型 17% 的基线,已是质的飞跃,也说明这类任务对当前所有模型而言仍然极具挑战性。
知识工作同样受益
更容易被忽略的是,这次升级并不局限于编码领域。在衡量真实业务流程任务的 Automation Bench 上,旧模型仅 17%,新模型达到 30.4%,几乎翻倍。这一点很重要——真实工作并不全是写代码,还有大量阅读、整理文档、处理工作流这类「不起眼却悄悄占掉你整个下午」的琐事。一个更擅长处理文档与流程的模型,能实打实帮你省回时间。

AI Agent核心机制:从「卡住就停」到「调整再试」
对Peep而言,Agent部分才是本次更新最精彩之处。Gemini 3.7 Flash 的工作节奏是这样一个闭环:
- 接到任务后先做规划;
- 编辑文件、运行代码、测试代码;
- 一旦出问题,不直接放弃,而是调整、修复错误、确认最终结果;
- 如果没成功,就再来一次。
关键词是 Adjust(调整)。老模型一碰到坎就会直接停住,留下一个半成品,你甚至不知道它哪里坏了。而新模型会持续尝试——先修,再检查是否生效,没成就再来。这正是「只会给你布置作业的AI」与「能直接交付成品的AI」之间的本质区别。
据演示,用户只需给出一行提示,比如「给某个页面做一个简洁的资源页,写清楚会员能得到什么,并保证在手机上运行流畅」,Agent就会自动梳理需求、搭建页面、在浏览器里测试,用户最后只需回头审查最终版本即可。
「Agent(智能体)」这个词在文中频繁出现,值得单独说清楚。AI Agent 是指能够感知环境、自主规划步骤、并采取一系列行动以完成目标的 AI 系统,区别于普通聊天模型「一问一答」的被动模式。普通模型的工作方式是:你给一个输入,它返回一个输出,然后等待下一条指令。Agent 则不同——它拿到目标后,会自己分解步骤、调用工具(例如执行代码、读写文件、打开浏览器)、观察执行结果,再决定下一步怎么做,整个过程形成一个持续的「感知—决策—行动—反馈」闭环。这也解释了为什么文中强调「调整(Adjust)」如此关键:只有具备自我纠错能力的闭环,才能真正把一件事从头做到尾,而不是在第一个障碍前停下来把球踢回给用户。
Antigravity平台详解:一个「Agent团队指挥室」
Antigravity 并不是一个孤立的应用。回顾 Google I/O,它作为 Antigravity 2 发布,由多个部分组成,可以理解为一个控制室,让你一次运行并指挥整支Agent小队:
- 桌面应用:统一调度多个Agent;
- 终端运行:可直接在命令行里跑Agent;
- SDK:开发者可自建定制Agent;
- 编程环境:内置Agent管理器。

三个真正实用的新能力
除了主体框架,几个新功能尤其值得关注:
- Sub-Agents(子智能体):主Agent可以把部分任务分派给助手Agent,实现并行工作——比如一个负责搭建页面、另一个负责检查页面,避免单个Agent闷头做完所有事而拖慢整体;
- 定时任务:让Agent在后台自动运行,无需人工时刻盯着;
- 语音指令:可以直接对Agent说话下达任务,不必逐字打字。
当Google把 Gemini 3.7 Flash 这样更强的大脑,装进这套专为「让Agent真正干活」而设计的系统时,你得到的就不再是一个更聪明的聊天机器人,而是一支可以被你指挥的小团队。
文中提到的 SDK(Software Development Kit,软件开发工具包)是指 Google 提供的一套编程接口和库,允许开发者在 Antigravity 的基础上构建自定义 Agent,而不必从零设计底层调度逻辑。Sub-Agents(子智能体)的概念同样值得展开:这是一种「主从协作」架构,主 Agent 负责整体规划和任务拆分,将子任务分发给多个专职 Agent 并行处理,最后汇总结果。这与软件工程中的「微服务」思路颇为相似——每个 Agent 只负责自己最擅长的那一块,系统整体的可靠性和速度因此得以提升。对于非开发者用户而言,这意味着复杂任务(比如同时搭建页面、检查兼容性、生成文档)不再需要排队串行,而是可以由多个 Agent 分头同步推进。
理性看待:AI Agent的能力边界在哪
尽管能力惊人,Peep也坦诚给出了理性的边界:现在还没到「把整个项目丢给AI就能走人」的阶段。
你依然需要:检查结果、制定计划、清楚这件事是为谁而做。AI能让整个流程快很多,但它不能替你思考——它是一个很强的工具,而非你的替身。

上手建议
对于想尝试的用户,给出几点实用心态:
- 从小任务开始:别一上来就拿最大的项目试手,先让它做一个单页面或一个具体修复,结果一眼就能判断成没成;
- 观察它的思路:不要只看结果,要看它是怎么一步步推进的,你会逐渐了解它擅长什么、哪里需要更明确的提示;
- 把它当新队友磨合:别指望它第一次就把所有事做对,给它一个有明确「结束标准」的任务。
真正能用好这些工具的人,不是那些配置最花哨的人,而是学会了如何把任务清楚地交出去、并快速检查结果的人。这种「布置—检查」的反馈循环,才是AI Agent时代最核心的工作方式。
结语
Gemini 3.7 Flash 与 Antigravity 的组合,标志着AI从「代码补全助手」向「自主任务执行者」的关键一步。三周一迭代的节奏、翻倍的基准分数、以及Sub-Agents与定时任务等系统级能力,共同指向一个方向:AI正在从被动应答,走向主动交付。但技术越强,越需要人类保持清醒——决定「做什么」和「为谁做」,始终是无法外包的部分。
相关推荐

DNS系统沦为诈骗温床:新域名滥用率高达20%
Interisle最新报告揭示,全球新注册域名中近20%被用于诈骗活动,8500万新域名中850万被列入黑名单。深入分析DNS滥用成因、ICANN监管困境及普通用户防范措施。

Spotify开源Portal:让Claude Code省下90%的Token开销
Spotify开源工具Portal通过智能上下文管理,帮助开发者将Claude Code的Token消耗削减90%。本文深入解析Portal的工作原理、实际节省效果,以及对AI编程成本优化的启示。

MFA长音频对齐失败怎么办?三步优化策略实战指南
详解Montreal Forced Aligner处理长音频时对齐偏差的常见原因(串音、长静默、填充词),并提供音频预处理、分段拼接、参数精调三大优化策略,帮助语言学研究者大幅提升强制对齐准确率。