Gemini 3.7 Flash:谷歌用降价打响Agent卡位战

三周一迭代:谷歌罕见的更新节奏
谷歌这次的动作透着一股急切。Gemini 3.7 Flash距离上一代3.6 Flash发布仅隔三周,创下谷歌AI产品线上最快的更新纪录。这种节奏本身就是信号——它不像一次从容的技术升级,更像是一场被市场逼出来的快速补位。
从官方口径看,3.7 Flash在编程、知识工作和网页开发上有明显提升,尤其擅长长时间的软件工程任务、PDF理解和智能体(Agent)任务。发布演示里,它直接用3D素材搭建了一个3D网页游戏,从引擎逻辑、美术素材到程序化生成的音频一次性完成,展示的是端到端的执行能力,而非单点问答。
有意思的是,据B站UP主的分析,3.7 Flash并不是一个全新的预训练模型,而是在3.6 Flash的底座上做了一轮较强的算法优化和后训练。所谓后训练(Post-training),是指在模型完成大规模预训练之后,通过RLHF(基于人类反馈的强化学习)、DPO(直接偏好优化)、指令微调等技术进一步优化模型行为的过程。相比重新做一次预训练(需要数千万美元算力和数月时间),后训练的成本低得多,但能显著改善模型在特定任务上的表现。3.7 Flash选择在3.6 Flash底座上做后训练而非重新预训练,说明谷歌判断底层知识储备已经足够,瓶颈在于任务执行的对齐和工具调用的稳定性。上下文窗口仍是100万Token量级,最高输出64K。

定位转向:从聊天模型到能干活的Agent主力
这次升级最有意思的地方在于它的定位取舍。普通知识推理能力并没有暴涨,真正明显提升的是Agent相关能力。
这里有必要解释一下Agent在AI语境中的含义。Agent(智能体)指的是能够自主感知环境、制定计划、调用工具并执行多步骤任务的AI系统。与传统的单轮问答不同,Agent可以分解复杂目标为子任务,自主决定调用哪些API或工具,处理中间结果的异常,并持续运行直到任务完成。典型的Agent应用包括自动化代码调试、文档处理流水线、数据分析管道等。当前行业中,OpenAI的Codex、Anthropic的Claude Code以及各类开源框架(如LangChain、AutoGPT)都在争夺这一赛道。
按报道给出的数据:在终端环境中跑长任务的基准提升了176%,自动化任务提升了79%,软件工程和网页开发指标也有30%到40%的增长。Artificial Analysis给出的智能指数为56,比3.6 Flash高4分;输出速度约每秒340 Token,并提供低、中、高三档努力程度(effort level),最低档的单任务成本可以压到0.16美元。
把这些数字串起来,谷歌的意图就很清晰了:它不想把3.7 Flash做成一个更聪明的聊天模型,而是要把它推成一个便宜、能干活、能调用工具、能长时间运行的Agent主力模型。这是一条与"堆知识、拼推理"截然不同的产品路线。

能力对标与真实性价比
能力上,3.7 Flash对标的是Claude Sonnet系列和GPT新一代模型。被这么一比,竞品确实显得有些尴尬。
但性价比是否真的领先,需要打个问号。从软件工程类指标(如SWE-bench一类)看,真正的性价比可能仍在DeepSeek V4 Flash那一侧。SWE-bench是由普林斯顿大学团队发布的软件工程能力评估基准,它从真实的GitHub开源项目中抽取已解决的Issue和对应的Pull Request,要求AI模型在给定代码仓库和问题描述后,自主生成正确的代码补丁。这个基准之所以被行业重视,是因为它考验的不是简单的代码补全,而是理解复杂代码库、定位Bug根因、跨文件修改的综合能力——这恰恰是Agent场景最核心的能力需求。谷歌这次更像是用降价和Agent叙事抢回存在感,而不是在能力上形成碾压。
Gemini 3.7 Flash定价解读:第一次真刀真枪的价格战
价格才是这次发布的重头戏,也是谷歌第一次真正意义上加入AI模型价格战。
3.7 Flash的定价为输入每百万Token 0.75美元、输出每百万Token 3.75美元,相当于3.6 Flash原价的一半。谷歌还顺手把3.6 Flash也降到了同一档位。需要提醒的是,这是优惠价,有效期到年底,之后价格会翻倍。
要理解这个定价的含义,需要了解大模型的计价逻辑。Token是大语言模型处理文本的基本计量单位,大约每750个英文单词对应1000个Token,中文则大约每500字对应1000个Token。模型厂商按输入和输出Token分别计价,输出价格通常高于输入价格,因为生成文本需要更多计算资源。此外,缓存定价(cached pricing)是对重复输入内容给予折扣,这在Agent反复调用场景中能大幅降低实际成本——而这正是比较各厂商定价时容易被忽略的隐藏变量。
把它放进DeepSeek的产品线里对比会更直观:输入价夹在V4 Flash和V4 Pro之间,输出价则接近V4 Pro,比V4 Flash贵了将近三倍。所以单看基准数字,它似乎贴着DeepSeek在打,但如果不把缓存价格算进去,这个"高性价比"的印象是有水分的。

为什么急着发:Gemini Pro线的困境
三周就迭代一次,背后的原因其实不复杂——谷歌的Pro线出了问题。
据分析,3.5 Pro那条线基本停滞,前代Pro从年初到现在仍停留在Preview阶段,3.5 Pro也在反复跳票。传闻内部因为递归调用和幻觉问题在重建这条线。在Pro迟迟无法交付的情况下,谷歌只能把Pro的能力蒸馏到Flash上,用3.7 Flash来卡位。
知识蒸馏(Knowledge Distillation)是一种将大模型(Teacher)的能力迁移到小模型(Student)的技术。核心思路是让小模型模仿大模型的输出分布,而不是直接从原始数据学习。这样小模型可以在更少的参数量和更低的推理成本下,接近大模型的表现。在谷歌的语境中,将Pro线的能力蒸馏到Flash线,意味着用更轻量、更便宜的模型架构来承载原本需要重量级模型才能实现的能力,这是在成本和性能之间寻找工程化平衡点的常见做法。
从结果看,3.7 Flash的整体价格已经接近过去的Gemini 3 Flash和3.5 Flash Lite档位,而能力则瞄准Claude Sonnet和GPT新一代去打。这是一种用低端产品线承接高端能力预期的过渡策略。

结语:一张被硬塞回牌桌的牌
综合来看,Gemini 3.7 Flash不是一次能力上的飞跃,而是一次策略上的调整。它靠降价和Agent叙事重新刷了存在感,把"便宜的Agent主力模型"这张牌硬塞回了竞争的牌桌。
它未必能让所有人回心转意——真正追求软件工程性价比的用户,可能依然会倾向DeepSeek一侧。但对谷歌而言,能在Pro线受困的窗口期用Flash稳住阵脚,本身就是一次务实的止损。这场AI价格战,才刚刚开始。
核心要点
相关推荐

李飞飞谈AI:视觉智能、创造力边界与人类主体性
斯坦福教授李飞飞在Huberman Lab播客深度解析AI与视觉科学的关系,探讨ImageNet如何引爆现代AI,阐述AI的能力边界、医疗应用前景,以及为何人类主体性是AI发展的核心命题。

DeepSeek Harness实测:插件化Agent框架的核心优势解析
深入实测DeepSeek Harness开源Agent框架,解析其插件化架构设计、编码能力、安装部署方式及与Claude Code的对比,帮助开发者了解这款可扩展Agent开发底座的真正价值。

10美元搭建50万域名搜索引擎:独立开发者的周末项目启示
一位独立开发者仅用一个周末和10美元成本,搭建了覆盖50万域名的垂直搜索引擎。本文深入分析低成本搜索引擎背后的技术栈、垂直搜索的差异化机会,以及独立开发者快速验证想法的方法论。