Gemini Flash激进降价:AI智能体成本战全面打响

谷歌再发新Flash:不到一个月的迭代节奏
谷歌本周再度更新了Gemini产品线,推出全新的Gemini 3.7 Flash。说个细节,就在三周前的7月21日,谷歌才刚刚发布了3.6 Flash,如今8月13日晚间又迅速推出了下一代。这种近乎"两周一迭代"的节奏,反映出当前大模型市场竞争的白热化程度。
从基准测试来看,Gemini 3.7 Flash的定位相当明确——用极低成本换取近乎前沿的性能。在AI综合基准测试中,Flash得分为56分,与Claude 3.5 Sonnet的55分、GPT-4.5的57分几乎持平。在Frontier Code 1.1代码测试中,它以43.6%的成绩超越了Sonnet的42.7%和GPT-4.5的41.3%;在Web开发测试中,其1588的评分同样领先竞品。这些基准测试覆盖了从综合智能指数到代码生成、从逻辑推理到实际应用的多个维度,是当前行业评估模型能力的标准化框架。其中Artificial Analysis的综合指数聚合了多项独立评估结果,Frontier Code则专注于衡量模型在真实编程任务中的表现,包括代码补全、Bug修复和架构设计等场景。

不过这并非全面碾压。在Deep推理测试中,GPT系列仍以69.6%的成绩领先于Flash的65.3%;在Terminal Bench 3.0终端任务中,竞品以20.8%的优势领先,Gemini仅为14.9%。Terminal Bench模拟的是真实Linux终端环境下的系统运维任务,包括服务器配置、故障排查和自动化脚本编写等,这类任务对模型的工具使用能力和长链路规划能力要求极高。在知识工作评估中,Gemini 3.7 Flash也明显落后。但谷歌的意图从来不是全项夺冠——它追求的是"性价比"这个维度上的绝对优势。
Gemini 3.7 Flash激进定价:四个半月的市场份额争夺战
真正让业界瞩目的是Gemini 3.7 Flash的定价策略。今年年底前,其输入价格为每百万Token 0.75美元,输出价格为每百万Token 3.75美元。谷歌明确表示,这仅相当于3.6 Flash原价的一半。
这里有必要理解Token的概念及其经济意义。Token是大语言模型处理文本的基本计量单位,大致相当于一个英文单词的3/4或一个中文字符。模型的使用成本按输入Token(用户提供的提示词和上下文)和输出Token(模型生成的回复)分别计价,输出通常比输入贵3-5倍,因为生成过程需要逐Token进行自回归推理,计算量远高于编码输入。在大规模部署场景下,每百万Token哪怕便宜0.1美元,累积到数十亿次调用后都意味着千万美元级别的成本差异。
但仔细阅读模型手册会发现玄机:这个优惠期截止到2026年初,届时输入费用将涨回1.5美元、输出涨至7.5美元。换言之,谷歌是在用价格补贴换取这四个半月的关键市场窗口期。
为什么谷歌愿意为几个月的时间窗口如此下注?答案在于智能体经济学。传统聊天机器人对话可能只调用模型一两次就结束,但真正能干活的AI智能体需要进行任务规划、执行搜索、阅读十几份文档、调用多种工具,遇到失败还会自动重试,再把所有结果写回上下文。此时Token消耗和工具调用次数会呈非线性增长,成本急剧攀升。
更具体地说,一个成熟的AI智能体与传统聊天机器人的本质区别在于自主性和工具使用能力。它需要具备任务分解(将复杂目标拆分为可执行步骤)、工具调用(搜索引擎、API、数据库等)、记忆管理(维护长期和短期上下文)、错误恢复(识别失败并自动调整策略)等能力。每项能力都意味着额外的模型推理调用。据行业估算,一个完成"市场研究报告"任务的智能体可能需要50-200次模型调用,消耗数十万Token。这就是为什么"每百万Token降价0.5美元"在智能体经济中意味着数十亿美元级别的市场重构。谁能以最低的单步成本运行数十甚至数百步任务,谁就掌握了结构性优势。
Spark智能体:Gemini 3.7 Flash的核心落地场景

谷歌几乎在发布当天就将3.7 Flash投入应用。它成为Gemini Spark的底层驱动——这是谷歌今年I/O大会发布、面向订阅用户的个人智能体,目前已覆盖全球160多个国家和地区。
谷歌将Spark定位为一款"全天候运行、在你掌控下执行操作"的智能体。它负责处理Google Workspace的工具调用,例如整合多份文件并起草邮件、更新项目状态和股票信息等。开发者则可通过Gemini API、Google AI Studio、Android Studio等途径接入,企业用户可通过Gemini企业级智能体平台使用。Spark的典型工作流程展示了智能体的Token密集型特征:当用户要求"整理上周所有会议纪要并生成周报"时,Spark需要调用日历API获取会议列表、逐一读取文档内容、提取关键信息、综合分析后生成报告,整个过程可能涉及十几次独立的模型推理调用,每次都需要携带不断增长的上下文。这正是Flash低价策略的核心价值所在。
Gemini Pro缺席与内部动荡
这里存在一个明显的逻辑断层:Flash版本从3.6直接跳到了3.7,而Gemini 3.5 Pro却始终未见踪影。7月21日3.6 Flash上线时,谷歌曾称3.5 Pro正在合作伙伴测试阶段,很快会公测,并提到Gemini 4正在进行"公司史上最雄心勃勃的预训练"。然而如今3.7 Flash都已发布,Pro的发布日期仍未确定。路透社在8月13日的报道中特意指出,此次发布完全未透露旗舰模型的任何上线信息。
这种沉默,结合公司内部的人事变动或许更容易理解。据报道,DeepMind高层出现调整,加之内部测试显示旗舰产品的代码表现不及预期,算力稀缺,以及关键时期对编程研发投入不足,多位核心研究人员离职创业。旗舰模型的延迟,很可能正是这些因素叠加的结果。在大模型行业,Pro/旗舰版通常代表公司最强的技术实力,其训练需要数万块顶级GPU运行数月,耗资数亿美元,任何技术路线的偏差都可能导致数月的延期。谷歌面临的困境并非个例——几乎所有头部实验室都在经历人才流失和算力争夺的双重压力。
OpenAI UltraFast:在"延迟"维度实现14倍速度突破

当谷歌在智能体成本上做文章时,OpenAI选择了一个完全不同的维度——速度。8月13日,OpenAI发布了名为UltraFast的新API层级,让旗舰模型以高达常规14倍的速度运行,大约每秒输出520个Token。
需要明确的是,UltraFast并非新模型,而是现有模型的一种全新推理模式。其核心逻辑在于终结了以往"实时响应"与"高智能"必须二选一的局限。过去想要真正的实时响应只能被迫选择小模型并牺牲智能水平,而UltraFast旨在兼顾前沿推理能力与近乎即时的输出。要理解每秒520个Token意味着什么,可以做个对比:普通人的阅读速度大约是每分钟250个英文单词(约330个Token),而UltraFast的输出速度是人类阅读速度的近100倍。这意味着一份5000字的研究报告可以在不到10秒内完成生成,真正实现了"思考即输出"的体验。
这显然也是为AI智能体设计的。OpenAI瞄准了事件响应、代码调试、金融研究、欺诈检测、实时客服以及语音交互和电商领域。早期测试用户形容这种差异是"质变而非量变",彻底颠覆了处理复杂工作时的交互体验。在智能体场景下,速度的意义被进一步放大:一个需要执行100步的智能体任务,如果每步推理从2秒缩短到0.15秒,总执行时间就从3分多钟压缩到15秒以内,这不仅是用户体验的飞跃,更使得许多对时效性要求极高的应用场景(如实时交易决策、安全事件响应)首次变得可行。
晶圆级芯片:UltraFast背后的硬件博弈
背后的工程实现值得关注:UltraFast运行在晶圆级芯片厂商的硬件上,将整块硅晶圆用于承载完整模型,而非分散在英伟达GPU机架阵列中。这省去了GPU之间繁琐的数据往来,消除内部流量后就能大幅缩短提示词与回复之间的延迟。
具体来说,传统芯片制造是将一块12英寸(约300毫米)硅晶圆切割成数百个独立芯片,每个芯片各自封装后安装到服务器中。运行GPT级别的大模型通常需要数千块这样的GPU协同工作,数据在芯片之间通过NVLink或InfiniBand网络传输,每次跨芯片通信都会产生微秒级延迟。而晶圆级计算的代表企业Cerebras反其道而行,将整块晶圆作为单一芯片使用,其最新的WSE-3芯片面积达46,225平方毫米(相当于英伟达H100的56倍),集成了90万个AI核心和44GB片上SRAM。所有计算单元通过片上互连直接通信,带宽比跨芯片网络高出数个数量级,这正是14倍速度提升的物理基础。
这也契合更广泛的市场趋势:随着原始性能趋于饱和,竞争正转向"谁能更快、更省地运行模型"。这既是Grok崛起的动力,也标志着OpenAI正悄然摆脱对英伟达的全面依赖,探索自研芯片策略。过去两年,英伟达凭借CUDA生态和GPU算力垄断了AI训练和推理市场,但其产品溢价极高(单块H100售价超3万美元),且供应持续紧张。头部AI公司纷纷寻求替代方案:谷歌有自研的TPU、亚马逊有Trainium、Meta在开发MTIA,OpenAI则同时布局自研芯片和与Cerebras等第三方厂商的合作。芯片多元化正成为AI公司降低风险和成本的核心战略。
DeepSeek V4 Pro逆势涨价:商业化转型背后的逻辑

就在OpenAI为算力发愁、谷歌激进降价时,DeepSeek却选择了完全相反的策略——涨价。周四,DeepSeek正式发布V4 Pro版本,输入Token每百万收费1.32美元,输出每百万3.96美元。相比V4 Flash的0.14美元和0.28美元,这大约是输入价格的9倍、输出价格的14倍。
涨价原因有些微妙:先发布的V4 Flash在多项独立测试中竟意外击败了V4 Pro的4月预览版。根据Artificial Analysis的评分,V4 Pro推理版的智能指数得分为53分,V4 Flash为52分——两者极为接近。这也暗示DeepSeek在预览版之后取得了长足进步。
更深层的是商业博弈。DeepSeek由量化私募基金幻方量化于2023年创立,长期依靠母公司自有资金运营,是中国AI领域罕见的纯技术驱动型企业。其技术路线以混合专家架构(MoE,即模型内部包含多个"专家"子网络,每次推理只激活其中一小部分,从而在保持高性能的同时大幅降低计算成本)和强化学习驱动的推理为核心。R1推理模型在2025年初发布后,以开源方式展示了与OpenAI o1系列相当的推理能力,且训练成本据称仅为后者的十分之一,一度引发全球科技股震荡,英伟达单日市值蒸发近6000亿美元。
R1爆火后,DeepSeek一跃成为中国最受瞩目的AI企业,但其领先优势随后受到月之暗面、智谱AI、MiniMax、阿里巴巴和字节跳动的挤压。据路透社7月报道,DeepSeek正筹划一轮估值约740亿美元的融资,距离6月完成首轮外部融资仅数周。对这家多年拒绝外部资本的公司而言,这是巨大的战略转变——从"技术实验室"向"商业化企业"的关键蜕变。他们计划将各部门人员规模至少翻倍,涵盖数据中心和AI智能体团队,并大规模招聘芯片设计工程师,研发自研AI芯片以降低对英伟达和华为的依赖。在美国对华芯片出口管制持续收紧的背景下(目前中国企业无法购买H100及以上级别GPU),自研芯片不仅是成本考量,更是供应链安全的战略必需。
三种路径,同一场智能体经济竞赛
综观本周三家动向,可以看到大模型竞争已从"谁更聪明"转向多维度的差异化博弈:谷歌用激进降价抢占智能体成本高地,OpenAI在延迟维度以晶圆级芯片实现速度突破,DeepSeek则通过涨价与融资寻求商业可持续性。
三者的共同点在于——都在为"智能体经济"做准备。当AI真正开始承担多步骤、长链路的实际工作时,成本、速度和可靠性将成为决定胜负的关键,而单纯的性能榜单排名反而退居其次。这场竞赛的下半场,比的不再是模型的第一反应有多惊艳,而是能否真正把活干完。
从更宏观的视角来看,2025年正在成为AI行业从"演示经济"向"生产经济"转型的分水岭。过去两年,各厂商的核心叙事是"我的模型在基准测试中排名第几",而现在的竞争焦点已转移到"我的模型能否以可接受的成本和速度完成真实世界的复杂任务"。这一转变将深刻重塑整个AI产业的价值链——从芯片设计到云服务定价,从开发者工具到终端用户体验,每个环节都在围绕智能体的需求进行重构。
核心要点
相关推荐

OneCLI:开源沙箱化AI Agent框架,解决团队协作安全难题
OneCLI是YC S26批次的开源沙箱化AI Agent框架,专为团队设计。本文深入解析其沙箱隔离机制、团队治理能力及企业级AI Agent安全落地的核心价值。

LLM时代的可扩展软件:架构范式的重构
探讨大语言模型如何重新定义软件可扩展性:从自然语言接口到智能体驱动的动态编排,解析面向LLM设计软件的关键原则、工具接口设计、MCP协议及未来架构挑战。

AI Agent入门第一课:如何调用大模型
AI Agent开发入门教程,从零讲解如何通过云平台调用大模型API。涵盖API-Key获取、请求参数配置、Messages消息组织到响应解析的完整流程,帮助初学者快速掌握Agent开发的核心基础。