Gemini 3.7 Flash发布实测,GPT-5.6超快模式提速14倍

谷歌三周内再迭代Flash模型
距离Gemini 3.6 Flash发布仅仅三周,Google DeepMind便火速推出了Gemini 3.7 Flash,并将其定位为目前"最智能的主力模型"。这种密集的迭代节奏在业内并不常见,也引发了外界对谷歌内部产品线策略的诸多猜测。
据B站相关技术UP主的分析,一个流传较广的说法是:谷歌可能正在悄然砍掉Gemini 3.5 Pro,将原本计划用于Pro模型的算法改进"重新包装"到了Flash产品线上,同时集中资源全力研发下一代旗舰Gemini 4系列。这种解释在一定程度上说明了为何一款Flash模型能在短时间内实现如此明显的性能跃升——它可能承载了本该属于Pro级别的技术积累。
在谷歌的Gemini模型体系中,Flash系列定位为速度快、成本低的中端主力模型,适合大规模生产环境部署;Pro系列则追求更高的推理精度和复杂任务处理能力;而Opus则是不计成本追求极致智能的旗舰。这种分层策略类似于芯片行业的产品线划分——比如英伟达的消费级、专业级和数据中心级GPU。Flash模型通常通过模型蒸馏、量化压缩或架构精简等技术,在保持大部分能力的前提下大幅降低推理成本和延迟。模型蒸馏是指用一个大型"教师模型"的输出来训练一个更小的"学生模型",使后者以更少的参数近似前者的行为;量化压缩则是将模型权重从高精度浮点数(如FP32或FP16)转换为低精度格式(如INT8或INT4),在几乎不损失性能的前提下将模型体积和计算量压缩数倍。将Pro级别的算法改进下放到Flash产品线,本质上是在不增加推理成本的前提下提升模型上限,这对企业用户极具吸引力。

需要明确的是,Flash定位本身就是速度与成本优先的中端主力模型,而非对标Opus 5或顶级Pro的旗舰产品。因此在评价它时,参照系应当是同级别的Flash模型,而不是那些定价高出数倍的前沿模型。
Gemini 3.7 Flash基准测试:稳步提升但非颠覆
从公布的数据来看,Gemini 3.7 Flash相比前代确实有实实在在的进步,但升级幅度谈不上惊艳。
代码与软件工程能力对比
在生产环境代码质量测试中,3.7 Flash得分为43.6%,明显优于3.6 Flash的34.4%,也超过了同级竞品Sonnet 5的42.7%。在长程软件工程任务上,该模型得分65.3%,较老款3.6 Flash的48.6%有大幅提升,但仍略逊于GPT-5.6 Turbo的69.6%。
这里需要补充的是,文中提到的"生产环境代码质量测试"和"长程软件工程任务"属于当前AI模型评估体系中的关键维度。前者通常衡量模型生成可直接部署代码的能力,包括代码正确性、可维护性和安全性;后者则测试模型在跨文件、跨模块的复杂软件工程场景中的表现,涉及理解大型代码库、进行重构和调试等能力。具体而言,长程软件工程基准(如SWE-bench)会给模型一个真实的GitHub Issue和对应的代码仓库,要求模型自主定位问题所在的文件和代码行,然后生成正确的补丁——这个过程可能涉及阅读数万行代码、理解模块间的依赖关系,并在不破坏其他功能的前提下修复bug。相比简单的编程竞赛题(如LeetCode风格的算法题),这些测试更接近真实开发场景,因此被业界视为衡量AI编程实用价值的核心指标。3.7 Flash在长程软件工程任务上从48.6%跃升至65.3%,意味着它在处理真实项目级别的代码任务时有了质的改善。
说个细节,Meta的模型(MusePack 1.2,得分54.9%)也开始越来越多地出现在各类基准榜单中,标志着开源与大厂模型的竞争格局正在进一步复杂化。Meta作为开源大模型的重要推动者,其Llama系列模型已经催生了庞大的开源生态,而MusePack等后续模型的竞争力提升,意味着企业在选择AI基础设施时有了更多不受单一供应商锁定的选择。
网页开发领域的领先表现
如果说3.7 Flash有什么最突出的亮点,那就是网页开发能力。该模型在此领域评分从旧款的约1538分小幅提升至1588分,虽然涨幅不大,却足以在所有终端模型中稳居第一。考虑到谷歌在企业级市场的深厚根基,这一优势很可能转化为企业应用场景的广泛落地。网页开发能力的评估通常涵盖HTML/CSS/JavaScript代码生成的准确性、响应式设计的实现质量、无障碍访问标准的遵循程度,以及与现代前端框架(如React、Vue、Angular)的兼容性。对于大量依赖Web技术栈的企业而言,一个在网页开发方面表现优异的模型可以直接融入其产品开发流水线,加速从设计稿到可部署代码的转化过程。
此外,在长视频理解(85.4%)和长上下文处理(97%)等场景中,3.7 Flash的表现同样领先于同级竞品,展现出谷歌在多模态和长序列处理上的传统优势。长上下文处理能力对企业应用尤为关键——在分析长篇法律文档、处理完整代码仓库或理解数小时的会议录音时,模型能否在超长输入中保持信息的准确召回和推理一致性,直接决定了其实用价值。从技术角度看,长上下文处理面临的核心挑战是注意力机制的计算复杂度(标准Transformer的注意力计算量与序列长度呈二次方关系)和"迷失在中间"现象(Lost in the Middle)——即模型倾向于更好地利用输入开头和结尾的信息,而忽略中间部分的内容。谷歌在这方面的领先可能得益于其在稀疏注意力、环形注意力(Ring Attention)等长序列处理技术上的持续投入。97%的长上下文处理得分意味着3.7 Flash几乎能完美地在百万级Token的输入中定位和利用关键信息,这对需要处理海量文档的法律、金融和研究机构来说具有极高的实用价值。
Gemini 3.7 Flash定价策略:短期诱人,长期存疑
谷歌为Gemini 3.7 Flash推出了一套限时优惠定价,颇具进攻性。

在2026年底前,该模型每百万输入Token仅需0.75美元,每百万输出Token为3.75美元,价格相当有竞争力。但这只是促销期定价——从2027年1月起,价格将翻倍至输入1.5美元、输出7.5美元。
要理解这个定价的意义,需要了解Token定价模型的基本逻辑:Token是大语言模型处理文本的基本单位,大约相当于英文中的0.75个单词或中文中的0.5-1个字。大多数现代LLM使用BPE(字节对编码)或类似的分词算法将文本切分为Token,常见的词汇表大小在32,000到256,000个Token之间。API定价以"每百万Token"为单位,分为输入(prompt)和输出(completion)两个价格。输出价格通常高于输入价格,因为生成文本比理解文本消耗更多算力——模型需要逐个Token进行自回归推理,每生成一个Token都需要完整的前向计算,包括将之前所有已生成Token的KV缓存(Key-Value Cache)加载到计算单元中进行注意力计算。相比之下,输入阶段的所有Token可以并行处理,计算效率高得多。对于企业用户而言,模型选择不仅看智能水平,还要计算单次调用成本和月度总支出。一个典型的企业级应用(如客服系统或代码助手)每天可能消耗数十亿Token,即便是每百万Token几美分的差异,累积下来也可能意味着每月数万美元的成本差距。
换句话说,谷歌用半年的低价来抢占市场份额和开发者心智,但长期成本会显著回升。这种"先低价获客、后恢复定价"的策略在云计算行业并不罕见——AWS、Azure和GCP在各自发展早期都曾通过激进定价来培养用户习惯和生态锁定。一旦开发者围绕某个模型构建了应用、积累了prompt工程经验并建立了评估流水线,迁移到其他模型的隐性成本就会显著上升。相比其他前沿实验室,它的价格依然低廉;不过和DeepSeek的Flash版本相比,尤其在涨价之后,价格优势就不那么明显了。
DeepSeek是中国AI创业公司深度求索推出的系列模型,以极低的训练和推理成本著称。其技术路线强调混合专家架构(Mixture of Experts, MoE)和高效训练策略,能够在较低算力投入下达到接近前沿模型的性能。MoE架构的核心思想是将模型参数分成多个"专家"模块,每次推理时只激活其中少数几个,从而在保持总参数量(即模型容量)的同时大幅降低实际计算量。例如,一个总参数量为6710亿的MoE模型可能在每次推理时只激活其中370亿参数,这意味着其推理成本接近于一个370亿参数的密集模型,但知识容量和表达能力却远超后者。DeepSeek还采用了多头潜在注意力(Multi-head Latent Attention, MLA)等创新技术来进一步压缩KV缓存的内存占用,使得其推理效率在同等参数规模下领先于传统架构。DeepSeek的Flash版本在海外开发者社区中获得了广泛关注,因为它以远低于竞品的价格提供了具有竞争力的性能,迫使谷歌、OpenAI等公司不断下调定价或推出优惠方案以维持市场份额。
社区争议:真实成本是否被低估?
发布之后,社区中出现了不少质疑声音。

核心争议在于:图表上呈现的性价比可能掩盖了真实成本。在深度软件工程测试中,Gemini 3.7 Flash的表现不如GPT-5.6 Luna,而实际使用成本约为表面数字的三倍。这让一些用户感到不满,认为谷歌在对比中刻意剔除了Opus和Fable等更强模型,是在"回避竞争"。
这里的"实际使用成本约为表面数字的三倍"值得深究。在复杂的软件工程任务中,模型往往需要多轮交互、思维链推理(Chain of Thought)以及多次重试才能完成任务。思维链推理是一种提示技术,通过引导模型逐步展示推理过程来提升复杂任务的准确率——但代价是模型会生成大量的中间推理步骤。如果模型在思考过程中产生了大量的中间推理Token(即所谓的"思考Token"),这些Token同样计入计费,但往往不会在官方的简单定价对比中体现。以Gemini 3.7 Flash为例,如果一个编程任务的最终输出是200个Token的代码,但模型在"思考"过程中生成了2000个推理Token,那么实际的输出Token消耗就是表面的11倍。此外,如果模型一次生成的代码质量不够高,开发者可能需要多次调用才能获得满意结果,进一步推高了实际成本。一些开发者工具(如Cursor、Windsurf等AI编程助手)在后台可能会自动进行多次调用和结果筛选,用户看到的是一次交互,但实际消耗的Token量可能是单次调用的数倍。这种"名义价格"与"有效价格"之间的差距,是当前AI产品定价透明度问题的一个缩影。
对此,理性的看法是:3.7 Flash毕竟是Flash级别产品,本就不该与Opus、Sonnet或Fable等旗舰同台竞技。真正值得期待的对标产品是尚未发布的Gemini 4系列。在Gemini 4登场之前,用旗舰标准去苛责一款中端模型并不公平。
此外,评论者普遍认为,如果榜单中加入DeepSeek的Flash版本,很可能会直接"搅局"——因为它在某些领域既更便宜又更智能。这也从侧面反映出,当前中端模型市场的竞争已经异常激烈。值得注意的是,这种竞争格局正在推动整个行业向"性价比"而非单纯"性能"的方向演进——对于绝大多数商业应用而言,一个成本低50%但性能只低5%的模型,在ROI计算上往往是更优选择。
OpenAI反击:GPT-5.6超快模式提速14倍
就在谷歌发布新模型的同时,OpenAI也开放了GPT-5.6超快模式(Ultra-Fast Mode)的候补名单,成为本轮竞争的另一大看点。

借助通过Cerebras获取的高速芯片,GPT-5.6在超快模式下能够以每秒高达750个输出Token的速度运行,相比标准模式提速约14倍。这一突破的意义不在于智能水平的提升,而在于响应延迟的极致压缩。
Cerebras Systems是一家专注于AI加速芯片的公司,其核心产品是晶圆级引擎(Wafer-Scale Engine, WSE),将整个硅晶圆制作成单一巨型芯片,面积达到约46,225平方毫米,是传统GPU(如英伟达H100,约814平方毫米)的数十倍。传统芯片制造将一块晶圆切割成数百个小芯片(die),然后单独封装;而Cerebras直接将整块晶圆作为一个计算单元使用,这种架构设计消除了传统多芯片系统中的芯片间通信瓶颈。在大语言模型推理中,Token是逐个顺序生成的(自回归特性),每生成一个Token都需要访问模型的全部参数——这意味着推理速度主要受限于内存带宽(Memory Bandwidth)而非计算能力(Compute),这种现象被称为"内存墙"(Memory Wall)问题。传统GPU架构中,模型参数存储在HBM(高带宽内存)中,每次生成Token都需要将参数从HBM搬运到计算核心,这个数据搬运过程成为速度瓶颈。Cerebras的设计通过将大量高速SRAM(约44GB,带宽高达每秒数百TB)直接集成在计算单元旁边,大幅降低了数据搬运延迟,从而实现了极高的单Token生成速度。750 Token/秒意味着每秒可以输出约560个英文单词,几乎相当于一个人一分钟阅读量的内容在一秒内就能生成完毕。作为对比,当前主流云端模型的典型输出速度在50-150 Token/秒之间,这意味着超快模式实现了一个数量级的速度跨越。
GPT-5.6超快模式的目标场景
这种超高速能力主要瞄准对延迟极度敏感的生产环境,包括:
- 实时语音支持:让语音助手与客户支持实现近乎无延迟的交互。在语音对话场景中,人类对响应延迟的容忍阈值约为300-500毫秒,超过这个时间就会产生明显的"卡顿感",严重影响用户体验和对话的自然流畅度。语音交互的完整链路包括语音识别(ASR)、语言理解与生成(LLM)和语音合成(TTS)三个环节,LLM环节的延迟压缩能为整个链路腾出宝贵的时间预算。750 Token/秒的速度意味着即便是较长的回复,首Token延迟和整体生成时间都能控制在人类感知的自然对话节奏内,使AI语音助手的交互体验首次真正接近人与人之间的实时对话。
- 金融研究与研报:在与AI代理交互时提供即时响应。金融市场中毫秒级的信息优势可能转化为巨大的交易价值,快速生成分析报告和决策建议的能力在高频交易和实时风控场景中具有直接的商业价值。例如,当突发新闻事件发生时,能够在竞争对手之前完成事件影响分析并生成交易建议的AI系统,可能为其用户带来显著的alpha收益。
- 安全合规与事件响应:在关键时刻提供快速可靠的支持。网络安全事件的平均响应时间直接影响损失规模——根据IBM的研究,每减少一天的事件响应时间,平均可减少约100万美元的数据泄露损失。超快模式可以帮助安全团队在事件发生后的"黄金时间"内快速分析日志、识别攻击向量并生成修复方案。
- 商业代理应用:支撑高吞吐的自动化工作流。当AI代理需要在一个复杂工作流中进行数十次甚至上百次的模型调用时(如多步骤的数据处理、多轮决策树评估或并行任务编排),每次调用节省的时间会累积成显著的端到端效率提升。一个需要100次串行模型调用的代理工作流,在标准速度(~100 Token/秒)下可能需要等待数分钟,而在超快模式下可以在数十秒内完成。
不过,目前该模式仍处于候补名单阶段,OpenAI尚未公布定价,也未披露速度提升对综合成本的具体影响。软硬件协同(尤其是与Cerebras的合作)被认为对OpenAI的未来发展至关重要,但速度换成本的账,还需要更多信息才能算清。从商业模式角度看,Cerebras的晶圆级芯片产能有限(制造一块晶圆级芯片需要极高的良率控制技术,任何一个缺陷都可能影响整块芯片的功能)、制造成本高昂,这可能限制超快模式的大规模普及,使其在短期内更多服务于愿意支付溢价的企业客户。这也意味着OpenAI可能需要同时维护基于英伟达GPU的标准模式和基于Cerebras的超快模式两套推理基础设施,增加了运营复杂度。
总结:中端AI模型市场进入贴身肉搏阶段
综合来看,本轮更新反映出AI大厂在中端主力模型上的激烈竞争:
谷歌选择用高频迭代和限时低价来巩固企业市场,尤其是在网页开发和多模态长序列任务上建立差异化优势;而OpenAI则押注硬件加速,用14倍的速度提升去开拓实时交互这一新战场。
对开发者而言,Gemini 3.7 Flash是一次稳健但不惊艳的升级,真正的重头戏或许要留给Gemini 4;而GPT-5.6的超快模式则为实时应用打开了新的想象空间。两条截然不同的路线,恰恰说明了当前AI竞争已从单纯的"谁更聪明",转向"谁更快、更便宜、更适配场景"的多维博弈。这种竞争格局对整个行业的健康发展是有利的——它迫使各家厂商不再仅仅追求基准测试分数的纸面提升,而是真正思考如何为不同场景的用户创造实际价值。从更宏观的视角看,这种多维竞争也在推动AI基础设施的专业化分化:未来我们可能会看到,不同的芯片架构、不同的模型架构和不同的部署方式,被精确匹配到不同的应用场景中——就像今天我们不会用同一款发动机去驱动手表、汽车和火箭一样。
相关推荐

Meta开源30B模型Muse Glimmer:一张显卡跑本地Agent的实战解析
Meta超级智能实验室开源Muse Glimmer 30B多模态Agent模型,采用4-bit量化、混合注意力和D-Flash投机解码三大技术,可在RTX 4090等消费级显卡上运行,Agent基准测试大幅领先同级模型。

OpenAI开源Codex Security深度评测:AI安全扫描工具的优势与局限
深度解析OpenAI开源的Codex Security代码安全扫描工具,对比Snyk、Semgrep、CodeQL等竞品,分析其AI Agent验证机制、真实测试数据、开发者反馈及当前局限性。

Ruby 4.0通用RCE反序列化利用链深度解析与防范指南
深入分析Ruby 4.0曝出的通用远程代码执行(RCE)反序列化利用链,解析Gadget Chain构造原理、攻击面影响,并提供Marshal.load安全防范建议与纵深防御策略。