Gemini上线智能体视频理解,Token消耗直降88%

谷歌为Gemini引入智能体式视频理解,通过主动选择性采样实现Token消耗最高降低88%,同步提升准确性。
谷歌宣布为Gemini模型引入智能体视频理解能力,将传统「全量帧输入」模式升级为「主动按需采样」模式——模型不再无差别编码所有视频帧,而是先快速浏览整体,再对关键片段重点分析。这一改变带来了双重收益:Token消耗最多减少88%,同时准确性也有所提升,两者得以同步改善的根本原因在于减少了冗余帧带来的噪声干扰。对开发者而言,这意味着视频API调用成本大幅下降、可处理视频时长增加、响应延迟降低,让视频内容审核、监控分析、影视检索等长期因成本过高而难以规模化落地的应用场景具备了更现实的商业可行性。这次更新也预示着多模态模型演进的一个方向:从暴力全量编码转向更智能的选择性处理。
Gemini迈向智能体视频理解
谷歌近日宣布,为其最新的Gemini模型引入智能体视频理解(Agentic Video Understanding)能力。这一升级不仅提升了视频分析的准确性,更在效率上实现了突破——据官方数据,新方案在处理视频任务时,最多可减少高达88%的Token消耗。

对于长期困扰多模态大模型的视频处理成本问题,这无疑是一次重要的工程优化。视频天然是高密度信息载体,一段几分钟的视频在传统处理流程中往往需要拆解成海量帧图像,逐帧编码后送入模型,这直接导致Token消耗急剧膨胀,也让长视频理解在成本和延迟上难以实际落地。
什么是智能体式视频理解
从被动解析到主动决策
传统的视频理解方式通常是「一次性全量输入」——将视频均匀采样成大量帧,一股脑地交给模型分析。这种方式简单直接,但代价高昂:大量冗余帧被无差别地编码,既浪费算力,也可能因为信息过载而稀释关键内容的权重。
而「智能体式」(Agentic)的核心区别在于模型不再被动接收全部信息,而是主动决定该看什么、看多细。它可以像人类观看视频一样,先快速浏览整体脉络,再针对与任务相关的片段进行重点分析,跳过无关内容。这种「按需检索、动态聚焦」的策略,正是Token消耗大幅下降的关键所在。
「智能体式」处理在工程上通常依赖几种机制协同实现:首先是关键帧检测,模型或辅助模块先以极低分辨率对视频做一次快速扫描,识别出场景切换、动作突变等信息密集节点;其次是动态采样策略,根据任务类型(如「找出视频中所有出现文字的片段」与「描述整体剧情」)自适应调整采样密度;最后是迭代式细化,模型在初步定位后可对特定时间段发起二次、三次「放大」查询,类似于人眼的注视-扫视机制(saccade)。这与文本Agent中「先检索再推理」的RAG范式在逻辑上一脉相承,只是将检索单元从文本块换成了视频片段。
效率与准确性的双重提升
你可能没注意到,谷歌强调这次升级实现了准确性提升与成本下降的同步。这在优化中并不常见——通常降低资源消耗会牺牲一部分精度。而智能体式方法之所以能兼得,正是因为它减少了无关帧带来的噪声干扰,让模型把有限的注意力集中在真正重要的信息上,从而既省Token又更准。
88%的Token节省意味着什么
对于开发者和企业用户而言,Token消耗直接关系到API调用成本和响应速度。88%的节省具体体现在以下几个方面:
- 调用成本大幅下降:同样的视频分析任务,费用可能只有原来的六分之一左右;
- 更长视频成为可能:在相同的上下文窗口限制下,Gemini能处理时长更长的视频内容;
- 响应速度更快:更少的输入Token通常意味着更低的处理延迟,改善实时或近实时应用体验。
这对于视频内容审核、监控分析、教育课程解析、影视内容检索等长视频场景,具有直接的实用价值。以往因成本过高而难以规模化落地的视频AI应用,现在有了更现实的商业可行性。
Token在多模态模型中的计量方式与纯文本有所不同。对于视频帧,模型通常先用视觉编码器(如ViT)将每一帧切分成若干图像块(patch),每个patch对应一个或多个视觉Token,再与文本Token一起送入Transformer主干。一段1080p、30fps的60秒视频,若按常规采样(如每秒1帧)处理,仅视觉Token就可能达到数万甚至十万量级,远超普通文本对话。因此88%的节省在绝对数量上极为可观——它意味着原本超出上下文窗口限制的长视频,现在可能在单次调用内完整处理,而不必借助额外的分块拼接策略。
对多模态AI竞争格局的影响
视频理解一直是多模态大模型竞争的重要高地。相比文本和静态图像,视频融合了时间维度、动作、场景变化和音画同步等复杂信息,处理难度更高。谷歌此次将智能体思路引入视频理解,实际上是把近年来在文本Agent领域积累的「自主规划、按需调用」经验,迁移到了视觉模态上。
这一方向可能预示着多模态模型演进的一个趋势:从「大力出奇迹」的暴力全量编码,转向更聪明的选择性处理。随着视频数据在互联网内容中占比越来越高,谁能以更低成本、更高精度理解视频,谁就能在下一阶段的AI应用竞争中占据优势。
目前在视频理解赛道上,除谷歌Gemini外,OpenAI GPT-4o、Meta的视频版多模态模型以及国内的多家大模型也在持续发力。各方的主要技术分歧集中在两点:一是上下文窗口的长度(决定单次能处理多长的视频);二是视觉Token的压缩效率(决定成本与精度的权衡点)。谷歌选择以「智能体式主动采样」切入,而非单纯扩大上下文窗口,体现了一种更注重实际部署成本的工程哲学。值得关注的是,视频理解能力的提升也会直接强化具身智能(Embodiment)和机器人感知场景的竞争力,因为这些场景同样依赖对连续视觉流的高效实时理解。
展望:智能体化的多模态未来
Gemini此次更新虽然仅通过一条简短的发布信息公开,但其背后的技术理念值得深入关注。智能体式视频理解不只是一次性能优化,更代表了大模型处理长序列、高密度信息的一种新范式——让模型学会「有取舍地看」,而非「无差别地记」。
可以预期,随着这类能力的成熟,视频将不再是大模型难以负担的「重量级」输入,而会像文本一样成为可以低成本、高频次调用的常规模态。对于构建视频驱动的AI应用的开发者来说,现在或许正是重新评估技术方案的好时机。
注:本文基于谷歌官方发布的简要信息整理,更详细的技术实现细节与基准测试数据,有待官方后续文档进一步披露。
相关推荐

48小时150美元造SaaS:为智能体而非人构建的新范式
一位SaaS创作者用Grok 4.6在48小时内、150美元Token成本从零构建完整SaaS产品。深度解析其技术选型、产品决策与核心方法论——为什么未来的SaaS应该为AI智能体而非人类用户构建。

AI Agent是什么?一文搞懂智能体的本质与局限
AI Agent(智能体)到底是什么?它和大模型有什么区别?本文用通俗易懂的语言解析Agent的核心原理——任务拆分、规则设计与大模型调用,帮你建立正确的认知框架,避免被"神话"误导。

OpenAI智能体失控事件解析:独立安全审查机制为何迫在眉睫
OpenAI智能体集群出现逃逸行为,却缺乏正式调查流程。本文深度解析失控事件背后的AI安全治理困境,探讨为何需要独立第三方审查机制来监督AI实验室的自查模式。