Gemini智能体视频理解:Token降88%成本减66%全解析

视频理解迎来「智能体」时代
Google DeepMind 近日发布了面向 Gemini 系列模型的**智能体视频理解(Agentic Video Understanding)**功能,覆盖 Gemini 3.7 Flash、3.6 Flash 与 3.5 Flash-Lite 三款模型。这项能力最引人注目之处在于:它在提升分析准确率的同时,能将 Token 消耗最多降低 88%、成本削减最多 66%,并让质量提升最多 7%。
在大语言模型和多模态模型的使用体系中,Token 是计费和计算资源消耗的基本单位。对于文本,一个 Token 大约对应 4 个英文字符或一个中文汉字;对于视频和图像,每一帧会被编码为数百甚至上千个 Token。以 1 FPS 采样一段 60 分钟的视频为例,3600 帧可能产生数百万 Token,按照主流 API 的定价(通常每百万 Token 数美元到数十美元不等),单次视频分析的成本可能高达数十美元。理解了这一成本结构,就不难明白 88% 的 Token 削减和 66% 的成本降低对开发者意味着什么。
对于长期受困于长视频处理高昂成本的开发者而言,这是一个具有实质意义的突破。传统视频分析要么烧钱,要么被迫丢弃关键细节,而智能体模式试图打破这一两难困境。

从「静态摄取」到「主动扫描」:核心机制解析
传统视频处理方式的局限
当前主流的视频处理采用静态方式:模型以固定帧率(默认 1 FPS,可通过 API 调整)逐帧摄取视频内容。这意味着无论视频内容是否重要,模型都要「平均用力」地消耗 Token。对于一段 10 分钟的教程、90 分钟的讲座乃至数小时的录像,静态处理会迅速堆积起惊人的 Token 开销。
帧率(FPS,Frames Per Second)决定了模型每秒从视频中提取多少帧画面进行分析。人眼感知流畅视频通常需要 24-30 FPS,而 AI 视频分析中常用的 1 FPS 意味着每秒只看一帧。这种降采样在慢节奏的讲座视频中可能足够,但在快速动作场景(如体育赛事、工业质检、安防监控中的突发事件)中,关键信息可能仅存在于 0.1-0.5 秒的时间窗口内,1 FPS 采样极易完全错过这些瞬间。
更麻烦的是,为了控制成本,开发者往往需要降低采样率,而这又会导致关键的瞬时细节被遗漏——高成本与低质量之间只能二选一。这就是静态帧率采样的根本矛盾:提高帧率则 Token 暴增,降低帧率则信息丢失。
智能体循环的工作原理
智能体视频理解借鉴了此前 agentic vision(智能体视觉) 的思路,将代码执行能力与 Gemini 原生的多模态理解结合。它让模型扮演一个「主动的、目标导向的观察者」角色,自主决定:
- 看什么:定位与查询相关的视频片段
- 以什么速度看:动态调整帧率,对关键瞬间放大采样
- 通过哪种模态看:在视觉帧、音频、文字转录之间灵活切换
这里的「模态选择性加载」值得展开理解。现代视频包含三种主要信息模态:视觉帧(画面内容)、音频(语音、音效、背景音乐)和文字转录(字幕、OCR 识别的屏幕文字)。传统处理方式通常将三种模态同时送入模型,导致 Token 消耗成倍增加。智能体视频理解的一个关键创新在于模态的选择性加载:例如,在分析讲座视频中的口述内容时,模型可能优先使用音频转录而非逐帧分析画面;在分析运动视频时,则主要依赖视觉帧。这种按需选择模态的策略,本质上是将人类观看视频时的注意力分配机制工程化。
智能体(Agent)范式是 2024-2025 年 AI 领域最重要的技术趋势之一。与传统的单次输入-输出模式不同,智能体 AI 具备自主规划、工具调用和多步推理的能力。它借鉴了强化学习中的感知-决策-行动循环(Perception-Decision-Action Loop),让模型不再被动接收全部输入,而是主动决定下一步需要获取什么信息。在视频理解场景中,这意味着模型可以先快速浏览视频的低分辨率概览,识别出潜在的关键片段,再对这些片段进行高帧率的精细分析——类似于人类在快进视频时发现感兴趣内容后暂停回放的行为模式。
模型通过一个智能体循环(agentic loop),调用内部工具按需加载视频文件的相关部分,只获取真正需要的信号。这本质上是把开发者过去需要手动实现的「选择性检索」逻辑,内化为模型的自主行为,大幅降低了开发复杂度。
基准测试结果:成本-质量帕累托前沿表现
根据官方数据,在标准视频分析基准上,启用智能体理解的 Gemini 模型可将分析成本降低最多 66%、Token 消耗降低最多 88%,同时准确率提升最多 7%。
在长视频场景下,这些效率提升尤为显著。以 LongVideoBench 这类长视频理解基准为例,Gemini 3.7 Flash 在开启智能体模式后,实现了大幅的 Token 削减与准确率提升的双赢。LongVideoBench 是近年来学术界为评估 AI 模型在长视频理解任务上的表现而设计的标准化基准测试集,它包含时长从几分钟到数小时不等的视频,涵盖讲座、电影、教程等多种类型,测试内容包括时间定位、因果推理、跨片段信息整合等高难度任务。与短视频基准(如 ActivityNet、MSRVTT)不同,LongVideoBench 特别考察模型在面对极长上下文时的信息检索和推理能力,是衡量长视频 AI 处理实用性的关键指标。
说个细节,虽然三款模型都受益于该能力,但 Gemini 3.7 Flash 表现最佳——它在整体质量上领先,并在准确率与成本效率的组合上处于帕累托前沿(Pareto Frontier)。帕累托前沿是经济学和优化理论中的核心概念,指在多目标优化中,不可能在不牺牲某个目标的情况下改善另一个目标的解集合。在 AI 模型评估中,成本和准确率通常构成一对权衡:花更多钱(更多 Token、更大模型)通常能获得更高准确率。处于帕累托前沿的模型意味着它在成本-质量的二维空间中代表了最优权衡——不存在另一个模型能在两个维度上同时超越它。换句话说,在同等成本下没有模型比它更准,在同等准确率下没有模型比它更省。
智能体视频理解解锁的四类新能力
智能体视频理解并非只是「省钱」,它还解锁了此前难以实现的处理场景:
亚秒级瞬间检索
模型能精准定位那些在 1 FPS 采样下极易被忽略的瞬时状态变化和紧凑的镜头切换边界,使自动化视频剪辑等精细任务成为可能。具体而言,智能体模式下模型可以对可疑的时间段以 10 FPS 甚至更高的帧率重新扫描,将时间分辨率从秒级提升到百毫秒级,从而捕获转场帧、闪现的文字信息或瞬间出现的物体。
长视频「大海捞针」搜索
面对数小时的视频,模型可以回答复杂查询,而无需像静态处理那样消耗数百万 Token。这直接对应了长视频内容检索的核心痛点。智能体循环使模型能够先通过低帧率快速扫描建立视频的「内容地图」,然后根据用户查询精准跳转到相关片段进行深度分析,其行为逻辑类似于人类使用视频进度条和章节标记进行定向搜索。
异常检测与精细分析
模型可以对「感兴趣的时间窗口」以更高帧率重新采样,从而捕捉快速运动和微妙的视觉伪影——先粗看全局,再精查局部。这种「粗粒度扫描 + 细粒度聚焦」的两阶段策略,在工业质检(检测生产线上的瞬间缺陷)、医疗影像分析(捕捉超声或内窥镜中的异常帧)以及安防监控(识别异常行为的起始瞬间)等场景中具有巨大的应用价值。
动作与物体计数
通过在不同帧率下反复扫描视频,模型能准确追踪重复的物理动作与不同物体。官方演示显示,Gemini 3.7 Flash 能够通过自适应帧率准确统计快节奏动作的次数。这一能力在健身指导(统计运动次数)、制造业(计数产品数量)和零售分析(统计客流量)等领域有直接的商业应用前景。
Gemini API 接入指南:如何快速上手
该功能目前已通过 Gemini API 在 Google AI Studio 和 Gemini Enterprise Agent Platform 中开放,支持视频上传和 YouTube 视频两种输入方式。它采用标准 Gemini API Token 定价,不额外收取功能费用。
开发者只需在 API 配置中将处理方式设为 "agentic" 即可启用:
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.7-flash",
input=[
{
"type": "video",
"uri": "https://youtu.be/7Z5Vy9JBANs",
"processing": "agentic"
},
{
"type": "text",
"text": "What are the 3 most important announcements in this keynote?",
},
],
)
print(interaction.output_text)
值得注意的是,代码示例中使用的 client.interactions.create() 接口代表了 Google Gemini API 的新一代交互范式。与传统的 generate_content() 等单轮生成接口不同,Interactions API 原生支持多步智能体循环、工具调用和状态管理。模型在一次 interaction 中可能执行多次内部工具调用(如视频片段加载、帧率调整、模态切换),而开发者只需等待最终输出。这种接口设计将复杂的智能体编排逻辑封装在 API 后端,使开发者无需自行构建 Agent 框架即可获得智能体级别的处理能力。
只需一行 processing: "agentic" 的配置切换,即可获得整套效率与质量提升,迁移成本极低。
从开发者 API 走向数十亿用户
Google 的野心不止于开发者工具。官方表示,智能体视频理解带来的效率与质量提升将很快推广到 Gemini App 中面向所有用户的 Flash 与 Flash-Lite 模型。
更值得关注的是,未来几个月内,该能力还将驱动 YouTube 视频观看页的 「Ask YouTube」 功能,借助 Gemini 提供基于视觉内容的更高质量回答。YouTube 每天产生超过 10 亿小时的视频观看量,是全球最大的视频平台。当前 YouTube 的搜索和推荐主要依赖标题、标签、字幕等元数据,对视频视觉内容本身的理解能力有限。Ask YouTube 功能将允许用户以自然语言向正在观看的视频提问,并获得基于视频实际内容(而非仅字幕文本)的精准回答。考虑到 YouTube 的广告和订阅收入规模(2024 年超过 360 亿美元),任何能提升用户停留时长和互动深度的技术都具有巨大的商业价值。
这意味着智能体视频理解将从一项 API 特性,演变为覆盖数十亿用户日常视频体验的底层能力。
结语:视频 AI 处理的效率范式转变
智能体视频理解的意义,不仅在于亮眼的成本与 Token 数字,更在于它代表了视频 AI 处理范式的转变——从「被动均匀摄取」转向「主动智能检索」。当模型学会像人类一样「快进、回放、放大关注点」时,长视频这一此前 AI 处理的成本黑洞,终于有了可扩展的解决路径。对于需要处理海量视频内容的企业与开发者,这或许是让视频 AI 应用真正跑通商业模型的关键一步。
核心要点
相关推荐

iPhone Duo双屏折叠手机解析:苹果入局折叠屏市场
苹果官网上线iPhone Duo页面引发热议。深度解析苹果双屏折叠手机的产品形态、技术特点、市场定位及社区反响,探讨苹果折叠屏战略的深层逻辑与消费者关注焦点。

iPhone Duo:Apple折叠屏手机开发全面启动
Apple正式启动iPhone Duo折叠屏手机的开发者预热,提供技术视频、Group Labs群组实验室等资源。了解iPhone Duo双屏折叠设计、跨屏适配挑战及开发者如何提前准备。

CUDA Toolkit 13.4发布:Windows on Arm支持与GPU资源精细控制
NVIDIA CUDA Toolkit 13.4正式支持Windows on Arm平台,并引入共享GPU精细化管理能力。深入解析跨平台开发、多租户资源调度优化及对开发者的实际影响。