Gemini Omni 1.1实测:40秒长视频生成与Seedance 2.5对比

谷歌近日发布了 Gemini Omni 1.1 Flash 视频生成模型,这是对前代 Omni 模型的一次重大升级。最引人注目的变化是视频时长最高可达 40 秒,同时还新增了一系列颇具想象空间的功能。本文将结合实际测试,逐一拆解这些新特性,并将其与目前主流的 Sora 与 Runway 等竞品格局进行对比,看看这款模型的真实实力究竟如何。
Gemini Omni 模型系列背景
Gemini 是 Google DeepMind 于 2023 年底推出的多模态大语言模型系列,旨在与 OpenAI 的 GPT-4 竞争。Omni 系列是 Gemini 家族中专注于视频生成的分支,采用了扩散模型(Diffusion Model)架构——这是当前 AI 视频生成的主流技术路线。扩散模型通过逐步向随机噪声中添加结构信息,最终生成连贯的视频帧序列。Flash 后缀代表该版本针对推理速度进行了优化,牺牲了部分生成质量以换取更快的响应时间,这在商业应用中尤为重要,因为推理成本直接影响服务的经济可行性。
Gemini Omni 1.1 Flash 核心新特性解析
相比前代,1.1 Flash 版本带来的更新相当密集,涵盖了从时长扩展到工作流优化的多个维度。
场景延展:从10秒跃升至40秒
本次升级最大的亮点是「Extended Scenes(场景延展)」功能,专为支持更长叙事而设计。其工作原理是模型分析已有的 10 秒素材,再基于此续接 10 秒,如此累加,最终可将视频延长至 40 秒的累计时长。对于需要连续叙事、或希望在单条视频中完成更完整表达的创作者而言,这是一个非常实用的能力。
**视频生成模型的时长挑战:**AI 视频生成中,时长扩展一直是技术难点。原因在于视频本质上是高维时序数据:一个 10 秒 30fps 的视频包含 300 帧,每帧若为 1080p 分辨率,数据量极其庞大。模型需要同时保持时间连贯性(temporal coherence,即相邻帧之间的平滑过渡)和语义一致性(semantic consistency,即角色、物体在整个时长内保持特征不变)。当前主流方案有两种:一是直接训练支持长时长的模型,但计算成本呈指数增长;二是采用「续接」策略,即生成短片段后基于上下文延续,Gemini Omni 1.1 采用的正是后者,这是在技术可行性与成本之间的折中方案。
首尾帧控制:赋予创作者更精准的导演能力
1.1 Flash 新增了「首帧+尾帧」功能。用户只需提供视频的起始帧和结束帧,模型会自动生成一段平滑过渡来衔接这两个画面。相比单纯依赖文本提示词,这种方式赋予了创作者对视频走向更强的掌控力。
**首尾帧控制的技术意义:**首尾帧控制(keyframe conditioning)是计算机图形学中的经典概念在 AI 时代的新实现。传统动画制作中,动画师会先绘制关键帧(keyframes),再由助手或软件补充中间帧(in-betweening)。AI 视频模型将这一流程自动化:用户提供起止画面,模型通过学习到的运动先验知识生成过渡。这比纯文本提示更可控,因为视觉信息比语言描述更精确——"一辆红色跑车"可以有无数种造型,但一张具体图片只对应唯一外观。该功能的实现依赖于模型的条件生成能力(conditional generation),即在给定约束下采样符合要求的输出,这在技术上需要模型同时理解图像语义和视频动态。
在测试中,上传了一辆普通汽车作为首帧、一个变形金刚机器人作为尾帧,要求模型生成机械变形过程。结果相当惊艳——过渡自然、机械感处理到位,虽然有轻微的画面扭曲,但整体效果已经足够可用,多生成几次变体几乎可以得到完美结果。

360p草稿视频:大幅提升迭代效率的工作流
个人认为最有价值、也最希望未来模型普及的功能,是「Draft Videos(草稿视频)」。它允许用户以 360p 低分辨率快速生成轻量级预览,速度提升最高可达 60%。Gemini Omni 本身就是一个「Flash」快速模型,在如此低的分辨率下生成,速度几乎是瞬时的。创作者可以用同一提示词批量生成多个版本,从中挑出最满意的一个,再放大用于最终项目。
**360p 草稿与分辨率放大技术:**分辨率分级生成是视频 AI 领域的重要工作流创新。360p(640×360 像素)相比 1080p(1920×1080)数据量仅为后者的约 1/9,这意味着生成速度可以大幅提升。之后的放大过程采用超分辨率技术(Super-Resolution),通常基于生成对抗网络(GAN)或扩散模型实现。关键在于放大不是简单的像素插值,而是利用模型学到的高频细节先验,重建出原本不存在的纹理和边缘信息。这种"先快速预览、后精细化"的范式类似于传统渲染中的预览模式(preview render),能显著降低创作迭代成本。值得注意的是,放大质量高度依赖模型训练时是否见过足够的高分辨率数据。

值得一提的是,模型支持将视频放大至 4K,且放大质量表现出色。从 720p 到 4K 的画质提升非常明显,这套「先草稿、后精修」的流程显著降低了试错成本。
视频参考输入:轻松复用运动风格
另一个令人兴奋的功能是支持将视频作为参考输入。如果你想要某种特定的运动方式,只需喂给模型一段参考视频,它就会将该运动整合进新的生成结果中。这对于需要保持风格一致性的项目来说非常有帮助。
**视频参考输入与风格迁移:**视频作为参考输入(video reference conditioning)是多模态模型能力的体现。技术上,模型需要从参考视频中提取运动特征(motion features),如光流(optical flow)、摄像机运动(camera motion)或角色动作模式,然后将这些特征注入到新视频的生成过程中。这与图像领域的风格迁移(style transfer)类似,但视频增加了时间维度的复杂性。实现方式通常是通过注意力机制(attention mechanism)让模型在生成每一帧时参考输入视频的相应时间点,或者通过控制网络(ControlNet)等架构显式地编码运动信息。这一功能对保持品牌视觉一致性或复制特定导演风格极具价值。
Gemini Omni 1.1 与 Sora 与 Runway 等竞品格局实测对比
**当前 AI 视频生成市场格局:**当前 AI 视频生成市场呈现多极竞争态势。OpenAI 的 Sora 于 2024 年 2 月展示了惊人的长视频生成能力(最长 60 秒),但至今未完全公开;Runway 的 Gen-3 系列在商业化方面走在前列,提供从文本到视频、图像到视频等多种模式;Pika Labs 以快速迭代和社区友好著称;而字节跳动的 Seededance(即文中的 Seedance)则在亚洲市场占据重要地位。这些模型在技术路线上各有侧重:有的强调物理真实性,有的优先运动流畅度,还有的如 Gemini Omni 专注于速度与成本优化。市场尚未出现绝对领先者,各家都在探索差异化定位。
新功能听起来诱人,但模型的真实生成质量才是关键。以下是在 Higgsfield 平台上进行的多组测试,与运行成本明显更高的 Sora 与 Runway 等竞品格局采用同条件对比(相同提示词、10秒时长、HD画质)。
**Higgsfield 平台定位:**Higgsfield 是一个专注于 AI 视频生成的云平台,类似于图像生成领域的 Midjourney 或 Stability AI。这类平台的价值在于降低使用门槛:用户无需配置 GPU 服务器、安装复杂依赖或调整模型参数,通过 Web 界面即可使用最新模型。平台通常采用订阅制或按量付费模式,并提供不同模型的统一接口,方便横向对比。对于开发者和创作者而言,这种"模型即服务"(Model-as-a-Service, MaaS)的模式大幅降低了技术壁垒,也加速了 AI 工具的普及。Higgsfield 支持多个主流视频模型,使其成为评测和对比的理想环境。
测试一:骑士与武士的写实对决
第一个提示词要求生成「欧洲骑士与日本武士在草地上的写实对决」。Gemini Omni 的整体美学表现令人印象深刻——草地非常写实,双方铠甲细节丰富。但打斗动作显得不够自然:刀剑相撞时出现了动漫风格的巨大火花,这在真实战斗中并不会发生;同时刀剑有轻微扭曲,角色动作偏僵硬。

换到 Sora 与 Runway 等竞品格局,角色的运动明显更加真实自然。不过它同样出现了刀剑碰撞冒火花的问题——除非是魔法与骑士的奇幻对决,否则钢制刀剑不应像烟花一样迸溅火星。尽管存在同样的瑕疵,Sora 与 Runway 等竞品格局在角色动作真实度上确实优于 Gemini Omni。

测试二:独轮车抛球杂耍——物理理解能力大考
第二个测试专门考验物理理解能力:一个人骑独轮车、同时用经典的瀑布式手法抛接三个红球。由于抛接高度依赖动力学运动和物体恒存性,这是检验模型物理直觉的好题目。
**物理理解与世界模型:**AI 视频模型的物理理解能力反映了其是否具备"世界模型"(world model)——即对真实世界运作规则的内在表征。抛球、碰撞、重力等物理现象遵循牛顿力学,但当前大多数视频模型是通过大规模数据学习统计相关性,而非真正理解物理定律。这导致它们在常见场景(如人走路)表现良好,因为训练数据充足;但在罕见或复杂的物理交互(如杂耍)中失效,因为缺乏足够样本且未内置物理引擎。一些前沿研究尝试将神经网络与物理模拟器结合,或通过强化学习让模型在虚拟环境中"体验"物理规则,但这些方法尚未在商业模型中普及。物理准确性是当前 AI 视频生成的核心瓶颈之一。
结果两个模型都没能交出满意答卷。Gemini Omni 中骑独轮车的动作还算不错,但球体在不断融化、消失。Sora 与 Runway 等竞品格局的球体虽然没有扭曲,但抛接动作完全不真实——球在空中悬浮的时间过长,运动物理彻底崩溃。可以说在复杂物理场景上,当前这两个模型都还远未成熟。
测试三:动态图形(Motion Graphics)生成
最后测试了动态图形能力,要求生成一段 10 秒的 Vox 风格编辑类动画,介绍 Gemini Omni 1.1 自身的功能。遗憾的是,这部分相比前代几乎没有改进——过渡和文字本身依然存在大量扭曲。
总结:定位清晰的高性价比AI视频工具
综合来看,Gemini Omni 1.1 Flash 的升级方向明确且实用,尤其是场景延展、首尾帧控制和 360p 草稿工作流这三大特性,切实提升了创作效率与可控性。
但从生成质量看,它更适合相对简单的任务。如果你只是需要为 YouTube 视频快速制作一些 B-roll 素材,或希望以极低成本生成基础 AI 画面,它会是一个很棒的工具。然而面对复杂的动态图形、高节奏动作场景等任务时,它仍显不足。
考虑到其相较 Sora 与 Runway 等竞品格局明显更低的运行成本,这种「性价比取向」的定位其实相当合理——它不是为了追求极致画质,而是为了在速度、成本与可控性之间取得最佳平衡。
核心要点
相关推荐

前Meta员工爆料:高薪工程师竟在给AI做数据标注
前Meta员工曝光大厂AI化转型真相:百万年薪工程师被安排做RLHF数据标注,组织扁平化后员工只需向AI系统汇报,咨询医疗等行业也在被AI重塑。知识工作者如何应对自我替代的职业困境?

自然语言驱动Blender:用AI编程助手生成3D场景实战
通过ChatGPT Codex等AI编程助手调用Blender Python API,仅用几句自然语言指令即可生成精美3D场景。本文详解从安装到渲染的完整流程,探讨编程助手作为通用执行器的创作新范式。

CAPI-DINO:为自监督学习补上全局表征的组合式探索
CAPI-DINO实验将DINO全局目标叠加到CAPI局部表征之上,在ViT-B/14模型上实现68.7%线性探测准确率,仅消耗16%算力。本文详解其架构设计、实验结果及局部与全局表征的权衡。