[控场AI]
· 7 分钟阅读· 3,973 字

NVIDIA Cosmos解析:物理AI如何打通语言、视频与动作

NVIDIA Cosmos解析:物理AI如何打通语言、视频与动作

NVIDIA Cosmos用单一模型融合理解、生成与动作,为物理AI提供闭环神经仿真能力。

NVIDIA研究负责人Ming-Yu Liu详细介绍了Cosmos世界模型的架构设计:该模型用自回归推理塔(VLM)与双向扩散生成塔协作,将视觉语言理解、场景生成和动作执行统一在单一框架内,并通过时间位置嵌入对齐视频、音频与动作等多模态信号。前向动力学、逆向动力学与策略在信息瓶颈约束下共享表示,产生跨任务协同效应。在应用层面,神经仿真器近期更适合做策略验证而非直接训练,只需保持排名一致即可大幅提升研发速度。Cosmos 3提供Super/Nano/Edge三种尺寸,全面开源,边缘版本可在Jetson等设备上本地运行,为人形机器人等安全关键场景提供无需依赖数据中心的即时推理能力。

NVIDIA研究负责人Ming-Yu Liu在MLST访谈中详细拆解了Cosmos系列模型的架构与设计理念。这是一款面向"物理AI"(Physical AI)的世界模型,能够以文本、视频、音频和动作作为统一输入与输出,为自动驾驶和机器人提供闭环仿真能力。本文基于该访谈梳理Cosmos的核心技术路径与应用前景。

一个模型,三种角色

Cosmos最引人注目之处在于用单一模型架构同时承担三类任务。最基础的用法是视觉语言理解:你问模型"视频里有几辆车""机器人是否成功把苹果放进篮子",它会基于视频内容回答。这种"视频+文本输入、文本输出"的组合,构成了一个标准的视觉语言模型(VLM)。

真正的转折在于把这套逻辑反转过来——模型不再描述场景,而是开始生成场景。Liu团队将这种能力定义为"Cosmos Dreams",用来构建闭环仿真器。访谈开头提到的那段汽车转弯视频,其路面从未被实际拍摄,完全由Cosmos生成。它能读取视频、模拟道路,并学习如何处理物体之间的交互。

We're combining these different modalities

这意味着Cosmos把"动作"(action)提升为一等公民。模型可能真正执行一个动作,而它的下一个观测结果正是由之前的动作引起的。这种因果闭环,是物理AI区别于普通视频生成模型的关键。

架构:自回归塔与扩散塔的协作

Liu详细解释了Cosmos的训练流程。起点是一个语言模型(从零训练或采用开源模型),它具备对语言结构的基本理解。随后接入视觉编码器,将视频或图像序列编码后连接到语言模型,形成一个以自回归方式逐token运行的视觉语言模型——它"用语言思考,说出它所看到的"。

关键的第二步,是用这个VLM的预训练权重初始化一个生成器。这里存在一个重要的架构差异:VLM是自回归的,而生成器采用扩散(diffusion)方式,是双向的。Liu将前者称为"推理塔"(reasoning tower),后者为生成塔。在生成塔中,每个token都会关注其他所有token,因此生成的视频、动作或音频在一个块(chunk)内部保持连贯性,同时还能利用推理塔传来的指令信息,理解用户想要生成什么。

生成器训练分两阶段:预训练学习基础能力,中期训练(mid-training)再加入动作数据。

自回归(autoregressive)与扩散(diffusion)是当前生成式AI的两大主流范式,理解两者差异有助于把握Cosmos架构的设计逻辑。自回归模型逐token依次生成,每个新token只能看到之前已生成的内容,天然适合语言推理这类需要线性因果链的任务,GPT系列是典型代表。扩散模型则从噪声出发,通过多步去噪迭代生成完整输出,每个位置在生成过程中可以双向关注整个序列,因此在图像、视频等需要全局一致性的任务上通常表现更优。Cosmos将两者组合:推理塔负责"想清楚要生成什么",生成塔负责"把它高质量地渲染出来"。这种分工使模型既能利用语言模型积累的语义推理能力,又能发挥扩散模型在视觉连贯性上的优势,同时用预训练的VLM权重初始化生成塔,也大幅减少了从零训练生成器所需的数据量。

不同模态如何对齐时间尺度

多模态融合面临一个现实难题:视频有不同帧率,音频有不同赫兹,动作信号也各有频率。如何让它们运行在同一时间轴上?

Liu给出的答案是一套"时间位置嵌入"(temporal position embedding)方案,将所有信号归一化到同一尺度。这样当token代表不同时间块或时空块时,它能知道哪些token处于同一时间点,以及不同时间点之间的相对距离。Liu强调,这是让单一模型能同时处理音视频与动作的关键所在。

三种动力学建模的协同效应

在机器人领域,Liu提到几种重要的建模视角:前向动力学(给定起点和动作,预测未来)、逆向动力学(给定视觉变化,推断所采取的动作)、以及策略(为完成任务机器人应该做什么)。

Cosmos把这三者放在同一个模型里训练,并施加"信息瓶颈"(information bottleneck)——有限的模型容量迫使它们共享表示。Liu指出,这三者本质上都在捕捉"观测与动作之间的相关性",只是切入的视角不同。论文结果显示它们之间存在协同(synergy),一个任务的学习会帮助其他任务。

it will be similar to LLM agents

这里存在一个数据上的不对称:人类生成的视频数据海量,而动作数据稀少。但模态之间会产生"良性迁移"。Liu认为关键在于"共享词汇"——人类的手如何操纵物体,其视觉模式与机器人操纵物体高度相似。即便动作空间不能精确对应,只要模式相似,就更容易泛化到其他本体(embodiment),甚至是未见过的本体。

信息瓶颈(information bottleneck)是机器学习中的一个理论框架,最早由Tishby等人提出,核心思想是:当模型容量有限时,为了同时完成多个任务,网络被迫提取输入数据中最本质、最通用的表示,而非为每个任务单独记忆特定特征。在Cosmos中,前向动力学、逆向动力学和策略共用同一套参数,有限的模型容量迫使它们学习一个能同时服务三个视角的"压缩表示"。这与多任务学习(multi-task learning)的直觉一致:共享表示层通常比各自独立训练的模型泛化能力更强,因为它必须捕捉跨任务的共性结构。对于机器人而言,这意味着在操纵苹果时学到的物体交互规律,可以迁移到操纵其他从未见过的物体上——这正是Liu所说的"跨本体良性迁移"的底层机制。

作为仿真器:策略验证优先

访谈中一个重要讨论是用Cosmos作为仿真器来训练策略,这引出了强化学习中经典的"仿真到现实"(sim-to-real)鸿沟,以及策略可能"钻仿真器空子"的风险。

improve the policy over time

Liu的务实判断是:神经仿真器在早期更适合用于策略验证,而非直接训练。模型构建者在一次训练中会产生大量检查点(checkpoint),如何判断哪个更好?理想情况是把每个策略部署到真实机器人上测成功率,但成本极高。如果神经仿真器测出的成功率排名与真实世界一致——不需要精确,只需"策略A优于策略B"的排序保持——就能快速缩小需要真实测试的检查点数量,大幅提升研发速度。

对于仿真器被"钻空子"的问题,Liu坦承任何仿真器乃至深度学习系统都可能被利用,但他相信随着领域成熟,会出现正则化训练的方法来规避,"我不知道确切的途径,但相信人们会找到办法"。

仿真到现实(sim-to-real)鸿沟是机器人领域长期存在的核心挑战:在仿真环境中训练出的策略,部署到真实物理环境时往往性能大幅下滑。传统物理引擎(如MuJoCo、Isaac Sim)通过精确建模刚体动力学来缩小这一差距,但对软体、液体、布料等复杂物理现象的仿真至今仍不准确,且场景外观与真实世界差异显著。神经仿真器(neural simulator)以真实视频数据为基础学习世界模型,在视觉保真度上天然接近现实,但其内部物理并非由显式方程驱动,更容易被策略"钻空子"——即策略发现了神经网络的预测盲区,而这些盲区在真实世界并不存在。Liu提出的"排名一致性"验证思路,本质上是将神经仿真器定位为一个廉价的粗筛工具而非精确裁判,从而规避对仿真精度的过高要求。

三种尺寸与开放生态

Cosmos 3提供Super、Nano、Edge三种尺寸。Super是追求最高保真度的前沿模型;Nano居中,便于适配各类GPU资源;Edge则专为Jetson Thor、Orin、DGX Spark等边缘设备优化。

Nano is

Edge模型的意义在于"模型住在机器人所在的地方"——执行动作时无需往返数据中心。真实部署中网络不一定可靠,而某些关键任务必须即时完成。由于模型更小,Edge也更易微调,团队曾提供一天内微调Edge模型以提升视觉理解能力的配方。Liu设想三种尺寸未来会协同工作:复杂任务"呼叫"更强大的模型,简单的即时任务则依赖边缘设备。

Liu反复强调Cosmos的开放属性:所有模型、代码乃至部分训练数据都已开源。模型与数据集托管在Hugging Face,代码位于GitHub仓库,仓库中还提供后训练(post-training)配方,帮助开发者复现结果。团队已在ZOE数据集上对Cosmos做后训练,取得SOTA级的抓取-放置策略结果。

世界模型的定义与前景

当被问及"什么是世界模型"时,Liu把它类比为当年对AGI的定义之争——至今没有共识。他给出的理解是:世界模型是"一组有用工具的集合",我们建模总是为了达成某个目标,可能是预测未来,也可能是理解某事为何发生。

展望未来,Liu对导航类任务已较为乐观,认为当前世界模型已足够好;真正的挑战在于操纵(manipulation)任务——涉及接触、缓冲与形变等复杂交互。他特别指出,当人形机器人进入千家万户,安全性比自动驾驶更为关键:你不会在家里看到汽车,但会看到人形机器人围绕在孩子和宠物身边。开发者无法搭建所有厨房和场景来做真实测试,神经仿真器因此成为获得研发速度的"唯一途径"。

分享:

相关推荐