VLA
将大规模预训练视觉-语言模型与机器人动作生成能力融合的前沿AI方向,代表性工作包括Google RT-2和Physical Intelligence的π0模型
核心事实
时间轴 (近 90 天)
谷歌的RT系列模型、丰田研究院的扩散策略(Diffusion Policy)以及视觉-语言-动作(VLA)模型是迈向世界任务模型的早期尝试
Gemini Robotics系列采用VLA(Vision-Language-Action,视觉-语言-动作)架构,将Gemini的多模态理解能力延伸到物理动作层面
RT-2首次证明了VLA架构的可行性,通过将机器人动作离散化为token,让视觉语言模型直接输出动作序列
前沿的机器人模型架构普遍以视觉-语言-动作(VLA)为核心框架,代表包括Google DeepMind的RT-2和Physical Intelligence的π0
Google DeepMind的RT-2首次将视觉-语言模型直接用于生成机器人动作指令
VLA将预训练的视觉-语言模型与机器人动作策略直接对接,使机器人能够将自然语言指令、摄像头图像与低级运动控制统一处理
全部知识事实 (6)
VLA将预训练的视觉-语言模型与机器人动作策略直接对接,使机器人能够将自然语言指令、摄像头图像与低级运动控制统一处理
70%待验证Google DeepMind的RT-2首次将视觉-语言模型直接用于生成机器人动作指令
60%待验证谷歌的RT系列模型、丰田研究院的扩散策略(Diffusion Policy)以及视觉-语言-动作(VLA)模型是迈向世界任务模型的早期尝试
50%待验证Gemini Robotics系列采用VLA(Vision-Language-Action,视觉-语言-动作)架构,将Gemini的多模态理解能力延伸到物理动作层面
50%待验证RT-2首次证明了VLA架构的可行性,通过将机器人动作离散化为token,让视觉语言模型直接输出动作序列
50%待验证前沿的机器人模型架构普遍以视觉-语言-动作(VLA)为核心框架,代表包括Google DeepMind的RT-2和Physical Intelligence的π0
50%