[控场AI]
概念视觉-语言-动作模型 / Vision-Language-Action Model

VLA

将大规模预训练视觉-语言模型与机器人动作生成能力融合的前沿AI方向,代表性工作包括Google RT-2和Physical Intelligence的π0模型

核心事实

时间轴 (近 90 天)

9月4日

谷歌的RT系列模型、丰田研究院的扩散策略(Diffusion Policy)以及视觉-语言-动作(VLA)模型是迈向世界任务模型的早期尝试

待验证50%
8月31日

Gemini Robotics系列采用VLA(Vision-Language-Action,视觉-语言-动作)架构,将Gemini的多模态理解能力延伸到物理动作层面

待验证50%
8月29日

RT-2首次证明了VLA架构的可行性,通过将机器人动作离散化为token,让视觉语言模型直接输出动作序列

待验证50%
8月29日

前沿的机器人模型架构普遍以视觉-语言-动作(VLA)为核心框架,代表包括Google DeepMind的RT-2和Physical Intelligence的π0

待验证50%
7月10日

Google DeepMind的RT-2首次将视觉-语言模型直接用于生成机器人动作指令

待验证60%
7月10日

VLA将预训练的视觉-语言模型与机器人动作策略直接对接,使机器人能够将自然语言指令、摄像头图像与低级运动控制统一处理

已验证70%

全部知识事实 (6)

来源文章