[KongchangAI]
Concept视觉-语言-动作模型 / Vision-Language-Action Model

VLA

将大规模预训练视觉-语言模型与机器人动作生成能力融合的前沿AI方向,代表性工作包括Google RT-2和Physical Intelligence的π0模型

Core Facts

Timeline (last 90 days)

Sep 12

WRC2026现场机器人的能力大多由VLA(视觉-语言-动作模型)或世界模型(World Model)驱动

Unverified50%
Sep 12

Morphi Robot采用世界模型加VLA的混合架构,能够支撑长达15分钟的长时序完整任务

Unverified50%
Sep 12

世界模型加VLA正在成为具身智能领域的主流架构共识

Unverified50%
Sep 11

项目计划下一步接入SmolVLA、OpenVLA-micro等轻量级VLA模型

Unverified50%
Sep 11

当前VLA领域缺乏可复现、可横向对比的标准化评测基准,多数VLA论文在各自定制的实验环境中报告结果

Unverified50%
Sep 11

VLA 模型将视觉感知、语言理解与机器人动作规划整合在统一模型中,通常以预训练的大型视觉语言模型为骨干,代表性工作包括 Google 的 RT-2 和 OpenVLA

Unverified50%
Sep 11

VSArena 项目更新后新增了 VLA(视觉-语言-动作)赛道,并公开了完整代码仓库与文档

Unverified50%
Sep 11

单体VLA模型在长时序(long-horizon)任务上表现不佳,且可解释性差

Unverified50%
Sep 11

OpenVLA、π0、RT-2 和 RDT-1B 都属于「单体模型」(monolithic)VLA模型

Unverified50%
Sep 11

单体VLA模型接收视觉与语言输入后直接生成原始运动指令或极短的动作序列,缺乏可复用的行为抽象

Unverified50%

6 more timeline events

All Facts (16)

Verified

VLA将预训练的视觉-语言模型与机器人动作策略直接对接,使机器人能够将自然语言指令、摄像头图像与低级运动控制统一处理

70%
Unverified

Google DeepMind的RT-2首次将视觉-语言模型直接用于生成机器人动作指令

60%
Unverified

世界模型加VLA正在成为具身智能领域的主流架构共识

50%
Unverified

WRC2026现场机器人的能力大多由VLA(视觉-语言-动作模型)或世界模型(World Model)驱动

50%
Unverified

当前VLA领域缺乏可复现、可横向对比的标准化评测基准,多数VLA论文在各自定制的实验环境中报告结果

50%
Unverified

VLA 模型将视觉感知、语言理解与机器人动作规划整合在统一模型中,通常以预训练的大型视觉语言模型为骨干,代表性工作包括 Google 的 RT-2 和 OpenVLA

50%
Unverified

OpenVLA、π0、RT-2 和 RDT-1B 都属于「单体模型」(monolithic)VLA模型

50%
Unverified

单体VLA模型接收视觉与语言输入后直接生成原始运动指令或极短的动作序列,缺乏可复用的行为抽象

50%
Unverified

单体VLA模型在长时序(long-horizon)任务上表现不佳,且可解释性差

50%
Unverified

谷歌的RT系列模型、丰田研究院的扩散策略(Diffusion Policy)以及视觉-语言-动作(VLA)模型是迈向世界任务模型的早期尝试

50%
Unverified

Gemini Robotics系列采用VLA(Vision-Language-Action,视觉-语言-动作)架构,将Gemini的多模态理解能力延伸到物理动作层面

50%
Unverified

RT-2首次证明了VLA架构的可行性,通过将机器人动作离散化为token,让视觉语言模型直接输出动作序列

50%
Unverified

前沿的机器人模型架构普遍以视觉-语言-动作(VLA)为核心框架,代表包括Google DeepMind的RT-2和Physical Intelligence的π0

50%
Unverified

Morphi Robot采用世界模型加VLA的混合架构,能够支撑长达15分钟的长时序完整任务

50%
Unverified

项目计划下一步接入SmolVLA、OpenVLA-micro等轻量级VLA模型

50%
Unverified

VSArena 项目更新后新增了 VLA(视觉-语言-动作)赛道,并公开了完整代码仓库与文档

50%

Source Articles