VLA
将大规模预训练视觉-语言模型与机器人动作生成能力融合的前沿AI方向,代表性工作包括Google RT-2和Physical Intelligence的π0模型
Core Facts
Timeline (last 90 days)
WRC2026现场机器人的能力大多由VLA(视觉-语言-动作模型)或世界模型(World Model)驱动
Morphi Robot采用世界模型加VLA的混合架构,能够支撑长达15分钟的长时序完整任务
世界模型加VLA正在成为具身智能领域的主流架构共识
项目计划下一步接入SmolVLA、OpenVLA-micro等轻量级VLA模型
当前VLA领域缺乏可复现、可横向对比的标准化评测基准,多数VLA论文在各自定制的实验环境中报告结果
VLA 模型将视觉感知、语言理解与机器人动作规划整合在统一模型中,通常以预训练的大型视觉语言模型为骨干,代表性工作包括 Google 的 RT-2 和 OpenVLA
VSArena 项目更新后新增了 VLA(视觉-语言-动作)赛道,并公开了完整代码仓库与文档
单体VLA模型在长时序(long-horizon)任务上表现不佳,且可解释性差
OpenVLA、π0、RT-2 和 RDT-1B 都属于「单体模型」(monolithic)VLA模型
单体VLA模型接收视觉与语言输入后直接生成原始运动指令或极短的动作序列,缺乏可复用的行为抽象
6 more timeline events
All Facts (16)
VLA将预训练的视觉-语言模型与机器人动作策略直接对接,使机器人能够将自然语言指令、摄像头图像与低级运动控制统一处理
70%UnverifiedGoogle DeepMind的RT-2首次将视觉-语言模型直接用于生成机器人动作指令
60%Unverified世界模型加VLA正在成为具身智能领域的主流架构共识
50%UnverifiedWRC2026现场机器人的能力大多由VLA(视觉-语言-动作模型)或世界模型(World Model)驱动
50%Unverified当前VLA领域缺乏可复现、可横向对比的标准化评测基准,多数VLA论文在各自定制的实验环境中报告结果
50%UnverifiedVLA 模型将视觉感知、语言理解与机器人动作规划整合在统一模型中,通常以预训练的大型视觉语言模型为骨干,代表性工作包括 Google 的 RT-2 和 OpenVLA
50%UnverifiedOpenVLA、π0、RT-2 和 RDT-1B 都属于「单体模型」(monolithic)VLA模型
50%Unverified单体VLA模型接收视觉与语言输入后直接生成原始运动指令或极短的动作序列,缺乏可复用的行为抽象
50%Unverified单体VLA模型在长时序(long-horizon)任务上表现不佳,且可解释性差
50%Unverified谷歌的RT系列模型、丰田研究院的扩散策略(Diffusion Policy)以及视觉-语言-动作(VLA)模型是迈向世界任务模型的早期尝试
50%UnverifiedGemini Robotics系列采用VLA(Vision-Language-Action,视觉-语言-动作)架构,将Gemini的多模态理解能力延伸到物理动作层面
50%UnverifiedRT-2首次证明了VLA架构的可行性,通过将机器人动作离散化为token,让视觉语言模型直接输出动作序列
50%Unverified前沿的机器人模型架构普遍以视觉-语言-动作(VLA)为核心框架,代表包括Google DeepMind的RT-2和Physical Intelligence的π0
50%UnverifiedMorphi Robot采用世界模型加VLA的混合架构,能够支撑长达15分钟的长时序完整任务
50%Unverified项目计划下一步接入SmolVLA、OpenVLA-micro等轻量级VLA模型
50%UnverifiedVSArena 项目更新后新增了 VLA(视觉-语言-动作)赛道,并公开了完整代码仓库与文档
50%