RT-2
谷歌DeepMind开发的机器人变换器模型,将视觉语言理解与机械臂控制统一在同一神经网络中的具身智能体
Core Facts
Timeline (last 90 days)
VLA 模型将视觉感知、语言理解与机器人动作规划整合在统一模型中,通常以预训练的大型视觉语言模型为骨干,代表性工作包括 Google 的 RT-2 和 OpenVLA
OpenVLA、π0、RT-2 和 RDT-1B 都属于「单体模型」(monolithic)VLA模型
Google的RT-2(Robotics Transformer 2)模型能够将视觉语言模型的推理能力转化为机器人的控制指令
RT-2采用256个离散bin来表示每个动作维度,7自由度机械臂的动作空间被编码为7个token的序列
Google的RT-2使用预训练的视觉-语言模型(如PaLI)作为backbone联合编码图像观察和自然语言指令,并在输出端生成离散化的动作token
谷歌的RT-2和DeepMind的Gato项目在探索视觉-语言-行动模型
谷歌的RT-2、斯坦福的VoxPoser等代表性工作已证明,预训练视觉-语言模型能够显著提升机器人的zero-shot泛化能力
2023年以来,研究者开始将GPT-4、Claude等大语言模型作为机器人的决策层,典型系统包括SayCan、Inner Monologue和RT-2
Google DeepMind的RT系列包括RT-1、RT-2、RT-X,RT-1训练基础操作能力,RT-2将VLM与机器人动作关联,RT-X通过跨平台数据共享实现更强泛化
谷歌的RT-2证明了视觉-语言模型可以直接输出机器人动作指令
8 more timeline events
All Facts (19)
谷歌DeepMind的RT-2、特斯拉Optimus、Figure AI等项目是具身智能方向的代表性探索
65%Verified具身智能领域代表性工作包括斯坦福大学的Mobile ALOHA、谷歌的RT-2,以及OpenAI与Figure合作的人形机器人项目
65%VerifiedGoogle DeepMind、Tesla Optimus、Figure AI、1X Technologies等公司都在积极推进机器人操控技术的研发
65%UnverifiedGoogle DeepMind的RT-2首次将视觉-语言模型直接用于生成机器人动作指令
60%UnverifiedVLA 模型将视觉感知、语言理解与机器人动作规划整合在统一模型中,通常以预训练的大型视觉语言模型为骨干,代表性工作包括 Google 的 RT-2 和 OpenVLA
50%UnverifiedOpenVLA、π0、RT-2 和 RDT-1B 都属于「单体模型」(monolithic)VLA模型
50%UnverifiedGoogle的RT-2(Robotics Transformer 2)模型能够将视觉语言模型的推理能力转化为机器人的控制指令
50%UnverifiedRT-2采用256个离散bin来表示每个动作维度,7自由度机械臂的动作空间被编码为7个token的序列
50%UnverifiedGoogle的RT-2使用预训练的视觉-语言模型(如PaLI)作为backbone联合编码图像观察和自然语言指令,并在输出端生成离散化的动作token
50%Unverified谷歌的RT-2和DeepMind的Gato项目在探索视觉-语言-行动模型
50%Unverified谷歌的RT-2、斯坦福的VoxPoser等代表性工作已证明,预训练视觉-语言模型能够显著提升机器人的zero-shot泛化能力
50%Unverified2023年以来,研究者开始将GPT-4、Claude等大语言模型作为机器人的决策层,典型系统包括SayCan、Inner Monologue和RT-2
50%UnverifiedGoogle DeepMind的RT系列包括RT-1、RT-2、RT-X,RT-1训练基础操作能力,RT-2将VLM与机器人动作关联,RT-X通过跨平台数据共享实现更强泛化
50%Unverified谷歌的RT-2证明了视觉-语言模型可以直接输出机器人动作指令
50%UnverifiedRT-2首次证明了VLA架构的可行性,通过将机器人动作离散化为token,让视觉语言模型直接输出动作序列
50%Unverified前沿的机器人模型架构普遍以视觉-语言-动作(VLA)为核心框架,代表包括Google DeepMind的RT-2和Physical Intelligence的π0
50%UnverifiedRT-2是Google DeepMind的Robotics Transformer 2,与OpenVLA等大规模机器人基础模型需要覆盖多样化场景、包含精确空间信息和语义标注的真实世界数据
50%UnverifiedRT-2(Robotics Transformer 2)直接用视觉-语言模型端到端生成机器人控制指令
50%UnverifiedGoogle DeepMind于2023年发布的RT-2首次验证了在550亿参数的视觉语言模型上微调机器人控制的可行性,其泛化能力相比前代提升近一倍
50%