RT-2
谷歌DeepMind开发的机器人变换器模型,将视觉语言理解与机械臂控制统一在同一神经网络中的具身智能体
核心事实
时间轴 (近 90 天)
Google的RT-2(Robotics Transformer 2)模型能够将视觉语言模型的推理能力转化为机器人的控制指令
RT-2采用256个离散bin来表示每个动作维度,7自由度机械臂的动作空间被编码为7个token的序列
Google的RT-2使用预训练的视觉-语言模型(如PaLI)作为backbone联合编码图像观察和自然语言指令,并在输出端生成离散化的动作token
谷歌的RT-2和DeepMind的Gato项目在探索视觉-语言-行动模型
谷歌的RT-2、斯坦福的VoxPoser等代表性工作已证明,预训练视觉-语言模型能够显著提升机器人的zero-shot泛化能力
2023年以来,研究者开始将GPT-4、Claude等大语言模型作为机器人的决策层,典型系统包括SayCan、Inner Monologue和RT-2
Google DeepMind的RT系列包括RT-1、RT-2、RT-X,RT-1训练基础操作能力,RT-2将VLM与机器人动作关联,RT-X通过跨平台数据共享实现更强泛化
谷歌的RT-2证明了视觉-语言模型可以直接输出机器人动作指令
RT-2首次证明了VLA架构的可行性,通过将机器人动作离散化为token,让视觉语言模型直接输出动作序列
前沿的机器人模型架构普遍以视觉-语言-动作(VLA)为核心框架,代表包括Google DeepMind的RT-2和Physical Intelligence的π0
还有 5 条时间轴事件
全部知识事实 (16)
谷歌DeepMind的RT-2、特斯拉Optimus、Figure AI等项目是具身智能方向的代表性探索
65%已验证具身智能领域代表性工作包括斯坦福大学的Mobile ALOHA、谷歌的RT-2,以及OpenAI与Figure合作的人形机器人项目
65%已验证Google DeepMind、Tesla Optimus、Figure AI、1X Technologies等公司都在积极推进机器人操控技术的研发
65%待验证Google DeepMind的RT-2首次将视觉-语言模型直接用于生成机器人动作指令
60%待验证Google的RT-2(Robotics Transformer 2)模型能够将视觉语言模型的推理能力转化为机器人的控制指令
50%待验证RT-2采用256个离散bin来表示每个动作维度,7自由度机械臂的动作空间被编码为7个token的序列
50%待验证Google的RT-2使用预训练的视觉-语言模型(如PaLI)作为backbone联合编码图像观察和自然语言指令,并在输出端生成离散化的动作token
50%待验证谷歌的RT-2和DeepMind的Gato项目在探索视觉-语言-行动模型
50%待验证谷歌的RT-2、斯坦福的VoxPoser等代表性工作已证明,预训练视觉-语言模型能够显著提升机器人的zero-shot泛化能力
50%待验证2023年以来,研究者开始将GPT-4、Claude等大语言模型作为机器人的决策层,典型系统包括SayCan、Inner Monologue和RT-2
50%待验证Google DeepMind的RT系列包括RT-1、RT-2、RT-X,RT-1训练基础操作能力,RT-2将VLM与机器人动作关联,RT-X通过跨平台数据共享实现更强泛化
50%待验证谷歌的RT-2证明了视觉-语言模型可以直接输出机器人动作指令
50%待验证RT-2首次证明了VLA架构的可行性,通过将机器人动作离散化为token,让视觉语言模型直接输出动作序列
50%待验证前沿的机器人模型架构普遍以视觉-语言-动作(VLA)为核心框架,代表包括Google DeepMind的RT-2和Physical Intelligence的π0
50%待验证RT-2是Google DeepMind的Robotics Transformer 2,与OpenVLA等大规模机器人基础模型需要覆盖多样化场景、包含精确空间信息和语义标注的真实世界数据
50%待验证RT-2(Robotics Transformer 2)直接用视觉-语言模型端到端生成机器人控制指令
50%