2024年出现的机器人控制模型,采用扩散策略替代自回归动作生成,旨在解决VLA模型在实时控制和动作精度上的局限
Physical Intelligence的π0采用了基于Flow Matching的连续动作生成方案,用于灵巧操作任务
前沿的机器人模型架构普遍以视觉-语言-动作(VLA)为核心框架,代表包括Google DeepMind的RT-2和Physical Intelligence的π0
谷歌DeepMind的RT-2、特斯拉Optimus、Figure AI等项目是具身智能方向的代表性探索