待验证50% 置信事实精确时间
谷歌的RT系列模型、丰田研究院的扩散策略(Diffusion Policy)以及视觉-语言-动作(VLA)模型是迈向世界任务模型的早期尝试
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/9/4
首次发现
有效期至:2026/12/3
来源
涉及实体
相关事实
待验证Google于2023年发布RT-2等视觉-语言-动作模型(VLA),将感知、语义理解与操作策略统一在同一Transformer框架中75% 相似待验证VLA的代表性工作包括Google的RT-2(Robotics Transformer 2)和Physical Intelligence公司的π0模型66% 相似待验证World Action Model通常采用视频生成模型作为骨干架构,代表性工作包括Google DeepMind的Genie系列和加州大学伯克利分校的UniSim66% 相似待验证谷歌的RT-2证明了视觉-语言模型可以直接输出机器人动作指令65% 相似待验证Google DeepMind的RT-2(2023年)将机器人动作词元化为离散token,附加到视觉-语言模型PaLI-X和PaLM-E的输出词汇表中,展现出零样本泛化能力64% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/854131API
curl https://kongchang.com/api/v1/knowledge/claims/854131MCP
get_claim(id=854131)