Unverified50% confidenceFactExact time
谷歌的RT系列模型、丰田研究院的扩散策略(Diffusion Policy)以及视觉-语言-动作(VLA)模型是迈向世界任务模型的早期尝试
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
9/4/2026
First Seen
Valid until: 12/3/2026
Sources
Related Entities
Related Claims
UnverifiedGoogle于2023年发布RT-2等视觉-语言-动作模型(VLA),将感知、语义理解与操作策略统一在同一Transformer框架中75% similarUnverifiedVLA的代表性工作包括Google的RT-2(Robotics Transformer 2)和Physical Intelligence公司的π0模型66% similarUnverifiedWorld Action Model通常采用视频生成模型作为骨干架构,代表性工作包括Google DeepMind的Genie系列和加州大学伯克利分校的UniSim66% similarUnverified谷歌的RT-2证明了视觉-语言模型可以直接输出机器人动作指令65% similarUnverifiedGoogle DeepMind的RT-2(2023年)将机器人动作词元化为离散token,附加到视觉-语言模型PaLI-X和PaLM-E的输出词汇表中,展现出零样本泛化能力64% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/854131API
curl https://kongchang.com/api/v1/knowledge/claims/854131MCP
get_claim(id=854131)