Unverified50% confidenceFactExact time
谷歌的RT-2证明了视觉-语言模型可以直接输出机器人动作指令
1
Sources
50%
Confidence
Long-term
Relevance
9/1/2026
First Seen
Sources
Related Entities
Related Claims
Unverified将大语言模型接入机器人的典型范式包括Google的SayCan(用LLM分解任务后调用底层运动原语)和RT-2(端到端生成控制指令)77% similarUnverifiedGoogle DeepMind的RT-2(2023年)将机器人动作词元化为离散token,附加到视觉-语言模型PaLI-X和PaLM-E的输出词汇表中,展现出零样本泛化能力76% similarUnverifiedGoogle于2023年发布RT-2等视觉-语言-动作模型(VLA),将感知、语义理解与操作策略统一在同一Transformer框架中71% similarUnverifiedGoogle DeepMind于2023年发布的RT-2首次验证了在550亿参数的视觉语言模型上微调机器人控制的可行性,其泛化能力相比前代提升近一倍71% similarUnverified学术界正探索基础模型在机器人领域的应用,如Google DeepMind的RT-2和斯坦福的Open X-Embodiment项目68% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/839177API
curl https://kongchang.com/api/v1/knowledge/claims/839177MCP
get_claim(id=839177)