Unverified50% confidenceFactExact time
Google的RT-2使用预训练的视觉-语言模型(如PaLI)作为backbone联合编码图像观察和自然语言指令,并在输出端生成离散化的动作token
1
Sources
50%
Confidence
Long-term
Relevance
9/8/2026
First Seen
Sources
Related Entities
Related Claims
UnverifiedRT-2首次证明了VLA架构的可行性,通过将机器人动作离散化为token,让视觉语言模型直接输出动作序列73% similarUnverified谷歌的PaLI、OpenAI的GPT-4V、Meta的LLaMA Vision均沿用了类似的图文对齐预训练策略72% similarUnverifiedMeta的ImageBind和Google的PaLM-E模型证明,将视觉、语言、惯性数据联合编码可提升机器人对复杂场景的理解能力67% similarUnverified通用实验室(Tongying Lab)发布了视觉-语言-动作(Vision-Language-Action)模型67% similarVerifiedVLA将预训练的视觉-语言模型与机器人动作策略直接对接,使机器人能够将自然语言指令、摄像头图像与低级运动控制统一处理67% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/880242API
curl https://kongchang.com/api/v1/knowledge/claims/880242MCP
get_claim(id=880242)