Unverified50% confidenceFactExact time
视觉-语言-动作模型(VLA)是具身智能的最新范式,代表性工作包括Google DeepMind的RT-2和Physical Intelligence的π0
1
Sources
50%
Confidence
Long-term
Relevance
7/10/2026
First Seen
Sources
超越语音指令:机器人多模态交互的未来进化路径
redditr/robotics7/8/2026
Related Claims
UnverifiedDeepMind开发了VLA(视觉语言动作模型)系统,将机器人的物理动作与视觉token、语言token置于同等重要的位置处理82% similarUnverified代表性VLA模型工作包括Google DeepMind的RT-2和斯坦福的OpenVLA78% similarUnverifiedDeepMind采用两个协同工作的模块:更擅长推理的ER模型(本质上是VLM)负责协调统筹,VLA模型负责执行物理动作77% similarUnverifiedDeepMind在VLA上叠加了一层Gemini模型,用户可直接用自然语言下达指令,机器人能一边工作一边对话70% similarVerifiedGoogle DeepMind的RT-2首次将视觉-语言模型直接用于生成机器人动作指令70% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/454707API
curl https://kongchang.com/api/v1/knowledge/claims/454707MCP
get_claim(id=454707)