Unverified50% confidenceFactExact time
VLA将机器人的物理动作表示为动作token,在统一序列预测框架中端到端完成从感知到行动的推理,Google DeepMind的RT-2系列工作是这一范式的代表
1
Sources
50%
Confidence
Long-term
Relevance
7/18/2026
First Seen
Sources
Related Claims
Unverified基于视觉语言模型(VLM)的屏幕理解使Agent能以语义层面而非像素层面理解界面,这一范式转变被业界称为认知自动化(Cognitive Automation)69% similarUnverifiedKrishna认为机器人模型应直接从视觉与传感器输入映射到动作,而非在中间嵌入LLM68% similarUnverified在大模型时代,Agent架构中LLM充当大脑负责推理决策,工具充当四肢负责与外部世界交互,记忆模块保存对话历史和中间状态66% similarUnverified该项目中roboreg负责机器人位姿估计,OpTaS负责实时求解带约束的导纳任务65% similarUnverified吴恩达主导的团队正在探索将大模型驱动的Agent与机器人硬件结合的具身智能方向64% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/552106API
curl https://kongchang.com/api/v1/knowledge/claims/552106MCP
get_claim(id=552106)