待验证60% 置信事实精确时间
Google DeepMind的RT-2首次将视觉-语言模型直接用于生成机器人动作指令
2
来源数
60%
置信度
长期有效
时效性
2026/7/10
首次发现
来源
Mistral发布Robostral Navigate:机器人导航基础模型详解
hackernewshackernews2026/7/8
相关事实
待验证DeepMind推出Auto-RT项目,将大语言模型与机器人控制模型RT-2结合,用LLM作为任务规划层将自然语言指令分解为底层动作序列84% 相似待验证DeepMind开发了VLA(视觉语言动作模型)系统,将机器人的物理动作与视觉token、语言token置于同等重要的位置处理79% 相似待验证Google DeepMind的SIMA项目训练了一个能够在多款3D游戏中执行自然语言指令的通用智能体77% 相似待验证Google DeepMind在多模态模型的GUI理解和交互方面持续投入,包括利用大规模网页截图数据训练模型以及探索Android设备操控能力73% 相似待验证Google DeepMind的Genie项目尝试从无标注视频中学习可交互的世界模型73% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/460978API
curl https://kongchang.com/api/v1/knowledge/claims/460978MCP
get_claim(id=460978)