待验证50% 置信事实精确时间
单体VLA模型接收视觉与语言输入后直接生成原始运动指令或极短的动作序列,缺乏可复用的行为抽象
1
来源数
50%
置信度
长期有效
时效性
2026/9/11
首次发现
来源
涉及实体
相关事实
已验证该模型属于视觉-语言-动作(VLA)模型的范畴,将视觉编码器、语言理解模块与动作预测头统一在端到端架构中78% 相似待验证当前的视觉-语言大模型(VLM)已具备开放词汇的目标检测、场景理解与推理能力,使得无需为每个新任务单独训练模型成为可能68% 相似待验证行为克隆属于模仿学习的最简形式,直接学习状态到动作的映射,而不像逆强化学习(IRL)那样推断专家的奖励函数67% 相似待验证多模态大模型(VLM)通过视觉编码器将patch转为高维向量并结合语言先验补全内容,与传统OCR基于局部决策并在置信度低时报错的行为有本质区别66% 相似待验证模型在未收到明确指令时输出图片,意味着系统提示词设计或RLHF训练中存在激励偏差65% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/898854API
curl https://kongchang.com/api/v1/knowledge/claims/898854MCP
get_claim(id=898854)