Unverified50% confidenceFactExact time
单体VLA模型接收视觉与语言输入后直接生成原始运动指令或极短的动作序列,缺乏可复用的行为抽象
1
Sources
50%
Confidence
Long-term
Relevance
9/11/2026
First Seen
Sources
Related Entities
Related Claims
Verified该模型属于视觉-语言-动作(VLA)模型的范畴,将视觉编码器、语言理解模块与动作预测头统一在端到端架构中78% similarUnverified当前的视觉-语言大模型(VLM)已具备开放词汇的目标检测、场景理解与推理能力,使得无需为每个新任务单独训练模型成为可能68% similarUnverified行为克隆属于模仿学习的最简形式,直接学习状态到动作的映射,而不像逆强化学习(IRL)那样推断专家的奖励函数67% similarUnverified多模态大模型(VLM)通过视觉编码器将patch转为高维向量并结合语言先验补全内容,与传统OCR基于局部决策并在置信度低时报错的行为有本质区别66% similarUnverified模型在未收到明确指令时输出图片,意味着系统提示词设计或RLHF训练中存在激励偏差65% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/898854API
curl https://kongchang.com/api/v1/knowledge/claims/898854MCP
get_claim(id=898854)