待验证50% 置信事实精确时间
与传统计算机视觉方案(如YOLO目标检测)相比,VLM无需针对特定物体训练专用模型即可完成开放词汇的物体识别与场景理解
1
来源数
50%
置信度
长期有效
时效性
2026/9/17
首次发现
来源
涉及实体
相关事实
待验证VLM能够根据自然语言描述识别训练数据中从未出现的目标类别,这种能力被称为零样本(zero-shot)或开放词汇(open-vocabulary)识别75% 相似待验证VLA模型将视觉感知、语言理解与动作生成统一在单一模型框架内,训练高度依赖大规模高质量人类操作演示数据68% 相似待验证VLM的细粒度理解缺陷被认为与CLIP式对比学习的训练目标有关,图文匹配的粗粒度目标无法促使模型学习组合性语义68% 相似待验证构造包含计数、空间关系、细粒度属性的训练数据可以缓解VLM预训练阶段的先天不足65% 相似待验证传统闭集检测器(如Faster R-CNN或YOLO系列)只能检测训练集中预定义的类别65% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/930594API
curl https://kongchang.com/api/v1/knowledge/claims/930594MCP
get_claim(id=930594)