[KongchangAI]
ConceptVLM / Vision Language Model

视觉语言模型

能够同时处理视觉(图像/视频)和语言(文本)输入的多模态AI模型,通过视觉编码器将图像转化为视觉token后与语言模型联合建模,支持视觉问答、图像描述等任务

Timeline (last 90 days)

Sep 11

研究者提出了一个简单、无需训练的框架,让具备推理能力的视觉语言模型进行迭代搜索、动态推理和证据积累

Unverified50%

All Facts (1)

Source Articles