ConceptVLM / Vision Language Model
视觉语言模型
能够同时处理视觉(图像/视频)和语言(文本)输入的多模态AI模型,通过视觉编码器将图像转化为视觉token后与语言模型联合建模,支持视觉问答、图像描述等任务
Timeline (last 90 days)
Sep 11
研究者提出了一个简单、无需训练的框架,让具备推理能力的视觉语言模型进行迭代搜索、动态推理和证据积累
Unverified50%
能够同时处理视觉(图像/视频)和语言(文本)输入的多模态AI模型,通过视觉编码器将图像转化为视觉token后与语言模型联合建模,支持视觉问答、图像描述等任务
研究者提出了一个简单、无需训练的框架,让具备推理能力的视觉语言模型进行迭代搜索、动态推理和证据积累