模型InternVL系列
InternVL
上海AI实验室推出的开源通用视觉语言模型,具备强大的多模态理解能力,支持图文混合输入,在文档理解、视觉问答等任务上表现优异
核心事实
时间轴 (近 90 天)
9月12日
VLM 是在传统 LLM 基础上融合了视觉编码器的多模态模型,典型代表包括 LLaVA、Qwen-VL、InternVL
待验证50%
全部知识事实 (5)
已验证
VLM(视觉语言模型)通常由视觉编码器(如ViT)、语言模型和连接两者的投影层组成,代表性模型包括GPT-4V/4o、Claude 3.5、LLaVA系列和InternVL
80%已验证开源多模态模型LLaVA、InternVL、Qwen-VL通常采用'视觉编码器+投影层+语言模型'的架构
70%待验证Qwen-VL和InternVL分别来自阿里和上海AI Lab,代表国内多模态领域的前沿水平
90%待验证开源多模态模型包括LLaVA、MiniCPM-V、InternVL、Qwen-VL等
60%待验证VLM 是在传统 LLM 基础上融合了视觉编码器的多模态模型,典型代表包括 LLaVA、Qwen-VL、InternVL
50%