Qwen-VL
Qwen-VL是阿里巴巴研发的视觉语言大模型,属于通义千问(Qwen)系列的多模态分支。该模型能够同时理解图像与文本输入,支持图文问答、视觉推理、图像描述生成、文档理解及GUI交互等多种任务,具备较强的中英文双语视觉理解能力,可应用于智能助手、自动化代理等场景。
Core Facts
GPT-4V、Claude 3、Gemini是现代多模态大模型的代表,能够同时处理文本、图像等多种数据类型
Qwen-VL是阿里巴巴达摩院推出的视觉语言模型系列,基于Qwen大语言模型扩展而来,采用ViT视觉编码器与Qwen语言模型的组合架构,通过位置感知的视觉-语言适配器实现跨模态对齐
VLM(视觉语言模型)通常由视觉编码器(如ViT)、语言模型和连接两者的投影层组成,代表性模型包括GPT-4V/4o、Claude 3.5、LLaVA系列和InternVL
Timeline (last 90 days)
Qwen系列的多分支包括针对代码场景继续预训练的CodeQwen以及融合视觉编码器的多模态版本Qwen-VL
MiMo-V2.6的具体基准测试成绩及与同类开源全模态模型(如Qwen-VL系列)的横向对比仍有待检验
阿里巴巴此前发布了 Qwen-Audio 和 Qwen-VL 系列模型
VLM 是在传统 LLM 基础上融合了视觉编码器的多模态模型,典型代表包括 LLaVA、Qwen-VL、InternVL
主流开源多模态模型上下文长度通常在4K到32K之间,LLaVA-1.5为4096 token,Qwen-VL为8192 token,InternVL2扩展到32K
InternVL2、Qwen-VL等专注文档理解的主流开源模型参数量多在3B至72B区间
代表性的VLM包括OpenAI的GPT-4o、Google的Gemini系列以及阿里巴巴的Qwen-VL系列
Qwen-VL是阿里巴巴达摩院推出的视觉语言模型系列,基于Qwen大语言模型扩展而来,采用ViT视觉编码器与Qwen语言模型的组合架构,通过位置感知的视觉-语言适配器实现跨模态对齐
Qwen-VL系列模型采用了动态分辨率输入机制,能够处理不同尺寸的图像而无需强制缩放
All Facts (17)
GPT-4V、Claude 3、Gemini是现代多模态大模型的代表,能够同时处理文本、图像等多种数据类型
90%VerifiedQwen-VL是阿里巴巴达摩院推出的视觉语言模型系列,基于Qwen大语言模型扩展而来,采用ViT视觉编码器与Qwen语言模型的组合架构,通过位置感知的视觉-语言适配器实现跨模态对齐
85%VerifiedVLM(视觉语言模型)通常由视觉编码器(如ViT)、语言模型和连接两者的投影层组成,代表性模型包括GPT-4V/4o、Claude 3.5、LLaVA系列和InternVL
80%Verified千问视觉模型(Qwen-VL系列)是阿里云通义团队推出的多模态大模型,能够同时理解文本和图像输入
75%VerifiedQwen-VL系列模型采用了动态分辨率输入机制,能够处理不同尺寸的图像而无需强制缩放
70%Verified开源多模态模型LLaVA、InternVL、Qwen-VL通常采用'视觉编码器+投影层+语言模型'的架构
70%VerifiedTransformers框架支持的文本模型包括GPT、BERT、LLaMA、T5等,视觉模型包括ViT、CLIP、Stable Diffusion等,音频模型包括Whisper、Wav2Vec等,多模态模型包括LLaVA、Qwen-VL等
65%UnverifiedQwen-VL和InternVL分别来自阿里和上海AI Lab,代表国内多模态领域的前沿水平
90%Unverified阿里的Qwen-VL和智谱的CogVLM/GLM-4V是中文领域代表性的多模态模型
90%Unverified开源多模态模型包括LLaVA、MiniCPM-V、InternVL、Qwen-VL等
60%UnverifiedQwen系列的多分支包括针对代码场景继续预训练的CodeQwen以及融合视觉编码器的多模态版本Qwen-VL
50%UnverifiedMiMo-V2.6的具体基准测试成绩及与同类开源全模态模型(如Qwen-VL系列)的横向对比仍有待检验
50%Unverified阿里巴巴此前发布了 Qwen-Audio 和 Qwen-VL 系列模型
50%UnverifiedVLM 是在传统 LLM 基础上融合了视觉编码器的多模态模型,典型代表包括 LLaVA、Qwen-VL、InternVL
50%Unverified主流开源多模态模型上下文长度通常在4K到32K之间,LLaVA-1.5为4096 token,Qwen-VL为8192 token,InternVL2扩展到32K
50%UnverifiedInternVL2、Qwen-VL等专注文档理解的主流开源模型参数量多在3B至72B区间
50%Unverified代表性的VLM包括OpenAI的GPT-4o、Google的Gemini系列以及阿里巴巴的Qwen-VL系列
50%