Qwen-VL是阿里巴巴研发的视觉语言大模型,属于通义千问(Qwen)系列的多模态分支。该模型能够同时理解图像与文本输入,支持图文问答、视觉推理、图像描述生成、文档理解及GUI交互等多种任务,具备较强的中英文双语视觉理解能力,可应用于智能助手、自动化代理等场景。
开源多模态模型包括LLaVA、MiniCPM-V、InternVL、Qwen-VL等