ModelQwen3 VL / Qwen3视觉语言模型
Qwen3-VL
阿里巴巴通义千问系列的视觉语言多模态大模型,采用视觉编码器(Vision Encoder)+ 大语言模型的架构,支持图片、视频等多模态输入,已开源
Timeline (last 90 days)
Sep 12
MiniMax H3的权重总计67GB,包括34GB的DiT主干、27GB的Qwen3-VL编码器加上VAE
Unverified50%
Sep 12
Qwen3-VL 是通义千问团队推出的多模态大模型
Unverified50%
Sep 12
Qwen3-VL 属于典型的分离式视觉大模型,以语言大模型为底座,前端接入 Vision Encoder
Unverified50%
Sep 11
对视觉大模型做下游任务微调时,可选择只微调后端LLM、只微调前端Encoder、两部分都训练,或指定训练特定层和模块
Unverified50%
Aug 5
Qwen-VL系列模型采用了动态分辨率输入机制,能够处理不同尺寸的图像而无需强制缩放
Unverified50%