模型Qwen3 VL / Qwen3视觉语言模型
Qwen3-VL
阿里巴巴通义千问系列的视觉语言多模态大模型,采用视觉编码器(Vision Encoder)+ 大语言模型的架构,支持图片、视频等多模态输入,已开源
时间轴 (近 90 天)
9月12日
MiniMax H3的权重总计67GB,包括34GB的DiT主干、27GB的Qwen3-VL编码器加上VAE
待验证50%
9月12日
Qwen3-VL 是通义千问团队推出的多模态大模型
待验证50%
9月12日
Qwen3-VL 属于典型的分离式视觉大模型,以语言大模型为底座,前端接入 Vision Encoder
待验证50%
9月11日
对视觉大模型做下游任务微调时,可选择只微调后端LLM、只微调前端Encoder、两部分都训练,或指定训练特定层和模块
待验证50%
8月5日
Qwen-VL系列模型采用了动态分辨率输入机制,能够处理不同尺寸的图像而无需强制缩放
待验证50%