[控场AI]
模型Qwen3 VL / Qwen3视觉语言模型

Qwen3-VL

阿里巴巴通义千问系列的视觉语言多模态大模型,采用视觉编码器(Vision Encoder)+ 大语言模型的架构,支持图片、视频等多模态输入,已开源

时间轴 (近 90 天)

9月12日

MiniMax H3的权重总计67GB,包括34GB的DiT主干、27GB的Qwen3-VL编码器加上VAE

待验证50%
9月12日

Qwen3-VL 是通义千问团队推出的多模态大模型

待验证50%
9月12日

Qwen3-VL 属于典型的分离式视觉大模型,以语言大模型为底座,前端接入 Vision Encoder

待验证50%
9月11日

对视觉大模型做下游任务微调时,可选择只微调后端LLM、只微调前端Encoder、两部分都训练,或指定训练特定层和模块

待验证50%
8月5日

Qwen-VL系列模型采用了动态分辨率输入机制,能够处理不同尺寸的图像而无需强制缩放

待验证50%

全部知识事实 (5)

来源文章