[KongchangAI]
ModelQwen3 VL / Qwen3视觉语言模型

Qwen3-VL

阿里巴巴通义千问系列的视觉语言多模态大模型,采用视觉编码器(Vision Encoder)+ 大语言模型的架构,支持图片、视频等多模态输入,已开源

Timeline (last 90 days)

Sep 12

MiniMax H3的权重总计67GB,包括34GB的DiT主干、27GB的Qwen3-VL编码器加上VAE

Unverified50%
Sep 12

Qwen3-VL 是通义千问团队推出的多模态大模型

Unverified50%
Sep 12

Qwen3-VL 属于典型的分离式视觉大模型,以语言大模型为底座,前端接入 Vision Encoder

Unverified50%
Sep 11

对视觉大模型做下游任务微调时,可选择只微调后端LLM、只微调前端Encoder、两部分都训练,或指定训练特定层和模块

Unverified50%
Aug 5

Qwen-VL系列模型采用了动态分辨率输入机制,能够处理不同尺寸的图像而无需强制缩放

Unverified50%

All Facts (5)

Source Articles