Concept视觉编码器 / 视觉Encoder
Vision Encoder
多模态大模型中负责处理视觉输入的编码器模块,将图片或视频帧转换为大语言模型可理解的Token序列,实现视觉空间到语义空间的对齐,通常基于ViT架构实现
Core Facts
Timeline (last 90 days)
Sep 12
Vision Encoder 的核心作用是对齐(alignment),即把视觉空间的信息映射到大语言模型的语义空间
Unverified50%
Sep 11
Qwen的视觉大模型主要基于语言大模型前接Vision Encoder,处理语音的模型则前接语音Encoder,视觉与语言模型仍相对分离
Unverified50%
Sep 1
多模态模型的视觉能力通常通过视觉编码器实现,常见方案包括ViT或SigLIP等预训练视觉模型
Unverified50%