[KongchangAI]
Concept视觉编码器 / 视觉Encoder

Vision Encoder

多模态大模型中负责处理视觉输入的编码器模块,将图片或视频帧转换为大语言模型可理解的Token序列,实现视觉空间到语义空间的对齐,通常基于ViT架构实现

Core Facts

Timeline (last 90 days)

Sep 12

Vision Encoder 的核心作用是对齐(alignment),即把视觉空间的信息映射到大语言模型的语义空间

Unverified50%
Sep 11

Qwen的视觉大模型主要基于语言大模型前接Vision Encoder,处理语音的模型则前接语音Encoder,视觉与语言模型仍相对分离

Unverified50%
Sep 1

多模态模型的视觉能力通常通过视觉编码器实现,常见方案包括ViT或SigLIP等预训练视觉模型

Unverified50%

All Facts (4)

Source Articles