Llava
LLaVA(Large Language and Vision Assistant)是一种开源多模态大语言模型,由视觉编码器与大型语言模型组合构成。它能够同时理解图像与文本输入,支持视觉问答、图像描述生成、多轮视觉对话等任务。LLaVA采用指令微调训练方式,具备较强的视觉语言对齐能力,广泛用于多模态研究与应用开发领域。
Timeline (last 90 days)
开源多模态模型包括LLaVA、MiniCPM-V、InternVL、Qwen-VL等
项目收录了GPT-4V、Gemini、LLaVA、Qwen-VL等模型的相关论文、教程和实践指南
LLaVA(Large Language and Vision Assistant)是学术界最具影响力的开源视觉语言模型之一
LLaVA采用视觉指令微调方法,将预训练的CLIP视觉编码器与LLaMA语言模型桥接,以相对低廉的训练成本实现了接近GPT-4V的多模态理解能力
LLaVA用一个简单的线性层连接视觉编码器和语言模型,证明了视觉指令微调的有效性
开源多模态模型LLaVA、InternVL、Qwen-VL通常采用'视觉编码器+投影层+语言模型'的架构
VLM(视觉语言模型)通常由视觉编码器(如ViT)、语言模型和连接两者的投影层组成,代表性模型包括GPT-4V/4o、Claude 3.5、LLaVA系列和InternVL
Transformers框架支持的文本模型包括GPT、BERT、LLaMA、T5等,视觉模型包括ViT、CLIP、Stable Diffusion等,音频模型包括Whisper、Wav2Vec等,多模态模型包括LLaVA、Qwen-VL等
MiniMind-V的整体架构设计参考了LLaVA(Large Language and Vision Assistant)的经典范式
LLaVA的训练分为两个阶段:第一阶段是预训练对齐(冻结视觉编码器和语言模型,仅训练投影层),第二阶段是指令微调(解冻语言模型进行端到端训练)
4 more timeline events