[KongchangAI]
ModelLLaVA

Llava

LLaVA(Large Language and Vision Assistant)是一种开源多模态大语言模型,由视觉编码器与大型语言模型组合构成。它能够同时理解图像与文本输入,支持视觉问答、图像描述生成、多轮视觉对话等任务。LLaVA采用指令微调训练方式,具备较强的视觉语言对齐能力,广泛用于多模态研究与应用开发领域。

Timeline (last 90 days)

Jun 1

开源多模态模型包括LLaVA、MiniCPM-V、InternVL、Qwen-VL等

Unverified60%
Jun 1

项目收录了GPT-4V、Gemini、LLaVA、Qwen-VL等模型的相关论文、教程和实践指南

Unverified80%
Jun 1

LLaVA(Large Language and Vision Assistant)是学术界最具影响力的开源视觉语言模型之一

Verified75%
Jun 1

LLaVA采用视觉指令微调方法,将预训练的CLIP视觉编码器与LLaMA语言模型桥接,以相对低廉的训练成本实现了接近GPT-4V的多模态理解能力

Unverified85%
Jun 1

LLaVA用一个简单的线性层连接视觉编码器和语言模型,证明了视觉指令微调的有效性

Partially Verified65%
Jun 1

开源多模态模型LLaVA、InternVL、Qwen-VL通常采用'视觉编码器+投影层+语言模型'的架构

Verified70%
Jun 1

VLM(视觉语言模型)通常由视觉编码器(如ViT)、语言模型和连接两者的投影层组成,代表性模型包括GPT-4V/4o、Claude 3.5、LLaVA系列和InternVL

Verified80%
Jun 1

Transformers框架支持的文本模型包括GPT、BERT、LLaMA、T5等,视觉模型包括ViT、CLIP、Stable Diffusion等,音频模型包括Whisper、Wav2Vec等,多模态模型包括LLaVA、Qwen-VL等

Unverified95%
Jun 1

MiniMind-V的整体架构设计参考了LLaVA(Large Language and Vision Assistant)的经典范式

Unverified55%
Jun 1

LLaVA的训练分为两个阶段:第一阶段是预训练对齐(冻结视觉编码器和语言模型,仅训练投影层),第二阶段是指令微调(解冻语言模型进行端到端训练)

Unverified90%

4 more timeline events

Source Articles