[KongchangAI]
ModelLLaVA

Llava

LLaVA(Large Language and Vision Assistant)是一种开源多模态大语言模型,由视觉编码器与大型语言模型组合构成。它能够同时理解图像与文本输入,支持视觉问答、图像描述生成、多轮视觉对话等任务。LLaVA采用指令微调训练方式,具备较强的视觉语言对齐能力,广泛用于多模态研究与应用开发领域。

Source Articles