Concept大视觉语言模型 / Large Vision-Language Models
LVLMs
能够同时处理图像与文本输入的大型多模态模型,支持视觉问答、图文理解等任务,是多模态AI领域的核心研究方向
Timeline (last 90 days)
Sep 15
研究通过理论分析证明,无关视觉 token 的干扰会导致大视觉语言模型可测量的性能下降
Unverified50%
Sep 15
研究者在主流 LVLMs 上进行了实验,结果显示当前顶级模型在面对同时具备长文档规模与冗余干扰的任务时表现远未达到理想水平
Unverified50%
Sep 15
作者认为抗干扰能力的评估可能成为多模态模型下一阶段的重要竞争维度
Unverified50%