[控场AI]
概念大视觉语言模型 / Large Vision-Language Models

LVLMs

能够同时处理图像与文本输入的大型多模态模型,支持视觉问答、图文理解等任务,是多模态AI领域的核心研究方向

时间轴 (近 90 天)

9月15日

研究通过理论分析证明,无关视觉 token 的干扰会导致大视觉语言模型可测量的性能下降

待验证50%
9月15日

研究者在主流 LVLMs 上进行了实验,结果显示当前顶级模型在面对同时具备长文档规模与冗余干扰的任务时表现远未达到理想水平

待验证50%
9月15日

作者认为抗干扰能力的评估可能成为多模态模型下一阶段的重要竞争维度

待验证50%

全部知识事实 (3)

来源文章