[控场AI]
基准TestHallVQA-benchmark

TestHallVQA

面向大视觉语言模型的多图VQA评测基准,融合文档级规模、人类考试难度与可控上下文冗余注入,系统量化无关视觉token干扰效应,并配套F1-R²评估指标

时间轴 (近 90 天)

9月15日

TestHallVQA 是一个多图 VQA 基准,结合了文档级规模、人类考试级别的难度以及可控的上下文冗余注入

待验证50%
9月15日

TestHallVQA 取材自科学考试场景

待验证50%
9月15日

研究团队提出了新的评估指标 F1-R²,用于联合量化计算推理能力与文档级冗余下的证据检索鲁棒性

待验证50%
9月15日

在此研究之前,学界很少对无关视觉 token 造成的性能退化现象进行系统的量化

待验证50%
9月15日

研究者在主流 LVLMs 上进行了实验,结果显示当前顶级模型在面对同时具备长文档规模与冗余干扰的任务时表现远未达到理想水平

待验证50%
9月15日

TestHallVQA 的相关数据集、代码及理论推导已在 GitHub 开源,地址为 github.com/yqyu2317/TestHallVQA-benchmark

待验证50%

全部知识事实 (6)

来源文章