基准TestHallVQA-benchmark
TestHallVQA
面向大视觉语言模型的多图VQA评测基准,融合文档级规模、人类考试难度与可控上下文冗余注入,系统量化无关视觉token干扰效应,并配套F1-R²评估指标
时间轴 (近 90 天)
9月15日
TestHallVQA 是一个多图 VQA 基准,结合了文档级规模、人类考试级别的难度以及可控的上下文冗余注入
待验证50%
9月15日
TestHallVQA 取材自科学考试场景
待验证50%
9月15日
研究团队提出了新的评估指标 F1-R²,用于联合量化计算推理能力与文档级冗余下的证据检索鲁棒性
待验证50%
9月15日
在此研究之前,学界很少对无关视觉 token 造成的性能退化现象进行系统的量化
待验证50%
9月15日
研究者在主流 LVLMs 上进行了实验,结果显示当前顶级模型在面对同时具备长文档规模与冗余干扰的任务时表现远未达到理想水平
待验证50%
9月15日
TestHallVQA 的相关数据集、代码及理论推导已在 GitHub 开源,地址为 github.com/yqyu2317/TestHallVQA-benchmark
待验证50%
全部知识事实 (6)
待验证
TestHallVQA 是一个多图 VQA 基准,结合了文档级规模、人类考试级别的难度以及可控的上下文冗余注入
50%待验证TestHallVQA 取材自科学考试场景
50%待验证研究团队提出了新的评估指标 F1-R²,用于联合量化计算推理能力与文档级冗余下的证据检索鲁棒性
50%待验证在此研究之前,学界很少对无关视觉 token 造成的性能退化现象进行系统的量化
50%待验证研究者在主流 LVLMs 上进行了实验,结果显示当前顶级模型在面对同时具备长文档规模与冗余干扰的任务时表现远未达到理想水平
50%待验证TestHallVQA 的相关数据集、代码及理论推导已在 GitHub 开源,地址为 github.com/yqyu2317/TestHallVQA-benchmark
50%