BenchmarkTestHallVQA-benchmark
TestHallVQA
面向大视觉语言模型的多图VQA评测基准,融合文档级规模、人类考试难度与可控上下文冗余注入,系统量化无关视觉token干扰效应,并配套F1-R²评估指标
Timeline (last 90 days)
Sep 15
TestHallVQA 是一个多图 VQA 基准,结合了文档级规模、人类考试级别的难度以及可控的上下文冗余注入
Unverified50%
Sep 15
TestHallVQA 取材自科学考试场景
Unverified50%
Sep 15
研究团队提出了新的评估指标 F1-R²,用于联合量化计算推理能力与文档级冗余下的证据检索鲁棒性
Unverified50%
Sep 15
在此研究之前,学界很少对无关视觉 token 造成的性能退化现象进行系统的量化
Unverified50%
Sep 15
研究者在主流 LVLMs 上进行了实验,结果显示当前顶级模型在面对同时具备长文档规模与冗余干扰的任务时表现远未达到理想水平
Unverified50%
Sep 15
TestHallVQA 的相关数据集、代码及理论推导已在 GitHub 开源,地址为 github.com/yqyu2317/TestHallVQA-benchmark
Unverified50%
All Facts (6)
Unverified
TestHallVQA 是一个多图 VQA 基准,结合了文档级规模、人类考试级别的难度以及可控的上下文冗余注入
50%UnverifiedTestHallVQA 取材自科学考试场景
50%Unverified研究团队提出了新的评估指标 F1-R²,用于联合量化计算推理能力与文档级冗余下的证据检索鲁棒性
50%Unverified在此研究之前,学界很少对无关视觉 token 造成的性能退化现象进行系统的量化
50%Unverified研究者在主流 LVLMs 上进行了实验,结果显示当前顶级模型在面对同时具备长文档规模与冗余干扰的任务时表现远未达到理想水平
50%UnverifiedTestHallVQA 的相关数据集、代码及理论推导已在 GitHub 开源,地址为 github.com/yqyu2317/TestHallVQA-benchmark
50%