基准
F1-R²
为TestHallVQA基准配套设计的评估指标,联合量化大视觉语言模型的计算推理能力与文档级冗余下的证据检索鲁棒性,提供比传统F1分数更细粒度的模型能力诊断
时间轴 (近 90 天)
9月15日
研究团队提出了新的评估指标 F1-R²,用于联合量化计算推理能力与文档级冗余下的证据检索鲁棒性
待验证50%
为TestHallVQA基准配套设计的评估指标,联合量化大视觉语言模型的计算推理能力与文档级冗余下的证据检索鲁棒性,提供比传统F1分数更细粒度的模型能力诊断
研究团队提出了新的评估指标 F1-R²,用于联合量化计算推理能力与文档级冗余下的证据检索鲁棒性