Benchmark
F1-R²
为TestHallVQA基准配套设计的评估指标,联合量化大视觉语言模型的计算推理能力与文档级冗余下的证据检索鲁棒性,提供比传统F1分数更细粒度的模型能力诊断
Timeline (last 90 days)
Sep 15
研究团队提出了新的评估指标 F1-R²,用于联合量化计算推理能力与文档级冗余下的证据检索鲁棒性
Unverified50%
为TestHallVQA基准配套设计的评估指标,联合量化大视觉语言模型的计算推理能力与文档级冗余下的证据检索鲁棒性,提供比传统F1分数更细粒度的模型能力诊断
研究团队提出了新的评估指标 F1-R²,用于联合量化计算推理能力与文档级冗余下的证据检索鲁棒性