[KongchangAI]
Benchmark

F1-R²

为TestHallVQA基准配套设计的评估指标,联合量化大视觉语言模型的计算推理能力与文档级冗余下的证据检索鲁棒性,提供比传统F1分数更细粒度的模型能力诊断

Timeline (last 90 days)

Sep 15

研究团队提出了新的评估指标 F1-R²,用于联合量化计算推理能力与文档级冗余下的证据检索鲁棒性

Unverified50%

All Facts (1)

Source Articles