共 2 篇相关文章
Q2D-Web 检索评测数据集结合 1.9 亿网页文档、6.9 万条 agent 重构查询与平均每查询 99.6 个正相关判断,通过大规模语料与深度相关性标注减少假阴性,为检索与 RAG 研究提供更真实的评测基准。
Q2D-Web 采用智能体引用、生产网页排名与 LLM 扩展的三套相关性集合,减少检索评测中的假阴性和单一标注依赖,并检验相关性定义如何影响模型表现。