Q2D-Web
面向Agent查询重构评测的真实生产环境数据集,包含23,000条去除个人身份信息的搜索记录,覆盖十种语言和数十个领域,用于评估智能体将用户请求转化为有效检索查询的能力
时间轴 (近 90 天)
Q2D-Web 数据集包含1.9亿(190M)网页文档构成的语料库
本文基于单一来源的简要披露整理,Q2D-Web的完整构建方法、具体基准结果与数据可用性仍有待更多官方资料确认
使用agent自动完成查询重构既能规模化生成近7万条查询又能保持查询的语义质量
Q2D-Web 的组合集合中平均每条查询有99.6个正相关性判断
Q2D-Web 数据集包含69,721条由agent重构的查询
智能体引用是指AI智能体在完成检索任务时主动选择并引用的网页内容,被视为一种隐式相关性信号
Q2D-Web 引入了三套相互独立的相关性判断集合来交叉验证检索结果的质量
Q2D-Web 的三套相关性集合分别是智能体引用、生产环境的网页排名以及经由大语言模型判断扩展的组合集合
Q2D-Web 的核心动机之一是降低假阴性(false negatives)
在Q2D-Web中,一份文档只要在任意一个可靠信号中被认定相关,就不会被轻易判为无关
还有 12 条时间轴事件
全部知识事实 (20)
Q2D-Web 数据集包含1.9亿(190M)网页文档构成的语料库
50%待验证本文基于单一来源的简要披露整理,Q2D-Web的完整构建方法、具体基准结果与数据可用性仍有待更多官方资料确认
50%待验证使用agent自动完成查询重构既能规模化生成近7万条查询又能保持查询的语义质量
50%待验证Q2D-Web 的组合集合中平均每条查询有99.6个正相关性判断
50%待验证Q2D-Web 数据集包含69,721条由agent重构的查询
50%待验证智能体引用是指AI智能体在完成检索任务时主动选择并引用的网页内容,被视为一种隐式相关性信号
50%待验证Q2D-Web 引入了三套相互独立的相关性判断集合来交叉验证检索结果的质量
50%待验证Q2D-Web 的三套相关性集合分别是智能体引用、生产环境的网页排名以及经由大语言模型判断扩展的组合集合
50%待验证Q2D-Web 的核心动机之一是降低假阴性(false negatives)
50%待验证在Q2D-Web中,一份文档只要在任意一个可靠信号中被认定相关,就不会被轻易判为无关
50%待验证Q2D-Web 承担的一个研究目的是检验相关性定义的差异本身会如何影响模型表现
50%待验证在Q2D-Web中,LLM判断被设计为三套集合之一而非唯一依据,以警惕LLM判断本身可能引入的偏差
50%待验证对于开发检索或RAG系统的团队,不应把模型评测结果绑定在单一标注体系上,多角度交叉验证才能得到更可信的性能判断
50%待验证Q2D-Web 的数据在采集阶段就完成了个人身份信息的剥离
50%待验证Q2D-Web 的数据取自真实的生产环境搜索行为,而非人工编造或模型生成的查询
50%待验证在 Q2D-Web 中,每一条查询都被独立评估,拥有各自的相关性判断(relevance judgments)
50%待验证将主查询与支持查询分开评判可以将Agent的查询规划能力拆解为可量化的子任务,便于定位失败源于意图误解还是信息补全策略不足
50%待验证关于Q2D-Web数据集的具体构建流程、标注标准以及配套的基线模型结果等细节尚未在公开素材中充分展开
50%待验证Q2D-Web 数据集在长达九个月的周期内持续采集
50%待验证Q2D-Web 数据集覆盖十种语言和数十个领域
50%