[控场AI]
基准Q2D-Web数据集 / Query-to-Document Web Dataset

Q2D-Web

面向Agent查询重构评测的真实生产环境数据集,包含23,000条去除个人身份信息的搜索记录,覆盖十种语言和数十个领域,用于评估智能体将用户请求转化为有效检索查询的能力

时间轴 (近 90 天)

9月15日

Q2D-Web 数据集包含1.9亿(190M)网页文档构成的语料库

待验证50%
9月15日

本文基于单一来源的简要披露整理,Q2D-Web的完整构建方法、具体基准结果与数据可用性仍有待更多官方资料确认

待验证50%
9月15日

使用agent自动完成查询重构既能规模化生成近7万条查询又能保持查询的语义质量

待验证50%
9月15日

Q2D-Web 的组合集合中平均每条查询有99.6个正相关性判断

待验证50%
9月15日

Q2D-Web 数据集包含69,721条由agent重构的查询

待验证50%
9月15日

智能体引用是指AI智能体在完成检索任务时主动选择并引用的网页内容,被视为一种隐式相关性信号

待验证50%
9月15日

Q2D-Web 引入了三套相互独立的相关性判断集合来交叉验证检索结果的质量

待验证50%
9月15日

Q2D-Web 的三套相关性集合分别是智能体引用、生产环境的网页排名以及经由大语言模型判断扩展的组合集合

待验证50%
9月15日

Q2D-Web 的核心动机之一是降低假阴性(false negatives)

待验证50%
9月15日

在Q2D-Web中,一份文档只要在任意一个可靠信号中被认定相关,就不会被轻易判为无关

待验证50%

还有 12 条时间轴事件

全部知识事实 (20)

待验证

Q2D-Web 数据集包含1.9亿(190M)网页文档构成的语料库

50%
待验证

本文基于单一来源的简要披露整理,Q2D-Web的完整构建方法、具体基准结果与数据可用性仍有待更多官方资料确认

50%
待验证

使用agent自动完成查询重构既能规模化生成近7万条查询又能保持查询的语义质量

50%
待验证

Q2D-Web 的组合集合中平均每条查询有99.6个正相关性判断

50%
待验证

Q2D-Web 数据集包含69,721条由agent重构的查询

50%
待验证

智能体引用是指AI智能体在完成检索任务时主动选择并引用的网页内容,被视为一种隐式相关性信号

50%
待验证

Q2D-Web 引入了三套相互独立的相关性判断集合来交叉验证检索结果的质量

50%
待验证

Q2D-Web 的三套相关性集合分别是智能体引用、生产环境的网页排名以及经由大语言模型判断扩展的组合集合

50%
待验证

Q2D-Web 的核心动机之一是降低假阴性(false negatives)

50%
待验证

在Q2D-Web中,一份文档只要在任意一个可靠信号中被认定相关,就不会被轻易判为无关

50%
待验证

Q2D-Web 承担的一个研究目的是检验相关性定义的差异本身会如何影响模型表现

50%
待验证

在Q2D-Web中,LLM判断被设计为三套集合之一而非唯一依据,以警惕LLM判断本身可能引入的偏差

50%
待验证

对于开发检索或RAG系统的团队,不应把模型评测结果绑定在单一标注体系上,多角度交叉验证才能得到更可信的性能判断

50%
待验证

Q2D-Web 的数据在采集阶段就完成了个人身份信息的剥离

50%
待验证

Q2D-Web 的数据取自真实的生产环境搜索行为,而非人工编造或模型生成的查询

50%
待验证

在 Q2D-Web 中,每一条查询都被独立评估,拥有各自的相关性判断(relevance judgments)

50%
待验证

将主查询与支持查询分开评判可以将Agent的查询规划能力拆解为可量化的子任务,便于定位失败源于意图误解还是信息补全策略不足

50%
待验证

关于Q2D-Web数据集的具体构建流程、标注标准以及配套的基线模型结果等细节尚未在公开素材中充分展开

50%
待验证

Q2D-Web 数据集在长达九个月的周期内持续采集

50%
待验证

Q2D-Web 数据集覆盖十种语言和数十个领域

50%

来源文章