HybridDeepResearch:首个混合深度研究基准揭示AI智能体跨模态整合瓶颈

深度研究智能体的现实困境
近年来,自主智能体(autonomous agents)在"深度研究"领域取得了长足进步。自主智能体是指能够感知环境、做出决策并自主执行行动以达成目标的AI系统——与传统的单轮问答模型不同,这类智能体具备多步推理、工具调用和环境交互能力。在"深度研究"场景中,它们通常采用ReAct(Reasoning + Acting)或类似的思维-行动循环框架,能够自主决定下一步该搜索什么、该查询什么、如何综合已获取的信息。OpenAI的Deep Research、Google的Gemini Deep Research等产品都是这一方向的代表。它们能够迭代式地浏览开放网络,综合来自不同网页的信息,最终形成对复杂问题的回答。然而,真实世界的问题求解从来不会局限于单一环境。
来自Snowflake AI Research的最新论文《Benchmarking Hybrid Deep Research Across Database Querying and Web Search》(arXiv:2609.09410)指出了一个关键问题:复杂的分析任务本质上要求智能体能够将来自模糊的非结构化文本(如开放网络)和高度精确的结构化数据(如关系型数据库)的证据编织在一起。
这里有必要理解两类数据的本质差异:结构化数据是按照预定义模式(schema)组织的数据,典型代表是关系型数据库中的表格数据,可以通过SQL进行精确查询,返回的结果具有确定性和可重复性。非结构化数据则包括网页文本、新闻文章、社交媒体帖子等,它们没有固定格式,信息密度不均匀,且往往包含歧义、冗余和噪声。SQL查询返回的是精确匹配的记录,而网络搜索返回的是按相关性排序的近似结果——这种本质差异正是混合推理任务的难点所在。
现实中的分析师每天都在做这样的事情——他们既要查询公司数据库获取精确的交易记录,又要在网络上搜索背景信息、新闻和行业动态,然后将两类信息整合成一个完整的结论。但现有的评测基准却将这两种模态孤立地进行评估,无法捕捉到其中最关键的"交接"(handoff)环节。

什么是智能体的"交接"能力?
研究团队强调的"交接"能力,指的是在不同系统之间移动证据时保持约束条件的能力。这是一个被以往研究严重低估的挑战。
举个例子:假设你需要回答"我们公司去年营收排名前三的产品,在社交媒体上的舆论评价如何?"这个任务就要求智能体首先通过SQL查询数据库找出"营收前三的产品"(结构化数据),然后带着这个精确的约束条件去网络上搜索相关评价(非结构化数据)。
在这个过程中,智能体必须准确地把数据库查询出的产品名称传递到网络搜索环节,不能丢失、篡改或模糊化这些约束。这个问题可以类比于软件工程中的"数据管道"概念——在多步推理中,每一步的输出都是下一步的输入,任何一个环节的信息损耗都会沿链条传播甚至放大,类似于信号处理中的噪声累积效应。在智能体系统中,信息损耗的典型表现包括:模型在将SQL查询结果转化为搜索关键词时丢失了精确的数值约束(如"营收前三"变成了"高营收")、实体名称在传递过程中发生微妙变形(如缩写展开或拼写变化)、时间范围等限定条件在跨步骤传递时被遗忘。这类问题的根源在于当前大语言模型依赖自然语言作为中间表示,而自然语言天然具有模糊性,不像程序语言那样能精确保持语义不变。一旦在"交接"过程中出现信息损耗,整个答案就会偏离正确方向。这正是当前AI智能体系统所面临的核心难题。
HybridDeepResearch 基准的设计详解
为了系统性地评测这一能力,研究团队提出了 HybridDeepResearch——据他们所知,这是首个同时要求网络搜索和SQL查询才能形成完整、可验证答案的深度研究基准。
数据规模与构建方式
该基准包含 380个工具依赖型任务,这些任务基于 LiveSQLBench-Base-Lite 数据库和公开的网络语料库构建。LiveSQLBench是一个专门用于评估大语言模型SQL生成能力的基准测试集,使用真实世界的数据库场景来测试模型将自然语言问题转化为正确SQL查询的能力。HybridDeepResearch在此基础上进行了创新性扩展,将SQL查询任务与网络搜索任务耦合在一起。
所有任务都经过了自动化检查与人工审核的双重验证——自动化检查确保每个任务确实需要两种工具才能完成(而非仅用一种工具就能回答),人工审核则验证答案的正确性和任务描述的清晰性。380个任务的规模在研究性基准中属于中等,但由于每个任务都需要跨模态推理,其评测价值远高于简单扩大数据量。
三种核心推理模式
基准覆盖了三种不同的推理模式,这是其设计的精髓所在:
- SQL2S(SQL到搜索):先进行SQL查询,再带着结果去网络搜索(从结构化到非结构化的定向推理)
- S2SQL(搜索到SQL):先进行网络搜索,再将结果用于SQL查询(从非结构化到结构化的定向推理)
- Parallel(并行模式):并行地从两个信息源获取证据,最后进行交叉验证
这三种模式的区分非常重要,因为它们分别代表了不同难度和不同类型的跨模态整合挑战。SQL2S要求模型在获得精确的数据库结果后,能够将其有效地转化为网络搜索策略;S2SQL则要求模型从模糊的网络信息中提取出足够精确的条件来构造SQL查询;而Parallel模式考验的是模型同时管理两条独立信息流并最终进行交叉验证的能力。
顶级模型也仅过半:评测结果深度剖析
研究团队在专有模型和开源权重模型上,使用多种智能体框架(agentic scaffolds)进行了广泛的评测。智能体框架是指围绕大语言模型构建的系统性架构,它定义了模型如何感知环境、规划行动、调用工具和整合结果。这些框架通常包含几个核心组件:任务规划器(将复杂问题分解为子任务)、工具调用接口(连接搜索引擎、数据库等外部系统)、记忆模块(维护对话历史和中间结果)以及反思机制(评估当前进展并调整策略)。不同的框架设计会显著影响智能体的表现,例如是否支持回溯、是否能动态调整计划、工具调用的粒度等都是关键设计选择。
评测结果令人深思。即便是当前最先进的模型——如 GLM-5.2、Claude-Sonnet-4.6 和 GPT-5——在困难子集上的 Pass@8 也仅达到约 50-54%。
Pass@k是源自代码生成领域的评测指标,最初由OpenAI在Codex论文中广泛使用。它表示在k次独立尝试中至少有一次成功的概率。Pass@8约为50-54%意味着,即使给模型8次独立生成答案的机会(每次可能采取不同的推理路径和工具调用策略),也只有约一半的困难任务能被至少解决一次。由于这个指标比Pass@1(单次尝试成功率)更宽松,50-54%的Pass@8实际上暗示着单次尝试的成功率远低于此——这说明问题不仅仅是采样运气问题,而是模型在能力上存在系统性不足。
这个数字清晰地表明,尽管单项能力(无论是纯网络搜索还是纯SQL查询)已经相当成熟,但将两者有效结合仍然是一道难以逾越的门槛。
定向推理比并行交叉验证更难
一个特别值得注意的发现是:定向推理(directional reasoning)明显比并行交叉(parallel intersection)更困难。
这意味着 SQL2S 和 S2SQL 这类需要严格顺序、需要将一个环节的精确输出作为下一个环节输入的任务,对智能体构成了更大的挑战。相比之下,并行获取证据后再做交集的任务反而相对容易。
其背后的逻辑不难理解:在定向推理中,前一步的约束必须被完整无损地传递到后一步,任何信息损耗都会沿着推理链放大——这在复杂系统理论中被称为"级联失败"(cascading failure),一个环节的小偏差可能导致下游环节的严重错误。而并行模式下,两个信息源相对独立,最后只需做交集验证,容错空间更大。这一发现也与人类认知科学中的研究一致:顺序依赖的推理任务往往比可以并行处理的任务更容易出错,因为工作记忆需要在步骤间精确维护上下文信息。
对AI智能体行业的实践启示
这项研究揭示了当前智能体系统的一个根本性短板:在不损失约束条件的前提下,跨越结构化与非结构化信息空间,仍然是智能体系统面临的一大未解难题。
对于正在构建企业级AI应用的团队而言,这一发现具有重要的实践意义。许多企业场景(商业智能分析、合规审查、市场研究等)本质上都是混合型任务,既需要查询内部数据库,又需要检索外部信息。以合规审查为例,审查人员需要从内部交易数据库中识别异常交易模式(结构化查询),然后在监管公告、新闻报道和行业指引中确认这些模式是否构成违规(非结构化检索),最后将两者综合形成审查意见。如果智能体在"交接"环节频繁出错,那么它在这些高价值场景中的可靠性就值得怀疑。
这也为未来的研究方向指明了道路:如何设计更鲁棒的约束传递机制、如何在多工具调用之间保持上下文一致性,将成为智能体研究的重要课题。潜在的解决方案可能包括:引入形式化的中间表示语言替代自然语言进行跨步骤信息传递、设计专门的约束验证模块在每次"交接"时检查信息完整性、以及利用强化学习训练智能体在多步推理中更好地保持约束一致性。
开放资源与社区参与
值得肯定的是,研究团队秉持开放精神,将代码和数据集完全公开:
- GitHub:https://github.com/Snowflake-AI-Research/HybridDeepResearch
- Hugging Face:https://huggingface.co/datasets/Snowflake/HybridDeepResearch
这为社区进一步研究混合深度研究任务、改进智能体的跨模态整合能力提供了宝贵的基础设施。开放基准在AI研究中具有重要的催化作用——正如ImageNet推动了计算机视觉的快速发展、SQuAD推动了阅读理解能力的提升一样,HybridDeepResearch有望成为推动混合推理智能体进步的关键标杆。随着越来越多的研究者在这一基准上进行评测和优化,我们有理由期待下一代智能体能够真正胜任那些需要融合多源信息的复杂现实任务。
核心要点
相关推荐

AI急诊分诊如何落地:印度母婴医疗的可审计实践
印度Noora Health将端到端LLM分诊系统重构为两阶段流水线:LLM提取症状+确定性规则引擎决策,召回率从56.5%提升至81%,已完成15万+条患者查询分诊,实现准确率与可审计性双赢。

Cursor低价订阅陷阱揭秘:破解服务的营销套路分析
深度拆解Cursor低价订阅服务的运作逻辑与风险隐患。从账号池模式、宣传话术到数据安全,帮助开发者识别灰色产品陷阱,建立理性消费观念。

用Claude做独立游戏:AI辅助开发全流程实录
一位独立开发者借助Claude等AI工具打造了《No Name Squish Game》,从编程加速、内容生成到PWA即点即玩,展示了AI辅助独立游戏开发的完整实践路径与人机协作的理想姿态。