Iris搜索智能体:反向数据构建与SFT-RL交替训练实现多跳推理突破

Iris通过超链接反向构建多跳训练数据与SFT-RL交替训练,在多项搜索推理基准上刷新开源最强纪录。
Iris是一项搜索智能体研究,推出Iris-mini(35B-A3B)和Iris-pro(397B-A17B)两款基于MoE架构的模型。其核心创新包括两部分:一是从网页超链接结构反向构建多跳推理训练数据,通过描述性改写去除快捷方式、双重筛选确保样本难度落在模型"最近发展区";二是"SFT-RL climbing"交替训练策略,让RL阶段发现的高质量轨迹持续回哺SFT阶段,形成正向闭环。研究团队还特别强调了推理时上下文管理的重要性,指出其带来的性能提升超过多数系统间差异。最终,Iris-pro在BrowseComp、DeepSearchQA等四项主流基准上均达到开源最强水平,团队计划开放模型权重及完整方案。
Iris搜索智能体:反向数据构建与SFT-RL交替训练实现多跳推理突破
近日,一项名为Iris的搜索智能体研究引发了AI领域的广泛关注。该研究发布了Iris-mini和Iris-pro两个模型,分别在35B-A3B和397B-A17B规模上进行训练,在多个搜索推理基准测试中取得了开源模型中的最强表现。
值得注意的是,这里的参数标注方式(如35B-A3B)揭示了模型底层采用的Mixture-of-Experts(MoE,混合专家)架构。以35B-A3B为例,35B表示模型的总参数量为350亿,而A3B表示每次推理时实际激活的参数量仅为30亿。MoE架构通过设置多个并行的专家网络和一个门控机制(Router),在每次前向传播中只激活少量专家参与计算,从而在保持大模型容量和知识储备的同时大幅降低推理时的计算开销。这种架构已被DeepSeek、Mixtral等模型广泛采用,是在模型能力与推理效率之间取得平衡的主流技术路线。

反向构建训练数据:从超链接结构到多跳推理链
Iris的核心创新在于其独特的数据构建pipeline。研究团队从网页语料库的超链接结构出发,采用反向构建的方式生成训练任务。具体而言,他们从种子页面及其外链中提取实体图,在此基础上构建多跳推理链。
这里需要理解多跳推理(Multi-hop Reasoning)的概念:它是指模型需要跨越多个信息源、通过多步逻辑链条才能得出最终答案的推理能力。例如,要回答"创办了SpaceX的人毕业于哪所大学",模型需要先确定SpaceX的创办者是Elon Musk,再检索其教育背景。传统的单跳问答系统只能处理一步检索即可解决的问题,而多跳推理要求模型具备规划搜索路径、整合异构信息和维护推理链一致性的能力,是当前搜索智能体研究的核心挑战。
网页中的超链接本质上构成了一个大规模的有向图结构,每个网页是节点,超链接是边。这种结构天然蕴含了实体之间的语义关联——当一个页面链接到另一个页面时,通常意味着两者在主题或实体层面存在关联关系。Iris团队利用这一特性,从种子页面出发沿超链接遍历,提取页面中的关键实体并构建实体关系图。这种方法的巧妙之处在于,它不依赖预先构建好的知识图谱(如Wikidata或Freebase),而是直接从原始网页生态中挖掘结构化关系,确保数据分布更贴近真实搜索场景。
为了确保问题具备真实难度,团队对每个非答案实体进行了描述性改写,使其无法通过简单的字符串匹配解决。描述性改写(descriptive rewriting)是指将实体名称替换为对该实体的自然语言描述。例如,将问题中的"北京"替换为"中国的首都",使模型无法通过简单的关键词匹配或实体名称检索来走捷径。这种技术在数据增强和评测设计中被称为去快捷方式(shortcut removal),目的是迫使模型进行真正的语义理解和推理。
更关键的是,他们只保留那些参考模型在闭卷情况下无法回答、但在提供支持证据后能够正确解决的问题。闭卷(closed-book)筛选借鉴了知识密集型NLP任务的评估范式:如果模型不借助外部检索就能回答问题,说明问题对该模型来说不够有挑战性;如果提供证据后仍无法回答,说明问题超出了模型的能力边界。这种双重筛选确保了训练样本落在模型的"最近发展区"内,最大化学习效率。
SFT-RL交替攀升:监督微调与强化学习的闭环训练
在训练方法上,Iris采用了一种名为"SFT-RL climbing"的创新策略,将监督微调(SFT)和强化学习(RL)交替进行。
要理解这一策略的意义,首先需要了解SFT和RL在大语言模型训练中各自扮演的角色。监督微调(Supervised Fine-Tuning, SFT)是指在预训练模型基础上,使用标注好的输入-输出对进行进一步训练,使模型学会特定任务的格式和基本能力。强化学习(Reinforcement Learning, RL)则通过奖励信号引导模型在探索中发现更优策略,尤其适合优化那些难以用静态标注数据完全覆盖的复杂行为,例如多步搜索决策和工具调用序列。在大语言模型领域,OpenAI的InstructGPT和后续的RLHF(基于人类反馈的强化学习)流程开创了SFT后接RL的范式。Iris的创新在于将两者交替进行而非串行执行:RL阶段发现的高质量行为轨迹被回传给SFT阶段作为新的监督信号,形成一个不断攀升的正向循环。
在RL阶段,策略针对实时搜索进行优化,奖励判断器和观察摘要器直接部署在训练集群内部,从而显著提高训练效率。
对于过长的rollout,系统会在请求级别中断,并在下一步从已提交的前缀恢复,避免资源浪费。在强化学习的语境中,rollout指的是模型按照当前策略执行完整的交互序列——对于搜索智能体来说,就是从接收问题到给出最终答案的整个搜索、推理和工具调用过程。在实际训练中,搜索智能体的rollout可能非常长,因为模型可能进行数十次搜索查询和网页阅读。Iris的请求级中断恢复机制类似于操作系统中的检查点(checkpointing)技术:当一个rollout超过资源预算时,系统保存当前状态并中断,在下一个训练步骤中从保存的前缀状态恢复继续执行,而非丢弃已完成的部分计算。这种设计显著减少了GPU资源浪费,是大规模RL训练工程化的重要实践。
每轮RL训练结束后,研究团队将最难解决且最高效的rollout回传至下一轮监督学习中,形成持续提升的闭环。
推理时上下文管理:被低估的关键技术
研究团队特别强调了推理时上下文管理(inference-time context management)的重要性。他们指出,这项技术在基准测试中带来的提升幅度超过了大多数已报告的系统间差异,是一项被普遍低估的关键能力。
上下文管理的核心挑战在于:搜索智能体在执行多跳推理时会累积大量的搜索结果和中间推理文本,而大语言模型的上下文窗口是有限的。如何在有限的上下文空间内保留最关键的信息、淘汰冗余内容,直接决定了模型在后续推理步骤中能否获取到必要的线索。有效的上下文管理需要在信息保留和空间节约之间取得精细平衡,这对于需要十步甚至数十步搜索才能完成的复杂任务尤为关键。
因此,每个基准测试都同时评估了启用和禁用上下文管理两种情况,同时保持工具集、上下文限制和判断标准固定。所有结果均来自单一的ReAct智能体,没有使用子智能体或测试时验证,确保了评估的公平性和可复现性。
ReAct(Reasoning + Acting)是由Yao等人于2023年提出的一种智能体框架,其核心思想是让语言模型交替进行推理(Thought)和行动(Action)。在每一步中,模型先输出一段推理文本说明当前的思考过程和下一步计划,然后执行一个具体动作(如搜索查询或网页浏览),再根据返回的观察结果(Observation)进行下一轮推理。这种框架将链式思维(Chain-of-Thought)与工具使用自然结合,已成为搜索智能体和工具使用智能体的主流架构。Iris选择使用单一ReAct智能体而非多智能体协作系统进行评测,说明其核心能力提升来自模型本身而非复杂的系统工程。
基准测试成绩:开源搜索智能体的全面领先
在启用上下文管理的情况下,Iris-mini在BrowseComp、BrowseComp-ZH、DeepSearchQA和HLE四个基准测试中分别达到了82.2%、84.8%、86.9%和52.3%的成绩。更大规模的Iris-pro则进一步提升至88.6%、85.1%、92.9%和56.4%,代表了各自参数范围内开源搜索智能体的最强整体水平。
| 基准测试 | Iris-mini | Iris-pro |
|---|---|---|
| BrowseComp | 82.2% | 88.6% |
| BrowseComp-ZH | 84.8% | 85.1% |
| DeepSearchQA | 86.9% | 92.9% |
| HLE | 52.3% | 56.4% |
这些基准测试各有侧重。BrowseComp是OpenAI发布的一个高难度网页浏览理解基准,专门评估AI系统在真实网络环境中进行深度信息检索和推理的能力,其问题经过精心设计以确保无法通过简单搜索或常识回答。BrowseComp-ZH是其中文版本,测试跨语言检索推理能力。DeepSearchQA则聚焦于需要多步深度搜索才能回答的复杂事实性问题。HLE(Humanity's Last Exam)是由Scale AI联合众多领域专家构建的极高难度综合知识测试,被设计为人类能力边界处的挑战——其问题涵盖数学、科学、人文等多个领域的专家级难题,56.4%的得分在该基准上已属于非常高的水平。
其中,BrowseComp-ZH的成绩表明Iris在中文搜索任务上同样表现出色,体现了出色的跨语言多跳推理能力。DeepSearchQA上超过90%的得分则进一步验证了模型在深度搜索推理任务上的优势。
开源计划与未来发展方向
研究团队计划发布模型权重以及数据构建、训练和评估的完整方案。这一开源承诺对学术界和工业界都意义重大,有望加速搜索智能体技术的迭代和落地应用。完整方案的开源意味着其他团队不仅可以复现Iris的结果,还能在其数据构建pipeline和SFT-RL climbing训练范式的基础上进行改进和扩展,这对于推动整个搜索智能体领域的技术进步具有重要的催化作用。
Iris的成功表明,通过精心设计的反向数据构建策略和SFT-RL交替训练方法,搜索智能体在多跳推理任务上仍有巨大的提升空间。随着模型和完整方案的开源,基于Iris框架的改进和应用值得持续关注。
相关推荐

Vercel AI SDK 发布 Vue 3.0.282 补丁更新
Vercel AI SDK 发布 @ai-sdk/vue@3.0.282 补丁更新,同步核心包 ai@6.0.282。本文解析该 Vue 生态 AI 开发工具的更新内容、版本节奏与开发者升级建议。

Vercel AI SDK 沙箱组件发布补丁更新
Vercel AI SDK 发布 sandbox-vercel@1.0.109 补丁更新,同步 harness 依赖至同版本。本文解读这次维护更新的内容及其对 AI 应用开发者的意义。

Claude的承重词汇:哪些关键词真正影响AI行为输出
探索Claude大语言模型中的承重词汇概念,解析特定关键词如何以超额权重影响AI行为输出,以及这一发现对提示工程优化、AI对齐研究和模型安全的实践启示。