[控场AI]
· 5 分钟阅读· 2,506 字

Sieve与Sage框架:让检索增强模型学会"知之为知之"

Sieve与Sage框架:让检索增强模型学会"知之为知之"

Sieve and Sage框架将RAG检索失败解耦为两类,用轻重两级模块实现高效弃权决策。

针对检索增强语言模型(RALM)在检索质量不佳时仍强行生成答案的问题,研究者提出了Sieve and Sage框架。其核心创新在于将检索失败区分为"证据缺失(不可回答)"与"证据被噪声干扰"两种状态,并设计了对应的两级流水线:轻量的Sieve模块负责预先筛查文档集中的干扰性证据,重型的Sage模块在干净证据的基础上完成生成或弃权决策。实验显示,相比单阶段基线,该框架在准确率和Macro-F1上分别最高提升69.4和55.2个百分点,推理速度最高加速1.99倍。这一架构在医疗、法律等高风险领域尤具价值,也为RAG系统设计提供了"任务解耦换效率"的新思路。

当AI也需要学会说"我不知道"

苏格拉底以"自知其无知"闻名。对检索增强语言模型(RALM)而言,这种自省能力同样关键——当检索到的证据无法支撑可靠回答时,模型应当选择"弃权"(abstention),而不是硬着头皮编造答案。一篇发表于 arXiv 的最新研究提出了名为 Sieve and Sage 的框架,专门解决这一问题。

检索增强生成(RAG)已成为缓解大模型幻觉的主流手段,但它并非万无一失。检索环节可能返回缺失的、矛盾的、甚至带有对抗性的信息。一旦模型盲目信任这些噪声,生成的答案反而可能比不检索时更加危险。因此,让模型判断"何时该闭嘴",成为构建可靠系统的核心命题。

Sieve and Sage 论文

把检索失败拆成两种状态

现有方法大多依赖一个庞大的单体 LLM,在单一步骤中处理所有类型的检索失败。研究者指出,这种"一刀切"的做法既限制了弃权性能,又带来了高昂的计算成本。

Sieve and Sage 的核心洞见在于对检索失败进行解耦,将其区分为两种截然不同的状态:

不可回答状态(Unanswerable)

这是指所需证据根本不存在于检索结果中。此时无论模型多强大,都无法给出有依据的回答,正确的做法是直接弃权。

被干扰状态(Distracted)

这是更微妙的情况:相关证据确实存在,但混杂着相互冲突、被否定或对抗性的信息。模型需要在噪声中辨别真伪,而这恰恰是最容易出错的环节。

这种拆解带来的价值在于——两种失败模式需要不同的处理策略,用统一模块笼统应对,效果和效率都会打折扣。

检索增强生成(RAG)的工作机制是:在语言模型生成答案之前,先从外部知识库(如文档库、搜索引擎)中检索相关片段,将其作为"上下文"一并送入模型。这一机制能有效减少模型依赖参数记忆而产生的幻觉,但也引入了新的脆弱性。检索系统本质上是基于语义相似度匹配的,它无法判断返回的文档是否真正"正确"——只能判断其是否"相关"。当知识库中本就缺少答案时,检索会返回相似但无关的噪声;当知识库中存在互相矛盾的陈述时,模型可能从中挑选对生成"流畅答案"最有利的那一条,而非最准确的那一条。这两种场景在实际部署中极为常见,却长期缺乏系统性的处理框架。

轻量筛选 + 重型推理的两级流水线

基于上述解耦,框架设计了两个分工明确的组件:

  • Sieve(筛子):一个轻量级模块,在调用昂贵的大模型之前,先对检索到的文档集进行"筛查",识别其中的干扰性证据。
  • Sage(智者):负责基于经过筛选的证据进行有依据的生成,并在必要时做出弃权决策。

这种"先筛后判"的设计思路,本质上是把计算资源分配到最需要的地方。轻量的 Sieve 承担了大量粗筛工作,避免让高成本的 Sage 在明显有噪声的输入上做无用功。这既是准确性的优化,也是成本的优化。

两级流水线(Two-stage Pipeline)是机器学习系统设计中的经典范式,其核心逻辑是"粗筛+精判":第一阶段用低成本模型快速排除明显不符的候选项,第二阶段才对剩余候选项投入高成本推理资源。这种设计在信息检索(如搜索引擎的召回-排序架构)和计算机视觉(如目标检测的候选区域生成)中均有成熟应用。Sieve and Sage 将这一思想引入 RAG 的弃权决策问题:Sieve 模块无需理解问题的语义细节,只需判断文档集内部是否存在冲突或对抗性信号,这是一个相对简单的分类任务,适合轻量模型完成;而只有当文档集通过筛查、证据质量可信时,才将完整推理任务交给能力更强的 Sage 模型处理。这种任务难度与模型能力的精准匹配,正是其效率提升的结构性来源。

实验数据:准确率与速度双提升

研究团队在通用领域和高风险专家领域两类场景下对框架进行了评估。结果颇为亮眼:

  • 相比单阶段基线,系统准确率最高提升 69.4 个百分点;
  • Macro-F1 指标最高提升 55.2 个百分点;
  • 推理速度实现最高 1.99 倍加速。

准确率和 F1 的大幅提升,说明预先检测干扰噪声这一步骤确实抓住了单阶段方法的痛点。而近两倍的加速则印证了两级流水线在效率上的优势——把简单判断交给轻量模块,只在真正需要时才动用重型模型。

值得关注的是"高风险专家领域"这一测试场景。在医疗、法律等对错误零容忍的领域,模型"宁可不答也不答错"的能力,其价值远高于多回答几个问题。这也是弃权机制研究的现实意义所在。

Macro-F1(宏平均F1分数)是评估多分类任务中常用的综合指标,计算方式是对每个类别分别求F1分数后取算术平均,而非按类别样本量加权。这一指标的关键特性在于对少数类别同等重视——在弃权评估场景中,"正确弃权"的样本往往远少于"正常回答"的样本,若采用加权平均,弃权类的表现容易被掩盖。因此,Macro-F1 的大幅提升(55.2个百分点)尤其有意义:它意味着模型不仅在常见的可回答问题上表现良好,在更稀有的"应当弃权"的样本上同样做到了准确识别,而非仅靠多数类的优势拉高整体得分。这也反映出 Sieve 对干扰性证据的检测在类别分布不均的真实场景中同样有效。

对 RAG 系统设计的启示

Sieve and Sage 给业界带来的思考,不仅在于具体的性能数字,更在于其架构哲学。当整个行业倾向于用更大的模型解决一切时,这项研究提示我们:通过任务解耦和分级处理,往往能用更少的算力换来更好的结果。

对于正在构建企业级 RAG 应用的团队而言,这套思路具有直接的借鉴意义——与其寄希望于单个大模型消化所有检索噪声,不如在流水线中加入一个专职的"守门员",提前过滤掉不可靠的证据。可靠性与效率,未必总是零和博弈。

需要说明的是,本文基于论文摘要撰写,具体的 Sieve 模块实现细节、训练方法及完整实验设置,仍需查阅原始论文全文获取。

分享:

相关推荐