递归语言模型如何实现真正推理:跳出分布外泛化困境

限制模型可见范围的递归语言模型,在分布外场景下比思维链更能学到真正的推理规则。
这篇arXiv论文比较了思维链(CoT)与递归语言模型两种推理范式,提出了一个反直觉的结论:限制模型的信息可见范围,反而能带来更好的分布外泛化能力。在分布内场景下,CoT能高效模拟递归规则,两种方法差异仅为常数因子;但在分布外场景下,CoT会利用子任务以外的上下文形成"捷径",一旦分布发生偏移便会崩溃。递归语言模型通过上下文隔离从根本上排除了这种失败模式,迫使模型学习真正的递归规则。论文最深刻之处在于挑战经典学习理论:即便假设类仍然覆盖了正确规则,模型也会因简单性偏好而选择捷径而非真相——这意味着"能表达"不等于"会学到",主动施加结构性约束可能是通向稳健推理的有效路径。
从一个反直觉的问题说起
当我们训练大语言模型时,通常认为让模型看到的信息越多越好。一篇最新的 arXiv 论文《Recursive Language Models Generalize Out of Domain》却提出了一个反直觉的观点:限制模型能够看到的内容,反而可能带来更好的推理能力。
这篇研究比较了两种学习范式——标准的思维链(Chain-of-Thought, CoT)与递归语言模型(Recursive Language Models)。前者是一个更"通用"的学习器,能够读取完整的推理轨迹;后者则通过将每个子任务放到隔离的上下文中求解,主动约束自己的可见范围。

分布内:通用性几乎是免费的
论文的第一个核心结论是关于分布内(In-distribution, IID) 场景的。在训练数据与测试数据来自同一分布时,CoT 的通用性几乎不需要付出代价。
研究指出,CoT 可以高效地模拟递归规则(recursive rule)。这意味着从 IID 泛化保证的角度看,两种方法的差异仅仅是一个常数因子。换句话说,在标准的同分布测试条件下,递归式的上下文隔离并不能带来明显优势——CoT 已经足够好。
这与经典学习理论的直觉是一致的:如果一个假设类(hypothesis class)能够覆盖正确的规则,那么在充足数据下模型应该能学到它。
思维链(Chain-of-Thought, CoT)提示由 Wei et al. 2022年提出,其核心思想是让模型在给出最终答案之前,先生成逐步的中间推理过程。这种方式显著提升了大模型在算术、常识推理和符号操作等任务上的表现。递归语言模型(Recursive Language Model)则是一种不同的范式:它将复合问题分解为层次化的子问题,每个子问题在独立的上下文窗口中单独求解,子问题的输出再汇入上层的求解过程——整个结构类似于函数式编程中的递归调用。两者的关键区别在于信息可见范围:CoT在一个连续的上下文中展开全部推理步骤,各步骤之间可以相互"看见";而递归模型的每个子任务只能看到自己的局部输入,无法访问并行或上层步骤的中间状态。这一结构差异正是本文理论分析的核心出发点。
分布外:捷径带来的崩溃
真正的分歧出现在分布外(Out of Domain, OOD) 场景。这也是论文最有价值的洞察所在。
当模型面对训练分布之外的数据时,CoT 的"看得全"反而成了弱点。因为 CoT 可以依赖当前子任务之外的上下文来拟合训练数据——这是一种捷径(shortcut)。这种捷径在训练时看起来有效,但一旦那些无关的上下文 token 发生变化,捷径就会崩溃,模型的推理随之失败。
递归语言模型通过上下文隔离(context isolation)从根本上排除了这种失败模式。既然每个子任务都在独立的上下文中求解,模型就无法利用子任务之外的信息作弊,只能学习真正的递归规则。
「捷径学习」(shortcut learning)是深度学习中一个被广泛观察到的现象:模型会利用训练数据中与标签统计相关但在语义上无关的特征来做出预测。经典案例包括图像分类器学会用背景颜色而非物体形状来分类,以及NLI模型利用假设句中的特定词汇(如"不"字)直接猜测标签,而非真正理解句子间的逻辑关系。在推理任务中,CoT的捷径则表现为:模型可能学会根据前几步推理轨迹的整体风格或特定词汇来预测答案,而不是真正执行每一步的逻辑运算。这类捷径在测试集与训练集同分布时难以被发现,因为那些"无关"的上下文信号在分布内恰好是稳定的,只有当测试数据的表面特征发生变化时,模型才会暴露出从未真正"学会推理"的本质。
覆盖正确规则还不够:简单性偏好的陷阱
论文最深刻的一点,是对经典学习理论的挑战。
即便 CoT 的假设类仍然覆盖了递归规则——也就是说,正确的解在理论上是可学的——模型却因为简单性偏好(simplicity bias) 而选择了捷径而非真相。模型倾向于用最简单的方式拟合训练数据,而捷径往往比真正的递归推理更"简单"。
这带来一个重要论断:要真正实现推理、而不仅仅是达到分布内的准确率,仅仅让假设类覆盖正确规则是不够的。这与经典学习理论形成鲜明对比——在传统框架里,覆盖正确规则加上足够数据通常就意味着能学到它。
为什么这一点很重要
这个发现对当前大模型推理研究有直接启示。业界大量工作聚焦于扩大模型容量、增加数据、优化提示,本质上都是在扩展"能表达什么"。但这篇论文提醒我们,表达能力(覆盖正确规则)与实际学到什么(归纳偏好)是两回事。
当我们希望模型跳出训练分布、进行真正的泛化推理时,主动施加结构性约束——比如递归式的上下文隔离——可能比单纯扩展能力更有效。
「简单性偏好」(simplicity bias)是神经网络的一种内在归纳偏好,指模型在多个能够拟合训练数据的假设中,倾向于选择描述长度更短或参数更少的那个——这与奥卡姆剃刀原则表面相似,但在学习理论中并不总是好事。随机梯度下降(SGD)等优化算法的更新机制天然偏向于先学习"低频、简单"的模式,导致模型经常在复杂的真实规则与简单的捷径并存时选择后者。经典学习理论(如VC维理论、PAC学习框架)假设:只要假设类足够覆盖目标概念,且训练样本充足,学习算法就能收敛到正确假设。但这一理论在神经网络场景下面临挑战——覆盖不等于选择,优化路径与归纳偏好共同决定了模型最终学到什么。这篇论文的贡献正是在推理任务的语境下,为这一理论缺口提供了具体的形式化分析与实证依据。
对模型架构与训练的启示
从工程角度看,这项研究为一类"结构化推理"方法提供了理论支撑。将复杂任务分解为独立子任务、并在隔离上下文中逐一求解的做法,不只是工程上的便利,更是一种能够改善分布外泛化的归纳偏好设计。
对于正在探索 Agent、任务分解、递归调用等范式的开发者而言,这一结论意味着:约束不是妥协,而可能是通往稳健推理的路径。当模型不能依赖无关上下文时,它被"逼迫"去学习真正的规则。
需要说明的是,本文基于该论文的摘要展开分析,具体的实验设置、数据集与量化结果需参考完整论文。但其核心论点——通过限制可见范围来改善分布外泛化——已经足够引发对当前推理模型设计范式的重新思考。
相关推荐

Firebase AI Logic 实战:让 Gemini 返回结构化 JSON
本教程讲解如何在 Firebase AI Logic 中通过定义响应 Schema,让 Gemini 返回干净、可预测的结构化 JSON。涵盖字段定义、请求配置与解析流程,适用于 API、仪表盘、表单和自动化等场景。

问责机制也能充满乐趣:重塑自律与团队协作的新思路
问责机制常被视为压力与惩罚的代名词,但它其实可以充满乐趣。本文探讨如何通过同伴支持、进展可见化和庆祝小胜利,将问责重构为推动个人成长与团队协作的愉悦力量。

Claude Code 入门:读懂它是什么与多端用法
Anthropic 团队成员 Lydia 主讲的 Claude Code 入门分享:它不只是 CLI,而是可在终端、IDE、浏览器和桌面端运行的 AI Agent。本文梳理其本质定位、多端用法与学习路径。