NeurIPS 73个工作坊无一聚焦因果推理:该领域正被边缘化?

一场无声的学术版图变迁
近日,一则来自 Reddit 机器学习社区的讨论引发了学界关注:在 NeurIPS 2026 公布的 73 个工作坊(workshops) 中,竟然没有一个专门聚焦于**因果推理(Causal Inference)**的主题。这一现象被不少研究者视为一个重要信号——因果推理这一曾经被寄予厚望的方向,正在顶级机器学习会议的舞台上逐渐失去声量。
NeurIPS(Neural Information Processing Systems)是全球最具影响力的机器学习与人工智能学术会议之一,每年吸引超过万名参会者。其会议体系分为主会(main conference)和工作坊(workshops)两大部分。主会论文经过严格的双盲同行评审,接收率通常在20-25%之间;而工作坊则是围绕特定主题组织的半天或全天研讨活动,通常安排在主会结束后的1-2天内举行。工作坊的投稿审查相对宽松,主要目的是促进前沿话题的自由讨论、展示进行中的工作(work-in-progress),以及建立子领域的社区联系。正因为工作坊的组织门槛相对灵活,它能更快速地反映社区的兴趣变化,使得因果推理在此层面的缺席尤为值得关注。
因果推理(Causal Inference)是一套旨在从数据中识别因果关系而非仅仅相关关系的理论与方法体系。其现代形式主要由两大框架构成:Judea Pearl 提出的结构因果模型(SCM)与有向无环图(DAG)框架,以及 Donald Rubin 提出的潜在结果框架(Potential Outcomes Framework)。Pearl 的 do-calculus 提供了从观测数据中推断干预效果的数学工具,而 Rubin 因果模型则通过反事实推理来定义因果效应。
在 Pearl 的框架中,DAG 不仅是一种可视化工具,更是一套完整的数学语言,能够精确定义混杂(confounding)、中介(mediation)和碰撞(collision)等因果结构。结构因果模型(SCM)由三个核心组成部分构成:外生变量集合U(不被模型内其他变量所解释的背景变量)、内生变量集合V(由模型内的因果机制所决定的变量),以及一组结构方程F(描述每个内生变量如何由其直接原因决定)。do-calculus 由三条规则组成,能够判断在给定因果图结构下,某个因果效应是否可以从纯观测数据中识别出来——这被称为"可识别性"(identifiability)问题。关键在于,do(X=x)算子与条件概率P(Y|X=x)有本质区别:后者是在观察到X=x的情况下Y的分布,可能包含混杂偏差;而前者表示通过外部干预强制设定X=x后Y的分布,它切断了所有指向X的因果箭头,消除了混杂效应。这一区分是因果推断区别于传统统计分析的根本所在。
Rubin 的潜在结果框架则采用了不同的切入角度:对于每个个体,假设在接受处理和未接受处理两种情况下各有一个潜在结果,因果效应被定义为这两个潜在结果之差。由于我们永远只能观察到其中一个(即"因果推断的根本问题"),整个框架的核心挑战在于如何通过实验设计或统计调整来估计群体层面的平均因果效应。
这两个框架在过去三十年中深刻影响了统计学、计量经济学和流行病学的方法论发展。正是这样一个具有深厚理论积淀的方向,如今在顶会工作坊中"缺席",才格外引人深思。
发帖者的感叹颇具代表性:"这就是因果推理的终点了吗?"(Is this it for Causal Inference?)在他看来,如今因果推理领域的活跃阵地已经收缩到 UAI、AISTATS 和 CLeaR 等专门性会议,而在 NeurIPS、ICML、ICLR 这样的"顶三"综合性会议上,因果方向的存在感正被大语言模型(LLM)、智能体(Agents)等热门议题不断挤压。

工作坊数量背后的"注意力经济"
工作坊看似只是会议的"配菜",但它实际上是学术风向的敏感晴雨表。NeurIPS 工作坊通常由该领域的活跃研究者发起提案,经过会议组织委员会评审后批准。一个成功的工作坊提案需要展示足够的社区兴趣(通常通过预期投稿量和确认的受邀演讲者来证明)、清晰的主题定位以及组织团队的学术影响力。工作坊的运作周期相对灵活,从提案到举办通常只需数月,因此它能比需要漫长评审周期的主会论文更迅速地反映领域热点的变化。
学术界的"注意力经济"现象有其深层的制度根源。顶级会议的版面有限(NeurIPS 主会通常接收率在 25% 左右),而工作坊数量虽然看似较多,实际上每个工作坊的会场容量、时间段和可见度都受到严格约束。更关键的是,工作坊的提案竞争本身就反映了社区的活力:一个成功的工作坊需要至少 3-5 位有影响力的组织者、5-8 位确认出席的受邀演讲者,以及对至少 30-50 篇投稿的合理预期。当一个方向的顶尖研究者被大模型方向"虹吸",或当年轻研究者判断该方向的论文接收难度较高而转向热点时,工作坊提案的组织基础就会被侵蚀。一个子领域能否成功组织起独立工作坊,往往取决于是否有足够的活跃研究者、足够的投稿量以及足够的产业关注度作为支撑。
因此,当 73 个工作坊中因果推理"颗粒无收"时,它传递的并非简单的"无人研究",而是一种更微妙的信号:在有限的会议版面这一稀缺资源上,因果推理在与 LLM、Agent、多模态、生成模型等方向的竞争中落于下风。
顶会正在被"大模型化"
原帖中一句"LLMs/Agents/etc seem to have eaten much of the lunch of several other subfields"(大模型和智能体等方向吃掉了其他子领域的大部分蛋糕)道出了近年来的普遍观感。自 2022 年底生成式 AI 浪潮爆发以来,机器学习顶会的投稿结构发生了显著倾斜。据统计,NeurIPS 2023-2025 期间,与大语言模型相关的投稿量增长超过 300%,而传统方向如贝叶斯方法、核方法、概率图模型等的投稿占比则持续下降。
这种变化的驱动力是多维度的。2022年11月ChatGPT发布后,整个AI研究生态经历了前所未有的结构性重构。首先是人才流动——大量原本从事概率图模型、因果推理、强化学习等方向的研究者转向大模型相关研究,部分是出于学术兴趣,部分则是受就业市场和资助压力驱动;其次是计算资源分配——大模型训练所需的GPU集群规模使得中小型实验室难以参与前沿竞争,资源进一步向少数大型机构集中;最后是发表激励——审稿人和程序委员会的构成也随热点变化,熟悉大模型的审稿人比例上升,这在客观上影响了非热点方向论文的评审质量和接收概率。这种变化不仅体现在学术论文层面,更反映在产业界的人才需求和风险投资的流向上——大量人力、算力与资金涌向大模型相关方向,形成了一个自我强化的生态循环。而强化学习、概率图模型、因果推理等传统方向则相对被稀释。
这并非说这些方向不再重要,而是在"注意力经济"的逻辑下,热点方向自带更强的传播效应、就业吸引力和资金回报,从而形成正反馈循环,进一步放大了资源分配上的不均衡。
因果推理真的"式微"了吗?
值得冷静看待的是,工作坊缺席并不等同于领域衰亡。事实上,因果推理有其独特的学术生态:
- 专门会议依然稳固:正如原帖所指出的,UAI(人工智能中的不确定性)、AISTATS(人工智能与统计)以及 CLeaR(因果学习与推理会议)都是高质量的专属阵地。其中,UAI 创办于 1985 年,是概率推理与因果推理领域历史最悠久的会议之一,其历史甚至早于 NeurIPS(1987 年创办)。UAI的创始群体包括Judea Pearl、Stuart Russell、Peter Cheeseman等概率推理和决策理论领域的先驱人物,它见证了贝叶斯网络从理论提出到实际应用的全过程,Pearl关于因果推断的许多开创性工作最初都发表在UAI上。该会议规模较小(年均接收约100-150篇论文),但以理论深度著称,强调数学严谨性和方法论创新,也是贝叶斯网络、概率图模型等方向的核心会议。AISTATS 虽然规模较小(每年接收约 200 篇论文),但以审稿质量著称,是统计机器学习理论研究者的首选会议之一;而 CLeaR 是 2022 年由 Bernhard Schölkopf、Elias Bareinboim 等因果推理领域的核心人物发起创立的专门会议,旨在为因果发现、因果表示学习等前沿方向提供专属平台。CLeaR 的论文涵盖因果发现算法、因果表示学习、因果强化学习等前沿议题,其创立标志着因果社区从"寄生"于综合会议转向建设自己的独立学术生态——这既反映了因果社区对顶会空间被压缩的主动应对策略,也说明社区并未消失,只是重心发生了转移。
- 跨学科影响力深远:因果推理广泛渗透于经济学(如政策评估中的工具变量法和断点回归设计)、流行病学(如疫苗效果评估中的倾向评分匹配)、统计学等领域,其影响力远不止于 NeurIPS 这一个衡量维度。2021 年诺贝尔经济学奖授予了 Joshua Angrist、Guido Imbens 和 David Card,表彰他们在因果推断方法论——特别是自然实验方法——上做出的杰出贡献,这便是因果推理跨学科影响力的最佳证明。
- 与大模型存在结合空间:因果推理与大模型的结合正在多个方向上展开探索。一是利用因果图来分析和消除大模型中的虚假相关(spurious correlations),提升分布外泛化能力;二是通过因果干预框架来理解大模型内部的推理机制,即所谓的"因果可解释性"(causal interpretability);三是将因果知识注入模型训练过程,以增强模型对因果关系的推理能力。其中,Activation patching(激活补丁)是机械可解释性(Mechanistic Interpretability)领域的核心技术之一,其思想直接借鉴了因果推断中的干预实验。机械可解释性是近年来由Anthropic、DeepMind等机构大力推动的研究方向,其核心目标是逆向工程神经网络的内部计算过程,理解模型"如何"而非仅仅"能否"完成特定任务。该方向的标志性工作包括Anthropic的"Transformer电路"(Transformer Circuits)系列论文,以及Kevin Meng等人提出的ROME(Rank-One Model Editing)方法。ROME正是通过因果追踪确定事实知识存储在Transformer的MLP层中特定位置,然后通过秩一更新来编辑这些知识。Activation patching的具体做法是:在模型处理输入 A 时,将某一层或某一注意力头的激活值替换为处理输入 B 时的对应激活值,然后观察输出的变化。如果输出发生显著改变,说明该组件在因果意义上参与了从 A 到输出的信息处理路径。这种方法与 Pearl 框架中的 do-operator 在概念上高度一致——都是通过"切断"自然的因果路径并强制设定某个变量的值来识别因果效应。Anthropic、DeepMind 等机构近年来大量采用这类方法来研究大模型的内部电路(circuits),形成了所谓的"因果追踪"(causal tracing)方法论。此外,因果推理对于解决大模型的幻觉(hallucination)问题也具有理论指导价值。从因果图的角度看,幻觉的产生可以归因于模型在训练过程中学习到了虚假相关而非真正的因果关系——例如,模型可能学到"提到某位科学家时通常也会提到某所大学"这一统计关联,但没有正确建模"该科学家在该大学工作"这一因果事实,从而在生成时产生错误的归属。因果干预框架提供了一种系统性诊断幻觉来源的方法:通过在模型的不同计算层施加干预,可以定位虚假关联在哪些组件中被编码,并据此设计针对性的缓解策略。因此,未来完全可能以"因果 + LLM"的形式重新回到主流视野。
一个健康领域该有的姿态
从积极角度看,因果推理拥有扎实的理论根基与明确的问题定义,这种"慢学科"的特质使其不容易被短期热点吞没,也不必依附于会议流量来证明自身价值。回顾历史,类似的现象并非首次发生——贝叶斯方法在 20 世纪 90 年代曾被神经网络热潮边缘化,当时以反向传播为核心的神经网络和以支持向量机为代表的核方法占据了主流关注,贝叶斯推断被认为"计算成本过高"且"缺乏可扩展性"。然而,当深度学习在 2010 年代后期开始面临过度自信、分布外检测失效等问题时,贝叶斯深度学习(如 MC-Dropout、变分推断、贝叶斯神经网络)重新成为研究热点,其理论价值在深度学习不确定性量化中得到了重新认可。类似地,当前大模型面临的可靠性、可解释性和幻觉问题,很可能为因果推理提供类似的"回归"契机——因为这些问题的本质往往与模型未能正确建模因果结构有关。具备坚实数学基础的领域往往拥有更长的生命周期,其价值不以短期热度为衡量标准。
对AI研究者的方向选择启示
这场讨论对广大 AI 从业者与研究生而言,其实提出了一个更深层的问题:如何在热点驱动的科研环境中保持方向定力?
一方面,紧跟大模型浪潮意味着更多的机会、资源与曝光;另一方面,扎根于因果推理这类基础方向,则可能在浪潮退去后展现出更持久的价值。理想的策略或许是寻找二者的交汇点——用因果的视角去审视大模型的可解释性与可靠性问题,既不脱离主流,又保留独立思考的深度。例如,当前已有研究者在探索用因果图来建模 Transformer 注意力机制中的信息流动,或利用干预实验(activation patching)来定位大模型中特定知识的存储位置,这些工作正是因果方法论与前沿热点的有机结合。
单一会议的工作坊构成不足以为一个学科盖棺定论。但这一现象确实值得整个社区警醒:当学术版图被少数热点主宰时,我们是否正在无意间牺牲研究的多样性?而多样性,恰恰是任何一个学科长期健康发展的根基。学术史反复证明,今日的"冷门"往往孕育着明日的突破——互联网时代之初,图论与网络科学同样曾是小众方向,却在后来成为理解社交网络、推荐系统等核心问题的关键工具。
结语
"73 个工作坊,没有一个关于因果"——这句略带无奈的观察,折射的是生成式 AI 时代整个机器学习领域的结构性变迁。因果推理或许暂时退居幕后,但它所代表的"理解世界为何如此"的追问,永远是人工智能无法绕开的核心命题。正如 Judea Pearl 在其著作《为什么》(The Book of Why,2018 年出版)中所强调的,真正的智能不仅需要回答"是什么"(关联层,即从数据中发现统计相关性)和"如果做了会怎样"(干预层,即预测主动行动的后果),更需要回答"为什么"(反事实层,即推理在不同条件下历史将如何改写)——这三个层级构成了 Pearl 提出的"因果之梯"(Ladder of Causation),而当前大语言模型尽管在关联层表现出色,在干预层和反事实层的真正推理能力仍存在根本性局限。热点会更迭,而根本问题不会消失。对于真正的研究者而言,这或许正是低调深耕的好时机。
注:本文基于 Reddit 机器学习社区的单一讨论帖及 NeurIPS 2026 工作坊公开列表整理分析,相关观点为社区个人看法,供参考。
相关推荐

EmbeddedSass for .NET:告别Node.js依赖的Sass编译方案
EmbeddedSass for .NET基于官方Embedded Sass协议,让.NET开发者无需Node.js即可原生编译Sass/SCSS。本文解析其技术原理、应用场景及与ASP.NET生态的集成方式。

旧金山到新加坡时差:硅谷科技人的跨太平洋日常
旧金山与新加坡之间存在15-16小时时差,频繁往返两地已成为科技从业者的常态。本文解析SF到SG时差挑战、两大科技中心的连接趋势,以及AI行业全球化布局背后的人才与资本流动。

Anthropic官方Claude Code插件目录发布:精选高质量扩展生态
Anthropic发布官方Claude Code插件目录claude-plugins-official,提供经过审核的高质量插件精选集。了解官方目录的定位、核心价值及对AI编程工具生态的深远影响。