机器学习可复现性危机:三大根源与破局之道

机器学习可复现性危机源于物理AI高成本、产业界信息垄断与竞争性封闭激励三重压力,亟需制度性重构。
本文围绕一场Reddit社区讨论,系统剖析机器学习领域可复现性危机的三大根源:物理AI实验的高硬件门槛使同行无力验证、大型AI公司凭借信息不对称发布无法核实的指标、竞争压力使研究者理性地选择封闭代码与数据。文章同时辨析了从科学史中寻找慰藉的局限性——曼哈顿计划等历史工程的"内部可复现性"建立在可靠物理定律之上,而ML成果的经验性本质使这一类比站不住脚。针对困局,文章提出三条出路:强化顶级会议的开放规范、以"可验证性"替代部分场景下的"可复现性"、以及培育对演示文化的健康怀疑态度,最终呼吁在新技术格局下重新定义而非放弃可复现性这一科学根基。
一个正在被边缘化的科研根基
可复现性(Reproducibility)曾是科学研究的黄金标准——任何结论都应该能被他人独立验证。然而在机器学习领域,这一原则正面临前所未有的挑战。近日,一位研究者在 Reddit 机器学习社区发起讨论,直言"可复现性在 ML 研究中似乎正走向无关紧要,是否已经太晚了?",迅速引发广泛共鸣。
这并非危言耸听。当越来越多的研究成果只能靠一段演示视频或几张图表来"证明"有效性时,整个领域的科学严谨性正在悄然被侵蚀。本文结合这场讨论,剖析机器学习可复现性危机的三大根源,并探讨可能的出路。

危机的三大根源
一、物理 AI 让实验无从复现
随着研究逐渐向"物理 AI"(Physical AI)领域延伸——机器人操控、具身智能等方向——复现一个实验往往需要昂贵的硬件设备,甚至一整套配备高速摄像机的实验室环境。
原帖作者指出得很直接:你根本无法确认某个实验是否真能被复现,只能选择相信演示视频。但演示本身并不可靠。研究者天然有动机只展示成功片段,而系统很可能在录制停止的瞬间就崩溃了。这种"樱桃采摘"(cherry-picking)式的展示,让基于演示的成果验证极其脆弱。
当一项研究的成本高到只有极少数机构能负担时,同行评审的验证功能实际上已经失效——没有人有能力真正重跑那个实验。
"具身智能"(Embodied Intelligence)指让AI系统通过与物理环境的交互来学习和执行任务,与纯数字环境中的模型训练有本质区别。这类研究的复现难度不仅体现在硬件成本上,还包括环境的不可控性:温度、光照、地面摩擦系数等物理变量都可能影响实验结果,而这些条件几乎不可能在不同实验室间精确复制。相比之下,传统深度学习实验只需要相同的代码和数据集,运行在同等算力的GPU上即可复现。"樱桃采摘"问题在物理AI中尤为突出——一个机械臂抓取任务的成功率可能只有40%,研究者只需录制10次实验中成功的4次,便能剪辑出一段"完美表现"的演示视频,而观众根本无从判断这是常态还是例外。
二、大公司的"信我就对了"
第二个根源来自产业界。大型 AI 公司频繁发布各类工具,宣称能以某种准确率或效率解决一系列问题。但除非你是这些公司的内部员工,否则根本无从核实这些数字的真实性。
问题是双重的:一方面,这些公司有强烈的财务动机去夸大指标;另一方面,它们所声称解决的问题往往模糊而主观,缺乏客观的检验标准。当一个模型宣称在某个"通用能力"上取得突破时,外界甚至难以定义该如何测量这种能力,更遑论复现。
这形成了一种信息不对称:产业界掌握着数据、算力和评测环境,而学术界和公众只能被动接受被精心包装过的结论。
三、竞争激励下的"故意不可复现"
最尖锐的是第三点,也是原帖所说的"房间里的大象":研究者本身就被激励去生产不可复现的工作。
在激烈的学术与商业竞争中,公开完整的代码和数据意味着可能被竞争对手"抢走饭碗",或者暴露方法缺陷而"显得难堪"。这解释了为什么许多人向论文作者发邮件索要代码时,往往石沉大海。
换句话说,不可复现有时并非能力问题,而是一种理性的策略选择。当整个激励结构都在奖励"保留一手"时,指望个体自觉开放几乎是奢望。
历史能给我们安慰吗?
面对这样的困局,原帖作者试图从科学史中寻找慰藉:也许一切都会没事,因为历史上也有类似情况。
比如原子弹的研制、登月工程,这些项目具有低"外部可复现性"但高"内部可复现性"(low outside reproducibility but high internal reproducibility)的特征——外界无法轻易复制,但项目内部有严格的验证流程。
然而关键差异在于:这些历史工程本质上是数学性的、经过严密推演和反复核验的。而机器学习的许多领域并非如此——它高度依赖经验性调参、随机初始化、庞大的数据集和难以言明的"工程技巧",缺乏那种可以从第一性原理推导并验证的数学骨架。
这个类比因此站不住脚:曼哈顿计划的内部可复现性建立在可靠的物理定律之上,而当下许多 ML 成果的"内部可复现性"本身就值得怀疑。
机器学习与传统工程科学在认识论层面存在根本差异,这一点常被低估。物理学或土木工程中,一个设计的有效性可以从基本方程推导出来,失败原因也可追溯至某个具体假设的违反。而神经网络往往是"有效但不知为何有效"——一个模型在某个数据集上表现优异,研究者可能无法给出任何超越"大量数据加上足够参数"的解释。这种"不透明性"使得ML结论的可迁移性天然较弱:在A实验室的数据分布和硬件环境下有效的方法,换一个环境可能完全失效,而没有理论工具能提前预判这种失效。正因如此,ML领域的"内部可复现性"本身就需要更严格的审视,而不能简单类比于有坚实理论支撑的历史工程项目。
出路何在?
讨论的核心问题最终落在:可复现性是否应该被彻底放弃?如果不放弃,未来又该如何更好地落实?
从当前的行业实践来看,尽管存在上述困境,仍有几条路径值得探索。
建立更强的开放规范
顶级会议如 NeurIPS、ICML 已经引入了"可复现性检查清单"(Reproducibility Checklist),要求作者提交代码、说明实验设置。执行力度虽参差不齐,但这至少将开放从"美德"转变为"义务",逐步改变激励结构。
值得注意的是,NeurIPS从2019年开始试行可复现性检查清单,要求作者说明训练细节、超参数设置、随机种子及统计显著性检验方法。部分顶会还引入了"可复现性赛道"(Reproducibility Track),专门发表对已有论文的复现研究——无论成功与否均可发表,这直接颠覆了"只有阳性结果才能发表"的传统偏见。然而,检查清单的实际效果存在争议:有研究者系统性地尝试复现通过清单审核的论文,发现成功率并未显著提升。根本原因在于,许多影响结果的"隐性知识"(tacit knowledge)——比如某个优化器在前几百步需要特殊的学习率预热策略——很难被任何标准化表格完整捕捉。
区分"可复现"与"可验证"
对于成本高昂的物理 AI 实验,或许不必强求完全的独立复现,而应转向可验证性——通过标准化的评测基准、第三方审计、开放的评估协议,让结论至少在某个受控环境中可被检验。这类似于历史工程中的"内部可复现性",但需要引入独立的外部监督方。
警惕演示驱动的评价文化
对于研究社区和公众而言,最重要的心态转变是:降低对演示视频和厂商自报数字的信任权重。一段炫目的 demo 不等于一个可靠的系统,一个亮眼的 benchmark 分数也不等于真实世界的能力。保持健康的怀疑,本身就是对可复现性危机的一种抵抗。
结语:不是放弃,而是重构
可复现性并非应该被抛弃,而是需要在新的技术格局下被重新定义和实现。物理 AI 的高成本、产业界的信息垄断、竞争带来的封闭激励,这三重压力共同构成了当下的危机。
但科学的自我修正机制从未失效——只是它需要制度设计的配合。从强制开放规范,到可验证性框架,再到评价文化的成熟,每一步都在重建那条被侵蚀的科学根基。这场关于可复现性的讨论之所以引发共鸣,恰恰说明社区仍然在意它。而只要还有人在追问"是否太晚了",答案就还没有盖棺定论。
相关推荐

@ai-sdk/zai@3.0.10 发布:依赖更新的补丁版本解析
Vercel AI SDK 发布 @ai-sdk/zai@3.0.10 补丁版本,同步更新 provider、provider-utils 与 openai-compatible 等底层依赖。本文解析该版本变更内容及 AI SDK provider 体系的设计意义。

Vercel AI SDK 更新:@ai-sdk/workflow 2.0.29 修复工具结果保留问题
Vercel AI SDK 发布 @ai-sdk/workflow 2.0.29 补丁版本,核心修复工作流在终止、延迟、暂停三种响应状态下 provider 工具执行结果的保留问题,并同步升级 ai@7.0.98 等核心依赖。

Vercel AI SDK 更新:@ai-sdk/xai 4.0.58 批处理与图像生成改进
Vercel AI SDK 发布 @ai-sdk/xai 4.0.58 版本更新,新增批处理图像生成支持,修复批处理请求类型校验及 DeepSeek 推理流问题,并同步升级 provider 相关依赖。