AI智能体复现ICML 2026论文:34%被验证,23%存在问题

一场史无前例的社区复现实验
近日,Hugging Face 联合 Alpha Chi 举办了一场规模空前的 ICML 2026 论文复现黑客松(Reproduction Hackathon),并在直播中公布了最终结果。这场活动由 Abu Bakr Abid 等 Hugging Face 团队成员组织,吸引了超过 1,200 名参与者,他们各自带着 AI 智能体(Agent)来尝试复现今年 ICML 会议上的论文。
AI 智能体是指能够自主感知环境、做出决策并执行行动的 AI 系统。与传统的单次问答式大语言模型不同,智能体具备多步推理、工具调用、代码执行和自我纠错等能力。在科研场景中,智能体可以阅读论文、理解实验设计、编写并运行代码、分析实验结果,甚至在遇到错误时自动调试。本次黑客松中,参与者使用的智能体涵盖了从简单的代码生成助手到复杂的多轮推理系统。这些智能体通常基于大语言模型(如 GPT-4、Claude 等)构建,通过 ReAct、Chain-of-Thought 等提示工程框架赋予多步推理能力,更先进的架构如 AutoGPT、OpenDevin 等还集成了代码解释器、文件系统访问、网络搜索等工具调用能力。在论文复现场景中,智能体需要完成一个复杂的认知链:解析 PDF 格式的学术论文、理解数学公式和算法描述、将方法论转化为可执行代码、配置实验环境并运行训练过程、最后将输出结果与论文数值进行对比分析。
这场活动的背景值得深思。ICML(International Conference on Machine Learning)是机器学习领域三大顶级学术会议之一(另外两个是 NeurIPS 和 ICLR),由国际机器学习学会主办,自1980年创办以来一直是学术界和工业界展示前沿研究成果的核心平台。据主办方介绍,2026 年 ICML 共收到超过 23,000 篇投稿,最终接收约 6,000 篇——相比 2025 年的 12,000 篇接收论文,接收量近乎翻倍,呈现指数级增长。近年来,随着深度学习和大语言模型的兴起,AI 领域的研究论文数量经历了前所未有的膨胀,从2020年到2026年顶会投稿量几乎每两年翻一番。这种爆发式增长,很大程度上正是由 AI 智能体降低了实验和论文撰写门槛所推动的——AI 辅助写作工具和自动化实验框架大幅降低了论文产出的边际成本。
投稿量的结构性增长背后还有更深层的原因:全球 AI 人才池的快速扩大(中国、印度等国的 AI 研究机构数量在2020-2026年间增长了数倍)、工业界研究实验室(如 Google DeepMind、Meta FAIR、字节跳动等)大量投入基础研究模糊了学术与产业的界限、以及预印本文化(arXiv-first)使得研究传播更加迅速。这种增长对评审系统造成了巨大压力——每位评审者需要审阅的论文数量不断增加,而高质量评审者的供给增速远低于投稿增速。
问题也随之而来:在如此庞大的论文数量面前,人工评审是否还能保证质量?主办方举了一个例子——一篇被评为 Spotlight 的论文,其评审意见中直言"我的置信度较低,因为我没有仔细检查所有证明"。这暴露出海量投稿背景下评审的力不从心。

用AI智能体大规模审查论文质量
黑客松的核心思路是:既然社区拥有大量 AI 智能体,为什么不让它们分头认领论文,尝试复现其中的每一个关键论断?
这一思路的提出有着深刻的学术背景。科研可复现性危机(Reproducibility Crisis)是近十年来学术界最受关注的问题之一。2016年 Nature 杂志的一项调查显示,超过70%的研究人员尝试复现他人实验失败,超过50%甚至无法复现自己的实验。在 AI/ML 领域,这一问题尤为突出:许多论文的实验依赖特定的随机种子、未公开的超参数调优过程、专有数据集或昂贵的计算资源。传统的同行评审制度主要依赖评审者的纸面判断,很少要求实际运行代码进行验证,这使得不可复现甚至存在错误的论文得以通过评审。
这一危机最早在心理学领域引起广泛关注——2015年开放科学协作组织尝试复现100项心理学研究,结果仅有36%能够成功复现。在机器学习领域,2019年 Dodge 等人的研究发现,许多 NLP 论文报告的最佳结果实际上来自大量未报告的超参数搜索,存在严重的选择性报告偏差。Papers With Code、ML Reproducibility Challenge 等社区倡议试图通过代码共享和系统性复现来缓解这一问题,但受限于志愿者的时间和计算资源,覆盖范围始终有限。本次黑客松首次展示了 AI 智能体在规模化解决这一问题上的潜力。
主办方在活动前做了充分准备:他们通读了所有论文,从每篇中提取出 3 到 8 个关键论断(claims),作为复现的验证目标。论文类型覆盖了从纯理论到纯实证的各个层次。
最终的数据令人印象深刻:
- 共完成约 6,800 次复现尝试
- 涉及 2,200 篇独立论文,占整个 ICML 会议的 34%
- 约 35,000 个论断被判定
这几乎可以确定是迄今为止针对大型 AI 会议、以社区形式开展的最大规模复现工程。此前也有个人主导的小规模复现尝试,但从未达到如此量级。
可复现的复现:Trackio 基础设施如何运作
本次活动的一大亮点在于"复现本身也是可复现的"。主办方使用了开源库 Trackio 来记录整个过程。Trackio 类似于 Weights & Biases 或 Neptune 等实验追踪工具,但额外提供了一个称为"Logbook(日志本)"的功能。
实验追踪(Experiment Tracking)是现代机器学习工程的核心实践之一。Weights & Biases(W&B,2017年成立)以其流畅的可视化和团队协作功能著称,MLflow(2018年由 Databricks 开源)侧重于模型生命周期管理,而 Neptune 则强调元数据管理的灵活性。Trackio 在此基础上进一步创新,其 Logbook 功能不仅记录最终结果,还完整保留了从代码执行到产出文件的全过程。这种设计理念源自"可审计 AI"(Auditable AI)的思想——当 AI 系统做出判断时,人类应该能够追溯其完整的推理链和证据基础。Trackio 的差异化还在于其与 Hugging Face 生态系统的深度集成,使得实验记录可以作为 Hugging Face Space 直接部署为可交互的 Web 应用,大大降低了结果分享和审查的门槛。
其工作方式很直接:原本运行 python script.py,现在改为通过 trackio code python script.py 执行,这样脚本代码及其所有输出都会被记录到 Logbook 中。更重要的是,脚本产生的产物——CSV 文件、模型检查点、数据集等——也会一并被保存到工作区。

每个 Logbook 由三部分构成:人类可读的代码与输出、智能体的原始交互轨迹(trace),以及生成的全部文件。这些日志本都会推送到 Hugging Face,可作为 Space 查看,轨迹可作为数据集查看。值得一提的是,这些日志本经过优化,可被智能体高效读取——你甚至可以让自己的智能体去分析多个复现结果,判断它们是否真正独立。在本次活动中,这意味着每一个"论文被证伪"或"论文被验证"的结论,都可以被第三方独立审查和验证。
结果一:超过1100篇论文的关键论断被成功验证
那么,ICML 2026 到底可复现吗?先说好消息。
在检验的约 2,000 篇论文中,超过 1,100 篇论文至少有一个关键论断被独立验证。具体细分:
- 266 篇被完全复现,即每一个论断都得到验证
- 632 篇通过小规模实验部分复现:由于某些论断依赖专有数据集或需要庞大算力,参与者被鼓励用小规模或合成数据集进行验证
- 约 4,000 个独立论断通过真实实验得到确认
关于小规模实验的方法论值得进一步说明。在复现研究中,完全按照原论文的规模重复实验往往是不现实的——许多 ICML 论文的实验可能需要数百个 GPU 小时或访问 TB 级的专有数据集。因此,本次活动采用了"缩放验证"(scaled-down verification)的方法:在更小的数据集、更少的训练轮次或更低的模型参数量下,验证论文声称的趋势和相对关系是否成立。这种方法的有效性基于机器学习中的一个经验性观察:许多算法的相对性能排序在不同规模下保持一致,即所谓的"缩放一致性"(scaling consistency)。Kaplan 等人2020年提出的神经网络缩放定律(Neural Scaling Laws)表明,模型性能通常随数据量和参数量呈幂律关系增长,且不同方法之间的相对优势通常在较小规模下就能观察到。然而,这并非总是成立——某些方法可能在小规模下表现平平,但在大规模下展现出"涌现"能力(emergent capabilities)。因此,缩放验证提供的是概率性而非确定性的证据。本次活动中,主办方鼓励参与者在日志中明确标注实验规模与原论文的差异,以便后续评估时考虑这一局限性。
主办方特别提到一篇被 8 位不同参与者同时复现的论文。多人独立复现的价值巨大——相比会议评审中通常仅有 3-4 名评审,本次部分论文获得了多达 12 人的复现验证,形成了强有力的交叉印证。这正是理想中的"金标准":论文被众多独立个体反复验证。
结果二:约23%的论文存在可复现性问题
负面结果同样值得关注。约 23% 的论文未能如宣称的那样被完全复现,其中至少 496 篇论文有一个论断被证伪或存在争议。
主办方谨慎地指出,不应简单认为这 496 篇论文"错了"。可能的原因包括:涉及专有数据集、小规模实验的趋势与大规模实验不一致等。

但确实存在更严重的情况:约 49 篇论文几乎被完全证伪,所有主要论断都存在问题。这些论文往往同时包含理论和实证结果,而智能体在两方面都发现了缺陷。综合来看,大约 2%-3% 的受检论文看起来确有实质性问题。
一个有趣的发现是"智能体的严谨程度不一":某些论文出现了不同团队得出相反结论的情况。有的智能体会对定理表述吹毛求疵,指出"某个假设不成立"或"证明跳过了一步"——这些可能属实,但更应称为"未言明的假设"而非真正的缺陷。这反映了 AI 系统在形式化验证与实际学术规范之间的张力:数学证明中省略"显然"步骤是常见做法,但严格的自动化验证器可能将其标记为逻辑跳跃。这种现象也揭示了一个更深层的问题——当我们用 AI 系统来判断学术论文的正确性时,如何校准 AI 的严格程度使其与学术社区的共识标准一致,本身就是一个有待解决的元问题。
对于确认存在问题的论文,主办方已开始联系原作者核实。据介绍,目前所有回复的作者都确认确实存在问题,并对被发现问题表示感谢,正准备在 arXiv 上发布勘误或更新论文。完整的日志本在此过程中发挥了关键作用,让作者能够逐步审查智能体的判断依据。
获奖者:人机协作的最佳范例
Hugging Face 一方共设立了四个奖项:
最佳证伪奖授予了 Utkarsh(Hugging Face 账号 our Chanters)。他复现了一篇关于"最优鲁棒性与学习增强分页"的论文,同时在理论和实证结果中发现错误,并给出了正确的渐进结果。评奖标准不仅要指出论断有误,还要给出更准确的表述。
最佳人机协作奖授予了 Kwabena Anim(账号 Kwab's Hug)。他复现的是一篇关于扩散 Transformer 量化方法的论文。扩散 Transformer(Diffusion Transformer,简称 DiT)是当前图像生成领域的主流架构,由 Peebles 和 Xie 于2023年提出,用 Transformer 替代了传统扩散模型中的 U-Net 骨干网络,被用于 Stable Diffusion 3、FLUX、Sora 等前沿模型中。量化(Quantization)是将模型权重从高精度浮点数(如 FP16 或 FP32)压缩为低精度表示(如 INT8 或 INT4)的技术,目的是减小模型体积和加速推理。对扩散 Transformer 进行量化面临独特挑战:扩散模型在推理时需要执行数十到数百步的去噪迭代,每一步的微小数值误差都会累积放大;自注意力计算中的 softmax 操作对数值精度极为敏感;且不同时间步的激活值分布差异巨大,使得静态量化方案难以适用。此外,图像质量的评估本身就具有主观性——FID、CLIP Score 等自动化指标并不能完全捕捉人类对图像美学和细节的感知。
这位参与者让智能体构建了一个 Web UI,用于对比原始图像与量化后图像的质量,然后由人类通过该界面亲自评估——将可自动化的量化工作交给智能体,把需要人类判断的评估环节留给自己,堪称人机协作的典范。

总榜第二名(1,000 美元 Hugging Face GPU 额度)由账号 Procreations(SSH)获得,他复现了 352 篇论文,接近整个会议的二十分之一。总榜第一名(2,000 美元额度)由账号 Sherpa 获得,复现了 363 篇论文。值得注意的是,单个参与者能在有限时间内复现数百篇论文,这本身就证明了 AI 智能体在自动化科研工作流中的巨大潜力——如果没有智能体的辅助,即使是最高效的研究者,手动复现一篇论文通常也需要数天到数周时间。
对学术生态的启示:用AI审查AI研究
这场黑客松不仅是一次技术展示,更揭示了 AI 时代学术发表面临的深层挑战。当论文产出因 AI 工具而爆炸式增长时,传统的人工评审机制正逐渐失灵。而讽刺又充满希望的是,同样是 AI,也可能成为大规模、可审计的复现验证的解决方案。
这种模式的意义在于它改变了学术质量控制的范式。传统模式下,论文发表前由少数评审者进行一次性审查;而本次活动展示了一种"发表后持续验证"的可能性——论文在发表后仍然接受社区的持续审查和复现检验。这与软件工程中"持续集成/持续测试"(CI/CD)的理念异曲同工:质量保证不是一个节点事件,而是一个持续过程。正如代码仓库中的每次提交都会触发自动化测试套件,未来的学术论文或许也会在发表后持续接受自动化的可复现性检验。这种范式转变还可能改变学术激励结构——如果论文发表后的可复现性记录成为公开信息,研究者将有更强的动机确保自己工作的稳健性。
主办方表示未来还将举办类似竞赛。相关结果已在 Hugging Face 的 ICML 2026 Agent Reproduction Challenge 页面公开,任何人都可以查阅这些完整可追溯的复现记录。这种"用 AI 审查 AI 研究"的模式,或许正是应对科研可复现性危机的一条新路径。
核心要点
相关推荐

Claude自主设计蛋白质成功率35%,远超人类专家水平
Anthropic的Claude模型在自主设计靶向疾病蛋白质任务中取得35%实验成功率,远超人类专家10%-15%的平均水平。本文深入解析这一湿实验验证成果对生物医药行业的潜在影响。

Perplexity Discover多语言支持突然消失,国际用户为何不满?
Perplexity Discover新闻资讯功能突然取消多语言支持,仅保留英文内容,引发国际用户强烈不满。本文分析功能回退的可能原因,探讨AI产品国际化面临的资源权衡与用户信任挑战。
