英伟达论文被爆代码漏洞,却斩获ICML Spotlight引争议

英伟达DreamDojo获ICML Spotlight却被曝代码全链路存在漏洞,引发对顶会评审机制的深层质疑。
英伟达基于Cosmos 2.5构建的机器人世界模型DreamDojo获得ICML Spotlight荣誉后,在Reddit引发激烈讨论。有研究者在复现过程中发现该论文的预训练、后训练和评估代码均存在严重bug,而论文本身的结果早已透露异常——投入4.4万小时人类数据与256块H100算力,相比基线模型的PSNR提升仅约0.5 dB,这一极不成比例的投入产出比既未引起作者团队反思,也未被评审质疑。事件将代码可复现性、大厂光环下的审查盲区、以及顶会评审在大规模训练时代的结构性局限推到聚光灯下,为整个AI研究社区敲响警钟。
一篇来自英伟达、基于Cosmos 2.5构建的机器人世界模型论文DreamDojo,近日在Reddit机器学习社区引发激烈讨论。这篇获得ICML Spotlight(亮点论文)荣誉的工作,被研究者指出其预训练、后训练及评估代码中均存在严重漏洞,而论文结果本身也透露出诸多值得警惕的信号。这起事件再度把顶会同行评审的可靠性推上了风口浪尖。
事件始末:从复现到发现漏洞
根据Reddit用户的描述,DreamDojo是英伟达基于其先前被引用约百次的Cosmos 2.5模型构建的机器人世界模型。研究团队号称收集了约4.4万小时的人类数据用于预训练,并使用256块H100 GPU进行训练。作者均是领域内知名且受尊敬的研究者,发表过大量经同行评审的论文。
问题出在复现环节。这位研究者在团队发布的GR1数据上尝试进行后训练,起初能够复现论文结果。但随后一位同事借助Claude的协助,在后训练代码中发现了一个关键bug——这个漏洞本质上让整个后训练流程的逻辑出了问题。顺着这条线索,他们进一步检查了项目的GitHub Issues,又发现另外两个被社区报告的bug,而这些bug直接影响到整个预训练阶段。
换句话说,按照这位研究者的说法,依据英伟达公开发布的代码,预训练、后训练和评估三个环节可能全部存在错误。他特别强调,这些代码写得非常糟糕,看起来并非AI生成,而更像是人工仓促编写的产物。
Cosmos 2.5是英伟达发布的一系列物理世界基础模型(World Foundation Model)的迭代版本,定位于为机器人、自动驾驶等具身智能场景提供高质量的视频生成与环境模拟能力。世界模型(World Model)的核心思路是让AI系统学习物理世界的运行规律,从而能够根据动作预测未来状态,为强化学习和机器人策略训练提供廉价的"虚拟仿真环境"。DreamDojo在Cosmos 2.5之上进行领域特化训练,试图提升其在机器人操作场景下的世界建模精度。这类工作的价值主张在于:通过大规模人类演示数据进行预训练,再用任务相关数据进行后训练(post-training),使模型更好地理解机器人与物体的交互物理规律,进而辅助下游策略学习。
疑点早已埋下:论文结果本身的异常
抛开代码问题不谈,论文结果本身其实早有蹊跷。发帖者指出,论文Table 4展示的性能提升极为边际——相比Cosmos 2.5,PSNR指标仅提升约0.5 dB。
这个数字放在整个投入规模下看,显得格外刺眼。投入4.4万小时的人类数据、数百小时的其他类型数据和机器人数据,再加上256块H100的庞大算力,最终换来的只是微乎其微的提升。发帖者直言:"这难道不可疑吗?"
他本人并不介意这项工作缺乏新颖性,也不介意数据未开源——真正令他震惊的是,当发现代码存在根本性错误后,论文中那些"异常微小"的结果反而变得合理了。换言之,代码的bug很可能正是导致模型几乎没有实质提升的根源。而作者和评审在面对如此不成比例的投入产出比时,竟然都没有产生警觉。
PSNR(峰值信噪比,Peak Signal-to-Noise Ratio)是图像与视频质量评估中最常用的客观指标之一,单位为分贝(dB),数值越高代表预测帧与真实帧越接近。在视频预测和世界模型领域,0.5 dB的提升属于极为细微的变化——通常只有在算法取得实质性改进时,才会看到数个dB量级的跨越式提升。值得注意的是,PSNR本身对感知质量的反映并不全面,但在评估世界模型的预测保真度时仍是重要参考指标。将如此微小的指标增益与4.4万小时数据集和256块H100(单卡租用成本约2-3美元/小时,256块连续训练数百小时意味着数十万美元级别的算力投入)相对照,收益与成本的极度失衡,本应触发基本的合理性审查。
两个灵魂拷问:作者与评审的失职?
发帖者抛出的质疑直指学术发表机制的核心:
第一,作者为何没有察觉? 投入海量资源和数据,却几乎没有换来任何实质性能提升,这本身就是一个强烈的危险信号。一支经验丰富的团队,理应在复盘时对这种投入产出失衡产生怀疑,进而回头审视自己的代码与流程。
第二,评审为何没有发现? 既然这篇论文获得了ICML Spotlight这一相当高的认可,意味着它经过了多位评审的严格审查。然而无论是异常的实验结果,还是公开代码中早已被社区报告的bug,似乎都没有在评审环节敲响警钟。
这起事件暴露出的,是机器学习顶会评审在面对大厂、知名团队、海量算力加持的"基础模型"类论文时,可能存在的审查盲区。当光环足够耀眼时,评审者是否还会去较真那些"反常识"的细节?
ICML Spotlight是国际机器学习大会中高于普通接收(Accept)但低于杰出论文(Outstanding Paper)的荣誉评级,通常授予前5%左右的录用论文,代表评审委员会认为该工作具有较高原创性和影响力。Spotlight论文往往在会议现场获得口头报告机会,并在学界传播中享有更高的能见度与引用潜力。正因如此,一旦Spotlight论文的研究可靠性受到质疑,其影响远不止于该论文本身——后续基于此成果构建的工作可能面临系统性的可靠性风险,而顶会的荣誉背书机制也会受到整体性的信任损耗。这也解释了为何此次事件在社区引发的反响远超一般的代码bug报告。
这件事折射出的行业隐忧
需要说明的是,上述内容目前主要源自单一爆料者在Reddit上的叙述,相关结论尚待英伟达官方及更多独立复现者的核实。但即便如此,讨论本身触及了几个值得整个AI研究社区深思的问题。
其一是基础模型军备竞赛下的质量焦虑。当"又一个基础模型"成为常态,研究的真正价值是否被海量数据和算力的叙事所掩盖?0.5 dB的提升被包装进一篇Spotlight论文,本身就反映了评价体系对"规模"的过度青睐。
其二是代码可复现性的重要性。正是因为英伟达公开了源代码,社区才有机会发现问题。这也从侧面印证了开源与可复现性对于学术诚信的关键作用——闭源的工作连被质疑的机会都没有。
其三是顶会评审机制的压力测试。随着投稿量激增、模型规模膨胀,评审者越来越难以对每一篇论文进行深度验证,尤其是涉及大规模训练的工作,几乎无法独立复现。这种结构性矛盾,正在侵蚀顶会荣誉的含金量。
无论DreamDojo事件的最终定论如何,它都为学界提供了一记警钟:知名机构、知名作者、顶级会议的三重背书,并不等于结果的正确性。真正的科学审查,终究要回到数据、代码和逻辑本身。
相关推荐

OpenSwarm:让智能体接管整台机器的AI优先操作系统
OpenSwarm是一款AI优先的操作系统,让智能体群接管整台机器——应用自生成、浏览器自驱动、多智能体协同作业。本文解析其核心理念、三大能力与现实挑战。

Claude Haiku 5.5发布:Anthropic最快的小模型详解
Anthropic发布Claude Haiku 5.5,定位最快最强的小模型,专为摘要、分类、编码子代理、客户支持等高频低成本任务打造。本文解析其应用场景与对开发者的价值。

OpenSEO:开源版Semrush,为AI Agent提供SEO数据能力
OpenSEO是一款开源的Semrush替代品,通过MCP协议为AI Agent提供SEO数据、工具与集成能力,并新增AI Visibility功能支持生成式引擎优化(GEO)。在Product Hunt登上榜单第3位。