NeurIPS评审困局:Rebuttal解决了问题,审稿人为何拒绝涨分?

一场关于学术公正的公开呼吁
随着NeurIPS 2026评审季的临近,Reddit机器学习社区(r/MachineLearning)上一篇标记为「讨论」([D])的帖子引发了广泛共鸣。r/MachineLearning是Reddit上最大的机器学习学术讨论社区,拥有超过300万订阅者,成员涵盖从博士生到知名教授、从工业界研究员到独立研究者。由于其匿名性和开放性,许多研究者愿意在此讨论在正式场合难以公开表达的观点,使其成为学术界非正式舆论场的重要组成部分。
发帖者提出了一个看似基础、却长期困扰学术界的问题:当审稿人承认自己的疑虑在rebuttal(反驳/答辩)阶段已被作者充分解决后,为何还有大量审稿人拒绝调整评分?
发帖者直言这可能是一个「不受欢迎的观点」(hot take),但其核心诉求朴素而合理:如果你在评审意见中列出了一系列具体问题,而这些问题在答辩环节被逐一解决,那么无论你是否「喜欢」这篇论文或它的方法论,都应当相应地提高分数。

这条帖子之所以能击中神经,是因为它揭示了顶级AI会议同行评审机制中一个普遍存在的结构性矛盾——评分标准的主观化漂移。所谓「主观化漂移」是指评审标准从论文的客观质量指标(如方法的技术正确性、实验的充分性、结论的可重复性)逐渐滑向审稿人个人的主观判断(如研究方向是否「热门」、方法是否「优雅」、贡献是否「令人兴奋」)。这种漂移在投稿量激增的背景下尤为严重——当审稿人需要在有限时间内评审多篇论文时,往往会依赖直觉和第一印象来形成判断,而非逐条验证论文的技术贡献。研究表明,同一篇论文在不同审稿人之间的评分差异可达2-3分(满分10分),这种高方差本身就是主观性问题的直接证据。
值得注意的是,AI/ML领域的评审体系有其独特的历史背景。同行评审制度的起源可以追溯到1665年《哲学汇刊》(Philosophical Transactions)的创刊,但其现代形式——由匿名外部专家对投稿进行系统性评估——直到20世纪中叶才在大多数学术期刊中普及。与传统学科依赖期刊不同,计算机科学以会议论文为主要学术发表渠道,这意味着评审周期极短(通常3-4个月从投稿到最终决定),审稿人需要在高时间压力下做出判断。此外,AI领域的快速迭代特性使得研究的「新颖性」成为一个高度主观的标准——一个月前的创新可能在评审结束时已被其他团队独立实现或超越。
Rebuttal机制的设计初衷与现实落差
Rebuttal本应是评审纠错通道
在NeurIPS、ICML、ICLR等顶级会议的评审流程中,rebuttal环节被设计为一种关键的「纠错机制」。以NeurIPS为例,其完整评审流程一般包括:初审分配(由领域主席将论文分配给3-4位审稿人)、独立评审(审稿人在约3周内给出评分和详细意见)、作者答辩(rebuttal,通常为期一周)、审稿人讨论与分数更新、领域主席汇总做出最终决定。整个流程采用双盲制(作者和审稿人互不知晓身份),旨在确保评审的客观性。
虽然这些会议采用双盲制,但在实践中,完全的匿名性越来越难以维持。许多研究者会在arXiv上预印发表论文,审稿人通过搜索标题或关键技术即可确认作者身份。2023年的一项研究估计,在顶级ML会议中,约30-40%的论文可以通过公开预印本被去匿名化。这种「伪双盲」状态可能引入额外的偏见——知名实验室的论文可能获得更宽容的评审,而来自非知名机构的创新工作则面临更高的证明门槛。
审稿人先给出初步评分和意见,作者随后有机会针对性地回应:补充实验、澄清误解、修正表述、提供额外证据。这一设计的底层逻辑是——评审是一个动态修正的过程,而非一锤定音的判决。
理论上,如果审稿人的核心质疑(concern)被证明是基于误读,或者作者补充的实验数据填补了原有的空白,那么初始评分的依据就已经不再成立,评分理应随之更新。
在实际操作中,rebuttal通常有严格的篇幅限制——NeurIPS一般限制在约5,000字符以内(包括对所有审稿人的回复),这迫使作者必须精准地优先处理最关键的问题。这种限制本身就创造了一种策略性博弈:如果审稿人提出了大量细碎问题,作者可能无法在有限篇幅内逐一回应,从而给审稿人留下「问题未解决」的印象。经验丰富的研究者通常会采用结构化的回复策略:先回应可能直接影响评分的核心质疑,再处理次要问题,最后用表格形式总结每个concern的解决状态。
现实中的「氛围评审」现象
然而现实是,许多审稿人在答辩后陷入了发帖者所描述的怪圈:一方面在公开回复中承认「感谢作者的澄清,我的疑虑已被解决」,另一方面却在评分栏保持原判,理由往往含糊其辞——「我还是不太看好这个方向」「整体感觉不够惊艳」。
发帖者用了一个精妙的词来概括这种现象:审稿人只是「不vibe这篇论文」(don't vibe with the paper)。换言之,评分不再取决于论文是否严谨、贡献是否成立,而取决于审稿人个人的主观偏好和第一印象。
这种行为背后有深层的心理学机制。认知心理学中的「锚定效应」(anchoring effect)——由Tversky和Kahneman于1974年首次系统描述——指人们在做判断时会过度依赖最初获得的信息(即「锚」)。在评审场景中,审稿人的初始评分就是一个强力锚点——一旦给出,后续信息(包括rebuttal中的新证据)对最终判断的影响力会显著降低。此外,「承诺与一致性」(commitment and consistency)这一社会心理学原理也在起作用:人们倾向于维持与先前行为一致的立场,改变评分相当于承认自己的初始判断有误,这在心理上构成了一种认知负担。这两种效应的叠加,使得即使审稿人在理性层面承认问题已解决,情感和认知惯性仍然阻碍其更新评分。
为什么审稿人不涨分是严肃的系统性问题
评审信号失真影响论文录用质量
当rebuttal无法有效影响评分时,整个评审系统就失去了自我修正的能力。作者花费大量精力撰写答辩、补充实验,得到的却是「你说得对,但我不改分」的回应,这不仅打击科研积极性,更让评审结果沦为噪声。
更严重的是,这种行为破坏了评审分数作为「质量信号」的可信度。领域主席(Area Chair)在做最终决策时,依赖的正是审稿人评分及其变化趋势。每位AC通常负责监督20-30篇论文的评审过程,其职责包括:确保审稿质量、引导审稿人之间的讨论、在审稿人意见分歧时做出裁判性判断、向高级领域主席(Senior Area Chair)提交录用建议。AC在做决策时,主要参考的信号包括审稿人的初始评分、rebuttal后的分数变化(分数上调通常被视为论文质量的正面信号)、审稿人之间的讨论质量、以及论文本身的内容。
AC的角色本质上是一个信息聚合者,但在实践中面临严重的信息不对称问题。一位典型的AC可能需要在最终决策阶段的1-2周内处理20-30篇论文的评审结果,这意味着平均每篇论文的决策时间不超过2-3小时。当审稿人评分不变但文字承认问题已解决时,AC面临的解读困难尤为突出——这到底意味着论文质量确实不够,还是审稿人懒于更新评分?一些资深AC会采用「校准会议」(calibration meeting)的方式与其他AC交叉检查边界案例,但这种做法并非制度性要求,完全取决于个人责任心。当审稿人的评分无法准确反映论文经过答辩后的实际状态时,AC就需要花费大量额外时间亲自阅读论文和答辩内容,这在论文量巨大的情况下几乎不可能对每篇都做到。如果分数不能反映论文经过答辩后的真实状态,AC的判断也会被误导。
科学探索的多样性被压缩
发帖者的最后一句话点出了更深层的价值观:「科学研究之美,在于我们每个人都能探索自己认为有意义的想法,而这些想法的价值未必对每一位审稿人都显而易见。」
这实际上是在批评一种评审霸权——审稿人以个人品味作为门槛,将不符合自己审美的研究方向拒之门外。历史上无数突破性工作在诞生之初都不被主流看好。如果评审机制默许「我不喜欢所以我压分」,那么真正具有开创性、非共识的研究将更难通过评审关卡。
审稿人是否有权在rebuttal后坚持原分?
值得指出的是,这个议题并非没有争议。反方观点认为,rebuttal解决「具体列出的疑虑」并不等于论文整体达到了接收标准。
一种常见的辩护是:审稿人的初始评分本身可能已经慷慨地给了作者答辩的机会,即「我先按解决问题的假设打了分,如果你没解决就该降分,解决了维持原分」。在这种框架下,rebuttal的作用是「守住」而非「提升」分数。
此外,也存在审稿人未能在初评中完整列出所有顾虑的情况——答辩解决了列出的三个问题,但审稿人在深入阅读后又发现了新的、更本质的缺陷。这种情况下维持低分有其正当性,但前提是审稿人应当明确沟通新的理由,而非以「不vibe」搪塞。
对科研社区的启示与改进建议
这场讨论的价值,远超NeurIPS 2026本身。它折射出AI学术界在论文投稿量爆炸式增长背景下的评审质量危机。AI学术会议的投稿量在过去十年间经历了指数级增长——以NeurIPS为例,2014年的投稿量约为1,700篇,到2023年已飙升至超过13,300篇,增长近8倍。ICML和ICLR也呈现类似趋势。这种增长带来的直接后果是:合格审稿人的供给严重不足,许多资历较浅的博士生甚至硕士生被拉入审稿队伍;单个审稿人的工作负担加重,每人通常需要在3-4周内评审4-6篇论文;评审质量难以保证,「快餐式评审」成为常态。在这种背景下,rebuttal机制的重要性反而更加凸显——它是修正草率初评的最后防线。
对审稿人而言,专业性意味着:评审意见应当具体、可操作;一旦提出的问题被解决,就应诚实地更新判断;如果坚持低分,必须给出清晰、可辩驳的理由,而非诉诸模糊的个人感受。
对作者而言,这也提醒我们在rebuttal中要精准地「关闭」每一个疑虑,用数据和逻辑而非情绪去回应,让审稿人无从以「氛围」为由压分。
对会议组织者而言,或许需要在流程设计上引入更强的问责机制。事实上,近年来多个顶级会议已开始探索相关改革:ICLR率先引入了评审质量评分系统,允许作者和AC对审稿人的评审质量进行反馈,低质量审稿人可能在未来被降低优先级或排除出审稿人池;NeurIPS从2021年起引入了「一致性实验」(consistency experiment),随机将部分论文分配给两组独立审稿人,以量化评审系统的噪声水平——2022年的实验结果显示,约50%的论文在两组审稿人之间会得到截然不同的接收/拒绝决定,这一惊人数据直接推动了后续改革讨论;此外,OpenReview平台的采用使得评审过程更加透明,部分会议已开始公开已接收论文的完整评审记录。
除了上述措施外,学术界正在探索更多前沿的评审改革方案。其中包括:基于LLM的辅助评审系统——2024年已有研究表明,GPT-4对论文的评估与人类审稿人的一致性达到约70%,部分会议开始实验性地使用AI生成初步评审意见供人类审稿人参考;「开放评审」(open review)模式——不仅公开评审内容,还公开审稿人身份,理论上可以增加问责压力,但也引发了关于初级研究者是否敢于对资深学者的论文提出批评的担忧;「彩票式评审」——对于处于接收边界的论文,部分学者提议直接采用随机录取,以坦诚地反映评审系统固有的噪声水平,而非制造确定性的假象。此外,TMLR(Transactions on Machine Learning Research)作为一本新创刊的滚动评审期刊,采用了「达标即录」(accept if above threshold)的标准而非竞争性排名,试图从根本上改变激励结构。
未来或许还需要要求审稿人在维持评分时必须明确说明rebuttal未能解决的具体理由,让「不改分」也需要付出解释成本。
归根结底,同行评审是学术共同体自我治理的基石。让评分回归证据、回归论文本身的质量,而非审稿人的个人品味,是维护这一制度公信力的必要前提。
核心要点
核心要点
相关推荐

李飞飞谈AI:视觉智能、创造力边界与人类主体性
斯坦福教授李飞飞在Huberman Lab播客深度解析AI与视觉科学的关系,探讨ImageNet如何引爆现代AI,阐述AI的能力边界、医疗应用前景,以及为何人类主体性是AI发展的核心命题。

DeepSeek Harness实测:插件化Agent框架的核心优势解析
深入实测DeepSeek Harness开源Agent框架,解析其插件化架构设计、编码能力、安装部署方式及与Claude Code的对比,帮助开发者了解这款可扩展Agent开发底座的真正价值。

10美元搭建50万域名搜索引擎:独立开发者的周末项目启示
一位独立开发者仅用一个周末和10美元成本,搭建了覆盖50万域名的垂直搜索引擎。本文深入分析低成本搜索引擎背后的技术栈、垂直搜索的差异化机会,以及独立开发者快速验证想法的方法论。