ChatGPT发现黎曼猜想论文错误,作者确认:AI审计学术论文的新范式

一个非数学家的意外发现
近日,一则来自Reddit的帖子在AI与数学社区引发热议。一位自称完全没有数学背景的普通用户声称,他借助ChatGPT在两篇近期发表的关于黎曼猜想的论文中,发现了一处归一化(normalization)错误,并且这一发现最终得到了论文作者本人的确认。
值得强调的是,发帖者本人反复澄清:他们并没有证明黎曼猜想。这与网络上偶尔出现的"AI破解世纪数学难题"的夸张标题截然不同。真正引人深思的,是这件事背后所反映出的AI辅助学术研究的新范式。

关于黎曼猜想
黎曼猜想是数学中最著名的未解决问题之一,由德国数学家伯恩哈德·黎曼于1859年提出。它关注的是黎曼zeta函数ζ(s)的非平凡零点分布——猜想认为这些零点的实部都恰好等于1/2,即全部落在所谓的"临界线"上。
黎曼zeta函数ζ(s)=Σ(1/nˢ)最初由欧拉在实数域上研究,用于证明素数有无穷多个。黎曼的天才在于将其解析延拓到整个复平面(除s=1处的极点外),并发现了其非平凡零点的分布与素数计数函数π(x)之间的精确关系。这一解析延拓是复分析中最优美的构造之一:原始级数仅在Re(s)>1时收敛,但通过函数方程ξ(s)=ξ(1-s)——其中ξ是完备化后的zeta函数——黎曼建立了s与1-s之间的深刻对称性,而这正是临界线Re(s)=1/2的几何来源。更为根本的是,zeta函数满足欧拉乘积公式ζ(s)=Π(1-p⁻ˢ)⁻¹(对所有素数p求积),这一公式将分析学对象的性质与算术对象直接联系起来,是整个解析数论大厦的基石。
具体而言,通过显式公式(explicit formula),素数的分布可以分解为一系列振荡项的叠加,每一项恰好对应zeta函数的一个零点。如果所有非平凡零点都在临界线Re(s)=1/2上,那么素数计数函数与其近似li(x)之间的误差项将被限制在O(√x·log x)的量级——这是理论上可能达到的最优估计。目前已有超过10万亿个零点被数值验证落在临界线上,但数值验证永远不能替代严格证明。
这个看似纯粹抽象的命题实际上与素数的分布规律有着深刻联系:如果黎曼猜想为真,我们将对素数在自然数中的分布获得极为精确的描述。它被列为克雷数学研究所的七大千禧年问题之一,悬赏100万美元。160多年来,无数顶尖数学家对其发起挑战,至今未获完整证明,但已有大量部分结果和等价表述被建立起来。值得一提的是,黎曼猜想的影响远超纯数学本身——在密码学中,许多公钥加密系统的安全性分析依赖于对素数分布的精确理解;在物理学中,zeta函数零点的统计分布与随机矩阵理论(特别是GUE分布)之间存在惊人的对应关系,这一联系由Montgomery和Dyson在1970年代发现,暗示着数论与量子混沌之间可能存在尚未被理解的深层结构。
事件经过
据发帖者描述,他并非带着明确目标去"攻克"黎曼猜想,而是以一种探索式的方式使用ChatGPT:让它不断深挖、尝试不同的思路、挑战既有假设,并检索近期发表的相关论文寻找有趣之处。
在处理两篇关于Jensen多项式双曲性(Jensen polynomial hyperbolicity)与黎曼猜想的论文时,ChatGPT注意到原始矩(moments,记为 M_n)与泰勒/Jensen系数之间存在一处归一化的不一致。问题的核心在于**阶乘归一化(factorial normalization)**处理上的偏差。
Jensen多项式是研究黎曼猜想的一条重要进路。其理论根源可追溯到Pólya和Jensen在20世纪初关于实零点多项式的工作。给定一个实整函数f(x)=Σ(γₖ/k!)xᵏ,其d阶n次Jensen多项式定义为J_d^n(x)=Σ_{j=0}^{d} C(d,j)·γ_{n+j}·xʲ。Pólya证明了一个深刻的结果:如果f具有黎曼猜想所要求的性质(即其Fourier对偶只有实零点),则对每个固定的d,当n充分大时J_d^n(x)的所有零点均为实数。
2019年,Griffin、Ono、Rolen和Zagier等数学家发表了一项里程碑式的工作,将黎曼猜想与Jensen多项式的双曲性联系起来——所谓"双曲性"是指多项式的所有零点均为实数,这与黎曼猜想要求零点落在临界线上的条件存在精确的数学对应关系。他们证明了对于足够大的多项式阶数,与黎曼ξ函数相关的Jensen多项式确实具备双曲性。这一方法的核心思想属于"逼近理论"在数论中的应用:将无穷维对象(整函数的零点分布)通过有限维截断(多项式)来逐步逼近。具体而言,他们证明了对每个固定阶d≥1,存在N(d)使得当n>N(d)时,相应的Jensen多项式J_d^n(x)是双曲的。这可以理解为黎曼猜想的"渐近"验证——虽然不能覆盖所有情况,但证明了在统计意义上零点确实倾向于落在临界线上。这一方法将一个分析数论问题转化为关于多项式零点分布的代数问题,为验证黎曼猜想提供了全新视角。虽然这不直接证明黎曼猜想,但首次从Jensen多项式框架为猜想提供了无穷多个一致性验证。
而所谓归一化(normalization)问题,在数学中是一种极为常见但容易产生混淆的技术细节。在涉及幂级数展开和多项式系数的场景中,不同的归一化约定会导致系数相差一个阶乘因子(如n!)。例如,泰勒展开 f(x)=Σaₙxⁿ 与 f(x)=Σ(bₙ/n!)xⁿ 两种写法中,系数aₙ和bₙ就相差n!倍。这类约定不一致问题有其系统性根源:不同的数学传统(法国学派偏好一种写法、德国学派偏好另一种)在符号选择上存在历史性差异;同一作者在不同论文中也可能采用不同约定;当一篇论文引用另一篇论文的结果时,如果两者的归一化约定不同且作者未显式标注转换因子,错误就会悄然引入。这类问题在组合数学和特殊函数领域尤为常见,因为阶乘、二项式系数、Pochhammer符号(升阶乘与降阶乘)、Gamma函数等的定义方式存在多种流行变体。在Jensen多项式与矩的关联中,M_n的定义是否包含阶乘归一化,会直接影响后续推导的所有不等式和界限估计。这种约定的不一致看似微小,但如果在推导链条中某处采用了一种约定而另一处采用了不同约定,就可能导致最终结论出现数量级的偏差,进而与已知定理产生矛盾。
这一偏差并非无关紧要——它严重到使论文中的某个结论似乎直接与一个已知定理相矛盾。发帖者随后让ChatGPT起草了一封措辞礼貌的邮件,说明这一问题并发送给了论文作者。作者不仅回复确认了问题的存在,甚至在邮件中称呼这位业余爱好者为"教授(Professor)"。
为什么这件事值得关注
通过同行评审的错误被AI捕获
这件事最耐人寻味的一点在于:涉及的两篇论文都是已经正式发表的,意味着它们通过了同行评审流程。数学论文的审稿通常极为严格,尤其是与黎曼猜想这类核心问题相关的工作。
然而,同行评审制度存在公认的结构性局限。现代同行评审制度始于17世纪的《哲学汇刊》,但直到20世纪中叶才成为学术出版的标准流程。审稿人通常是无偿志愿服务的同行专家,时间精力有限;对于高度技术性的长篇数学证明,审稿人往往将主要注意力集中在核心思路的正确性上,而对符号约定、系数的具体数值、辅助引理的边界条件等"机械性"细节投入的精力相对不足。在数学领域,著名案例包括1993年Andrew Wiles首次提交的费马大定理证明中被审稿人Nick Katz发现的缺陷(后经一年修补成功),以及2012年望月新一关于abc猜想的论文至今争议未休。数学论文的审稿周期常达数年,一篇50页以上的证明需要审稿人投入数百小时逐行验证,而审稿人通常仅有1-2位且无报酬。统计研究表明,即使在顶级数学期刊,发表后被发现需要勘误(erratum)甚至撤稿的情况并不罕见。这并非审稿人不负责任,而是人类认知资源的固有局限。
值得补充的是,数学审稿与其他学科有本质不同。在实验科学中,审稿人主要评判方法是否合理、数据是否支持结论;但在纯数学中,审稿人的任务是验证每一步推导的逻辑正确性,这使得数学审稿成为所有学科中要求最高、工作量最大的审稿形式。著名数学家Terence Tao曾公开讨论过审稿系统的困境:顶尖数学家的时间极为宝贵,而详细验证他人的长篇证明通常被视为"学术公共服务"而非个人学术贡献,这导致高质量审稿人的供给长期不足。
归一化错误——特别是像阶乘系数这类容易被视为"技术细节"的部分——恰恰是人类审稿人容易忽略的地方。这类错误往往不涉及核心思路的谬误,而是在符号约定、系数展开或标准化定义上的细微不一致。而这,正是大语言模型在符号推理与交叉比对方面开始展现价值的领域。
AI的角色:不是证明者,而是审计者
必须清醒地看到,ChatGPT在这里扮演的并非"证明黎曼猜想"的角色。它做的事情更接近于一个耐心且不知疲倦的审计者(auditor):
- 逐行比对不同论文中的定义与系数约定
- 发现M_n与泰勒/Jensen系数之间的归一化不一致
- 识别出由此推出的结论与已知定理的冲突
这是一种典型的"发现矛盾"而非"构建证明"的任务。对于当前的大语言模型而言,识别逻辑不一致、比对符号约定、检查推导链条中的断裂点,正是其相对擅长的能力方向。相比之下,从零构建一个原创的、严密的数学证明仍然是极具挑战的任务。
从技术角度看,大语言模型处理数学的能力来源于其在大规模文本语料(包括arXiv预印本、数学教科书、MathOverflow和Stack Exchange讨论等)上的预训练。模型并不进行"真正的"符号推理或语义理解,而是通过统计模式匹配来生成看似合理的推导。这解释了为何它在符号层面的一致性检查上表现较好——这些任务本质上可以归结为文本模式匹配与序列比对;而在需要构造新对象、进行反直觉推理或选择恰当的证明策略时表现较差——这些任务需要对数学结构的深层理解,而非表面文本的相似性。Chain-of-thought(思维链)提示策略可以部分缓解这一问题,通过引导模型逐步展开推理过程来减少跳步错误,但不能从根本上赋予模型真正的数学直觉。
当前大语言模型在数学方面的能力呈现明显的非均匀分布:在符号操作、模式识别、定义比对等任务上表现较强,因为这些本质上可以归结为文本匹配与逻辑一致性检查;但在需要深层数学直觉、构造性证明、选择恰当的引理组合等创造性工作上仍然相当薄弱。与此同时,形式化证明助手与大语言模型的结合正在成为学术前沿方向。形式化证明助手(如Lean、Coq、Isabelle等定理证明器)的核心思想是将数学证明转化为计算机可验证的形式语言——Lean数学库(Mathlib)目前已形式化超过15万条定理,涵盖本科到研究生阶段的大量数学内容。2024年DeepMind的AlphaProof系统结合了AlphaZero风格的强化学习与Lean证明器,在IMO级别的竞赛题中达到了银牌水平,但其解题策略依赖于大量搜索和已知策略的组合,与人类数学家的创造性洞察有本质区别。Meta的HTPS(Hyper Tree Proof Search)项目则专注于自动定理证明的搜索效率。这些工具在封闭问题(有明确陈述待证的命题)上表现良好,但在开放性问题中——需要选择研究方向、构造新概念、发现未知联系——仍无法替代人类数学家的直觉。本次事件中ChatGPT所完成的工作——交叉比对约定、发现不一致——恰好落在当前模型能力的"甜区"。
需要保持的审慎态度
单一来源,尚待独立验证
这则消息目前仅来自一个Reddit帖子,且发帖者出于隐私考虑移除了论文与作者的身份信息。这意味着:
- 我们无法独立核实涉及的具体论文
- 无法确认作者"确认错误"的确切措辞与程度
- "作者称呼其为教授"这一细节也可能只是礼节性表达,而非学术认可
因此,在事实层面,这仍是一个单一来源、未经交叉验证的轶事。它的价值更多在于启发性,而非作为AI能力的权威证据。
从学术社区的反应来看,这类故事在社交媒体上的传播往往伴随着信息的放大与变形。Reddit作为一个匿名平台,其信息的可信度本身就需要审慎对待。在缺乏可重复验证的情况下,我们应当将这一事件视为一个有趣的案例研究,而非一个已被确证的事实。即使故事的核心内容属实,其细节——如错误的严重程度、对论文结论的实际影响、作者回应的完整语境——都可能与帖子中的叙述有所出入。
警惕AI幻觉的反向风险
同样你可能没注意到,大语言模型也可能"发现"根本不存在的错误——即产生所谓的幻觉(hallucination)。在数学场景下,模型可能因为误解某个符号约定,而错误地"指出"一处并不存在的矛盾。
大语言模型在数学推理中的幻觉问题有其独特形态。不同于自然语言中的事实性错误(如编造不存在的历史事件),数学幻觉往往表现为:模型生成看似严密实则跳步的推导(省略了不成立的中间步骤)、将不等价的数学对象混为一谈(如混淆L²范数与sup范数,或将条件收敛与绝对收敛混淆)、或者错误地"记忆"不存在的定理名称和结论(如引用并不存在的"Smith-Johnson引理")。2023年Frieder等人的研究("Mathematical Capabilities of ChatGPT")系统测试了GPT-4在研究级数学问题上的表现,发现其在约30%的情况下会生成包含微妙逻辑错误但表面流畅的"证明"。更为棘手的是,这些错误往往被包裹在正确的数学语言和合理的证明框架中,使得非专家极难识别。
这种现象在实践中并不少见:模型可能将不同论文中使用的不同但等价的定义误判为矛盾,或者在处理复杂的下标与上标时混淆对象,从而生成看似合理但实际错误的"纠错"报告。一个典型的失败模式是:模型正确识别了两篇论文使用了不同的记号,但错误地判断这种记号差异反映了实质性的数学矛盾,而实际上只是表述习惯的不同。这使得非专业用户尤其容易被误导,因为他们缺乏判断模型输出正确性的独立能力。
在本例中,由于作者本人确认了问题,这在很大程度上排除了幻觉的可能。但这也恰恰说明了一个关键点:AI发现的问题必须经过人类专家的验证,才能确立其真实性。人机协作的价值不在于AI单方面下结论,而在于AI提出线索、人类作出判断的闭环。这一模式——AI作为"假设生成器"、人类作为"假设验证器"——可能是当前技术条件下最有效的协作范式。
更深层的意义:AI正在重构科研参与门槛
发帖者用了一个词来概括自己的感受——"加速(Accelerando)"。这个词源自音乐术语(意为渐快),也是科幻作家查尔斯·斯特罗斯2005年同名小说的标题,描述技术奇点加速到来的图景。在那部小说中,Stross描绘了一个技术进步速率不断加快、最终超越人类认知能力极限的世界——这一意象与当前AI能力的快速迭代形成了有趣的呼应。抛开夸张的情绪,这件事确实触及了一个正在发生的趋势:
科研的参与门槛正在被重新定义。 一个没有数学专业背景的普通人,坐在家里,借助AI工具,能够审视最新发表的数学成果,发现一处通过了同行评审的疏漏,并与研究者建立起有效沟通。这在几年前几乎是不可想象的。
这并不意味着专业训练变得不重要——恰恰相反,理解归一化、Jensen多项式、黎曼猜想背景的能力,仍然掌握在专家手中。但AI正在成为一种"能力放大器",让更多人得以参与到高度专业化的知识审查与讨论中。这种现象可以类比为望远镜对天文学的影响:望远镜没有取代天文学家的理论素养,但它让更多观测者能够看到此前只有最大型天文台才能捕捉的现象。历史上类似的"能力民主化"浪潮并非首次出现——印刷术让知识传播不再局限于抄写员,互联网让信息获取不再局限于大学图书馆,开源软件让编程工具不再局限于商业机构。AI辅助研究可能是这一序列中最新也最深刻的一环,因为它触及的不仅是信息的获取,更是信息的理解与分析。
值得注意的是,这种"民主化"也带来了新的挑战。当非专业人士借助AI向专家发送大量可能错误的"纠错"邮件时,专家的时间可能被大量低质量的沟通所消耗。如何建立有效的过滤机制——让真正有价值的发现(如本例)能够到达研究者手中,同时减少噪音——将成为学术社区需要面对的新问题。这类似于开源软件社区中"issue triaging"(议题分类筛选)的挑战:当贡献门槛降低时,如何维持信号与噪音的合理比例?
对学术界而言,这也提出了一个前瞻性问题:未来的同行评审是否应该常规性地引入AI辅助的一致性检查? 让AI在论文发表前扫描符号约定、系数归一化、推导链条中的潜在矛盾,或许能显著降低此类技术性错误流入正式文献的概率。事实上,一些学术出版商和预印本平台已经在探索类似工具——例如用AI检测论文中的统计错误、引用不一致或图像重复等问题。Springer Nature在2023年开始试点使用AI工具检查提交论文的完整性,arXiv也在探索自动化的格式与引用校验。Elsevier的UNSILO系统使用NLP技术来辅助编辑评估论文的主题相关性和创新性;而Proofig等工具则专门检测图像操纵。将这一思路延伸到数学符号与推导的一致性检查,是一个自然且有价值的方向,尽管实现这一目标需要克服数学文本的高度形式化与自然语言混合表达之间的技术鸿沟——数学论文通常混合使用LaTeX公式、自然语言解释和图表,这种多模态表达使得自动化分析比纯文本场景困难得多。
结语
这则来自Reddit的故事,既不该被夸大为"AI攻克黎曼猜想"的神话,也不该被简单当作噱头一笑置之。它真实地展示了当前AI工具在知识审计、符号比对、逻辑一致性检查方面的实用价值,同时也提醒我们:AI是线索的提出者,人类专家仍是最终的裁决者。
在这场人机协作的实践中,最有价值的收获或许不是那处归一化错误本身,而是它所揭示的可能性——当每个人都拥有一个不知疲倦的智能助手时,知识的生产与审查将呈现出全新的图景。这不是AI取代数学家的故事,而是AI赋能好奇心的故事:一个普通人的探索欲望,加上一个强大工具的耐心执行力,产生了超越任何一方单独所能达到的结果。
从更宏观的视角看,这一事件或许预示着一种新型的"公民科学"(citizen science)的兴起。传统的公民科学项目——如Galaxy Zoo让志愿者分类星系形态、Foldit让玩家折叠蛋白质结构——依赖于将复杂问题分解为普通人可以完成的简单子任务。而AI辅助的公民科学则不同:它允许普通人在AI的引导下直接参与高层次的学术对话,而不仅仅是完成被预先设计好的简单任务。这一转变的深远影响,可能需要数年甚至数十年才能完全显现。
核心要点
相关推荐

Claude自主设计蛋白质成功率35%,远超人类专家水平
Anthropic的Claude模型在自主设计靶向疾病蛋白质任务中取得35%实验成功率,远超人类专家10%-15%的平均水平。本文深入解析这一湿实验验证成果对生物医药行业的潜在影响。

Perplexity Discover多语言支持突然消失,国际用户为何不满?
Perplexity Discover新闻资讯功能突然取消多语言支持,仅保留英文内容,引发国际用户强烈不满。本文分析功能回退的可能原因,探讨AI产品国际化面临的资源权衡与用户信任挑战。
