AI攻克25年数学难题:人工智能如何改变数学研究

一个被搁置25年的数学难题
在数学与计算机科学的交汇地带,总有一些问题静静地躺在角落——它们不是无解,而是难到让研究者们暂时选择了绕道而行。近期引发广泛关注的一则消息是:AI系统成功解决了一个悬置约25年之久的数学老问题。这不仅是一次算法层面的胜利,更标志着人工智能在数学推理与科学发现领域的角色正在发生根本性转变。
所谓"25年问题",通常指那些在上世纪末被明确提出、却因当时的计算工具与理论框架限制而无法彻底攻克的命题。在数学史上,问题被搁置数十年并非罕见——费马大定理从1637年提出到1995年被Andrew Wiles证明,历时358年;四色定理在1852年提出后直到1976年才借助计算机完成证明。费马大定理之所以耗时如此之久,是因为费马时代的数学工具远不足以处理这一问题——最终的证明依赖于20世纪才发展起来的椭圆曲线理论、模形式和Galois表示理论。Wiles的证明长达129页,核心是建立半稳定椭圆曲线与模形式之间的对应关系(即谷山-志村猜想的特殊情形)。四色定理则代表了另一种范式——它是第一个本质上依赖计算机的重大数学证明,开创了"计算机辅助证明"的先河,也为当今AI数学证明的讨论埋下了伏笔。上世纪90年代末,组合数学、图论和计算复杂性理论中涌现了大量这样的问题:它们的陈述简洁明了,但解决路径涉及天文数字级的组合爆炸,超出了当时计算工具和人类直觉的可及范围。
所谓"组合爆炸",是计算复杂性理论中的核心概念。当问题规模线性增长时,可能的解的数量呈指数级甚至更高阶增长。例如,旅行商问题中n个城市有(n-1)!/2种可能路线,仅20个城市就产生约6×10^16种组合。上世纪90年代,随着互联网和基因组学的兴起,大量组合优化问题被形式化提出,但当时最强的超级计算机(如IBM Deep Blue级别,每秒约2亿次运算)远不足以穷举这些空间。更关键的是,许多问题被证明属于NP-hard类别,意味着除非P=NP,否则不存在多项式时间的精确算法。P=NP问题是克莱数学研究所七大千年难题之一,悬赏100万美元。P类问题是可以在多项式时间内解决的问题,NP类问题是其解可以在多项式时间内验证的问题。如果P≠NP(这是大多数计算机科学家的信念),则存在一大类问题,我们能快速验证答案但无法快速找到答案。NP-hard问题至少与NP中最难的问题一样难,这意味着对这些问题,我们很可能永远找不到高效的精确算法,只能依赖近似算法、随机算法或启发式方法。这些理论壁垒使得研究者只能寄望于启发式方法或全新的数学工具。数学界习惯于将这类问题"暂时搁置",等待新方法的出现。而如今,AI恰恰扮演了那个"新方法"的角色。
为什么这个AI数学突破值得关注
与传统的暴力计算不同,现代AI系统(尤其是结合了大语言模型与符号推理的混合架构)能够在庞大的搜索空间中发现人类研究者难以察觉的模式与路径。这种混合架构融合了两大传统AI范式的优势:基于统计学习的神经网络擅长模式识别和直觉跳跃,基于逻辑规则的符号系统则提供严格的推理保证。大语言模型负责生成候选假设和启发式探索方向,符号推理引擎则验证每一步的逻辑合法性。
大语言模型(如GPT-4、Gemini)的数学能力源自其在海量文本语料(包括数学论文、教科书、证明库、代码仓库)上的预训练。通过自注意力机制和Transformer架构,模型学会了捕捉数学表达式中的结构模式、证明中的常用策略(如归纳法、反证法、构造法)、以及不同数学分支之间的类比关系。然而,这种能力本质上是统计性的——模型在"类似"的推理模式中进行插值和外推,而非基于公理系统进行严格推演。这也是为什么需要符号推理系统作为补充:LLM提供创造性的"猜测",符号系统提供确定性的"验证"。
这种架构的突破在于:神经网络提供了类似人类"数学直觉"的启发式搜索能力,而符号系统充当了不可腐蚀的逻辑防线,两者互补形成了超越任何单一方法的问题求解能力。
因此,AI不是简单地"算得更快",而是在某种意义上"想得不同"。当一个尘封多年的难题被重新拾起并解决时,背后反映的是方法论的迭代,而非单纯算力的堆砌。

AI在数学研究中的新定位
过去几年,人工智能在数学领域的应用经历了从"辅助工具"到"协作伙伴"的演变。早期,机器主要用于数值验证和大规模枚举;而现在,AI开始参与到猜想的提出、证明路径的探索,乃至完整证明的构建当中。
从验证到发现:DeepMind的持续突破
DeepMind、OpenAI等机构近年来持续在AI数学研究方向发力。其中最具代表性的突破包括:
FunSearch 是DeepMind于2023年底发表在Nature上的工作,其核心思想是将大语言模型与进化算法结合。系统让LLM生成Python程序(代表数学构造),然后通过自动评估器对程序输出的数学对象打分,高分程序被保留并作为上下文反馈给LLM以生成更优变体。这个过程模拟了生物进化中的变异-选择循环。
值得深入理解的是,FunSearch中使用的进化算法与传统遗传算法有本质区别。传统进化算法(遗传算法、进化策略等)的核心循环是:初始化种群→评估适应度→选择→变异/交叉→形成新种群。其理论基础是Schema定理(Holland, 1975),表明高适应度的"短模式"在进化中被指数级富集。然而传统变异算子是语法层面的随机扰动,在程序空间中大多数变异会产生语法错误或语义无关的改变。FunSearch的关键创新在于用LLM替代随机变异:LLM理解代码的语义结构,能够进行"有意义的变异"——比如修改算法逻辑、调整参数策略、甚至引入全新的启发式规则。这种"智能进化"大幅提高了搜索效率,使得在合理的计算预算内就能发现高质量的数学构造。
FunSearch在cap set问题上超越了人类已知的最佳构造,标志着AI首次在开放性数学研究问题上做出了超越人类现有成果的贡献。Cap set问题源自极值组合学,具体问题是:在F_3^n(三元有限域的n维向量空间)中,最大的不含三点共线子集(即没有三个元素的和为零向量)的大小是多少?这个问题与Roth定理的有限域类比密切相关,也与通信中的无错编码、Ramsey理论有深刻联系。2016年Croot-Lev-Pach方法和Ellenberg-Gijswijt的突破性工作给出了指数级上界,但构造性下界(即实际找到大的cap set)长期停滞不前。FunSearch的贡献正是在构造性方面超越了人类已知最佳结果,为这一领域注入了新的可能性。
AlphaGeometry 同样由DeepMind开发,于2024年初发表在Nature上,专门针对欧几里得几何证明问题。它采用了神经-符号混合架构:一个经过合成数据训练的语言模型负责提出辅助构造(如添加辅助线、辅助点),一个基于代数方法的符号推理引擎(Deductive Database)负责从已知条件进行严格的逻辑推演。在国际数学奥林匹克(IMO)历年几何题测试中,AlphaGeometry解决了30道题中的25道,接近金牌选手水平。这项工作证明了AI可以在需要创造性构造的数学推理中表现出接近顶尖人类的能力。
这些进展反复印证一个趋势:AI已经具备了在特定领域进行"原创性发现"的能力。此次解决25年老问题,正是这一系列进展的延续。AI系统通过对已有数学知识的深度理解,结合大规模的搜索与验证机制,最终找到了人类研究者长期未能捕捉的关键突破口。
人机协作的研究范式
值得强调的是,这类成果几乎都不是AI"独自"完成的。更准确的描述是:人类研究者定义问题、设计搜索框架、验证结果的正确性,而AI负责在巨大的可能性空间中高效探索。这种人机协作的分工使得原本需要数年甚至数十年的探索周期被大幅压缩。
AI攻克数学难题的技术逻辑
要理解人工智能如何攻克这类长期未解的问题,需要认识到几个关键的技术支柱。
搜索与生成的闭环结合
现代AI数学系统通常将"生成"与"评估"结合成一个闭环:模型不断提出候选解或候选构造,评估器(往往是严格的形式化验证工具)则判断其正确性与优劣。通过成千上万次迭代,系统逐步逼近最优解。
许多数学问题的本质困难在于其解空间呈指数级或更高阶的组合爆炸。例如,在图论的极值问题中,n个顶点的图有2^(n(n-1)/2)种可能构型,传统穷举完全不可行,而人类直觉能探索的路径也极为有限。AI系统的优势在于:通过学习大量数学文献和已有证明,模型获得了启发式剪枝能力,可以将搜索集中在"有希望"的方向上。同时,这类问题通常具有明确的验证标准——给定一个候选解,判断其是否满足条件往往是多项式时间可完成的。这种"生成困难、验证容易"的非对称性(类似于NP问题的特征)恰好适合AI的生成-验证闭环架构。
形式化验证:确保数学严格性
数学证明与工程近似最大的区别在于"严格性"。AI给出的结果如果不能被形式化验证,就无法被数学界接受。因此,Lean、Coq等证明助手在这一过程中扮演了关键的把关角色。
Lean和Coq是两种主流的交互式定理证明器(Interactive Theorem Prover),它们基于依赖类型理论(Dependent Type Theory)构建。在这些系统中,数学命题被表示为类型,而证明则是构造出该类型的一个项(term)。这一对应关系被称为Curry-Howard同构(又称"命题即类型"原理),是20世纪逻辑学最深刻的发现之一。Curry-Howard同构揭示了逻辑学、计算机科学和范畴论之间的深刻统一:逻辑命题对应类型,证明对应程序,命题的逻辑联结词对应类型构造子(如蕴含对应函数类型,合取对应积类型,析取对应和类型)。这一对应意味着验证一个证明是否正确,等价于类型检查一个程序是否良类型——而类型检查是可以完全自动化的算法过程。这就是Lean和Coq能够提供"机器可检验的确定性"的理论基础:只要类型检查器的实现是正确的(其核心代码通常只有几千行,可以人工审计),所有通过检查的证明就具有数学确定性。
具体而言,命题"对所有自然数n,n+0=n"被编码为一个依赖函数类型Π(n:ℕ), n+0=n,而证明这个命题就是构造一个属于该类型的程序(通常通过对n的归纳)。类型检查器会自动验证每一步推理是否合法——验证项的类型是否与声明匹配,从而提供机器可检验的数学严格性。这种机制消除了人类审稿中可能遗漏的逻辑缺陷,使得即使是数百页的复杂证明也能获得绝对可靠的验证。
Lean由微软研究院开发,其数学库Mathlib已形式化了超过15万个定义和定理,涵盖代数、分析、拓扑等多个分支。Mathlib不仅是验证工具,更是一个机器可读的数学知识图谱——AI系统可以直接查询、引用和组合这些形式化知识来构建新证明。2023年,陶哲轩(Terence Tao)使用Lean形式化了其关于多项式Freiman-Ruzsa猜想的证明,标志着顶级数学家开始将形式化视为研究流程的一部分而非事后验证。Coq则源自法国INRIA研究所,曾用于验证四色定理的计算机证明(Gonthier, 2005)以及编译器正确性证明(CompCert项目)。
近年来,这些工具与AI的结合日趋紧密——AI负责"猜测"证明策略,证明助手负责"判定"其正确性,形成了可信赖的自动化数学研究流水线。它们确保AI的每一步推理都经得起逻辑检验,从而让"AI解决数学难题"这一说法具有真正的学术分量。
AI科学发现的意义与争议
科学发现的加速器
如果AI能够系统性地解决那些被人类"暂时放弃"的难题,其意义将远超单个问题本身。它意味着大量沉睡的科学问题库可能被重新激活。那些因缺乏合适工具而搁置的猜想、构造、优化问题,都有望在人工智能的帮助下重见天日。
关于"理解"的哲学之问
不过,这类成果也引发了持续的讨论:当AI给出一个正确但人类难以直观理解的证明时,我们究竟是在"解决"问题,还是仅仅在"通过"问题?
数学家保罗·埃尔德什(Paul Erdős)曾说上帝有一本书("The Book"),里面记录着每个定理最优雅的证明。数学界历来重视证明的"美感"——简洁、出人意料的连接、深刻的结构洞察被视为数学发现的核心价值。
这种对证明美学的追求有着深厚的历史根基。1890年代,希尔伯特用纯存在性方法证明了代数不变量有限生成定理,被戈尔丹评价为"这不是数学,这是神学",因为证明没有给出具体构造。20世纪的布尔巴基学派强调结构主义和抽象统一性,而匈牙利学派(以埃尔德什为代表)则推崇巧妙的组合论证和初等方法。1994年,瑟斯顿(Thurston)在其著名文章《论数学的证明与进步》中指出,证明的核心功能是传递理解而非仅仅确立真理——一个好的证明应该让读者感到"我现在明白为什么这是对的",而不仅仅是"我已经被说服这是对的"。
1976年四色定理的计算机证明首次将这一争议推到台前:Appel和Haken的证明需要检查1,936种不可约构型(后简化为633种),人类不可能逐一手动验证,必须信任计算机的输出。这引发了数学界的激烈辩论——一个需要检查数百种情况的证明是否真正增进了人类对图着色本质的理解?如今AI证明将这一讨论推向新高度。
支持者认为,正确的证明本身就是知识,而且AI可能揭示人类未曾注意到的数学结构;反对者则担忧,如果数学沦为"黑箱验证",学科将丧失其作为人类智识活动的核心意义。这场争论的本质是:数学究竟是关于真理的科学,还是关于理解的人文?一个由机器搜索得出的复杂证明,是否能带来与人类优雅证明同等的知识价值,仍是学界争论的焦点。
值得注意的是,这场争论可能存在第三条路径:AI证明可以作为"存在性证据"——先确认某个命题为真,然后人类数学家再去寻找更优雅、更具启发性的证明。历史上这种模式并非没有先例:四色定理的计算机证明激发了后续数十年寻找更简洁证明的努力,虽然至今仍未完全摆脱计算机辅助,但证明的结构已经被大幅简化和深化。AI或许不是数学理解的终点,而是通向理解的新起点。
结语:人工智能走向科学前沿的信号
无论如何,AI攻克25年数学老难题是一个明确的信号:人工智能正在从消费级应用走向严肃的科学前沿。它不再只是聊天、写代码或生成图片的工具,而是逐渐成为拓展人类知识边界的真正伙伴。
对于研究者而言,这既是机遇也是挑战——机遇在于探索效率的空前提升,挑战则在于如何重新定义"发现"与"理解"的边界。可以预见,未来将有越来越多被"留在过去"的数学难题,在AI的助力下被重新拾起并最终解决。
(注:本文基于Hacker News上的讨论线索撰写,具体技术细节请以相关机构的正式论文为准。)
相关推荐

Claude自主设计蛋白质成功率35%,远超人类专家水平
Anthropic的Claude模型在自主设计靶向疾病蛋白质任务中取得35%实验成功率,远超人类专家10%-15%的平均水平。本文深入解析这一湿实验验证成果对生物医药行业的潜在影响。

Perplexity Discover多语言支持突然消失,国际用户为何不满?
Perplexity Discover新闻资讯功能突然取消多语言支持,仅保留英文内容,引发国际用户强烈不满。本文分析功能回退的可能原因,探讨AI产品国际化面临的资源权衡与用户信任挑战。
