OpenAI千禧年数学难题争议:AI训练数据边界在哪里

近日,一则重磅消息在数学界和AI圈引发轩然大波:OpenAI宣称利用一款尚未发布的内部模型,成功给出了纳维-斯托克斯(Navier–Stokes)存在性与光滑性问题的解答方案。这是七大千禧年难题之一,自2000年5月24日起就悬赏100万美元。然而,这项本应值得庆祝的突破,很快被一场关于数据来源和学术伦理的争议所笼罩。

一场被质疑的"突破"
纳维-斯托克斯方程是描述流体运动的基础方程,其解的存在性与光滑性问题困扰数学家近一个世纪。该方程组由法国工程师克劳德-路易·纳维和英裔爱尔兰数学家乔治·加布里埃尔·斯托克斯分别在1822年和1845年独立推导,本质上是牛顿第二定律在连续流体介质上的推广,描述了粘性不可压缩流体的速度场和压力场如何随时间演化。千禧年难题所问的核心是:给定合理的初始条件,三维纳维-斯托克斯方程的解是否在所有时间内都存在且保持光滑(即不出现速度无穷大的"爆破"现象)?这个问题之所以极其困难,在于方程的非线性对流项会导致能量在不同尺度之间级联传递,使得数学家无法用现有工具排除奇异性的形成。如果OpenAI的结果经得起验证,这将是AI在纯数学领域最具里程碑意义的成就之一。
值得一提的是,千禧年奖问题(Millennium Prize Problems)由美国克雷数学研究所(Clay Mathematics Institute)于2000年设立,共选定七个长期未解的数学难题,每题悬赏100万美元。截至目前,仅有庞加莱猜想被俄罗斯数学家格里戈里·佩雷尔曼于2003年解决(他拒绝了奖金)。其余六个——包括P vs NP问题、黎曼假设、杨-米尔斯存在性与质量间隙、霍奇猜想、BSD猜想以及纳维-斯托克斯问题——至今仍未解决。这些问题代表着数学领域最深层的未知。
但问题在于,这项发现伴随着来自纽约大学数学教授Tristan Buckmaster的严重指控。Buckmaster是流体力学偏微分方程领域的知名学者,此前因与Vlad Vicol合作证明了纳维-斯托克斯方程弱解的非唯一性(基于Convex Integration技术)而在数学界声名鹊起,他对纳维-斯托克斯问题有着深厚的技术积累。Buckmaster此前一直与知名数学家Levent Alpöge(目前就职于Anthropic)合作研究相关问题。据Buckmaster公开发布的声明描述,事情的经过颇为复杂。
简短版本是:Buckmaster和Alpöge花了将近一年时间研究这个问题,期间大量使用了Claude和Codex(主要是GPT-5.6 Sol),并在8月15日取得了关键突破。这里需要解释的是,Codex是OpenAI推出的代码生成与推理工具,在学术研究中被越来越多地用作"智能笔记本"——研究者将推导草稿、证明片段和想法全部存入其中,利用大语言模型进行符号推演辅助、反例搜索和证明策略建议。这种工作模式意味着用户会将极其详细的、尚未发表的研究进展暴露给AI平台。与传统数学工具(如Mathematica或Lean证明助手)不同,LLM平台的数据处理链路更加复杂——涉及对话日志存储、可能的模型微调和数据去标识化处理,用户对其数据流向的控制力远小于本地工具。数学界的"传闻机器"随即启动,两人听说OpenAI得知了Anthropic方面解决了"一个重大开放问题",于是主动联系OpenAI,才发现对方有一个团队正在用相似的方法研究同一问题。
关键的时间线与追问
在Buckmaster的叙述中,几个追问显得尤为尖锐。他引用道:
我问他们第一次发送提示词(prompt)是什么时候。这个问题在很长时间内没有得到OpenAI的直接回答。最终各方同意,那是在最近几天,也就是在我们工作的信息传到OpenAI之后。
我问模型是否在我们的会话数据上训练过,或者能否访问我们在Codex中的会话——我们把整个项目的所有草稿都放进了Codex。我被告知模型不会查阅用户数据。我再次追问训练问题,但没有得到回答。
更复杂的是,OpenAI团队提出可以等Buckmaster先发表,或让他署名撰写关于OpenAI成果的论文,但明确表示由于与Alpöge雇主(Anthropic)的竞争关系,Alpöge不会被邀请为共同作者。这一细节让整件事的学术伦理色彩更加浓重。在学术传统中,优先权(priority)是最核心的学术货币,而共同作者的认定直接关系到智力贡献的归属。将竞业关系引入学术署名决策,模糊了企业竞争与学术规范之间的界限。
OpenAI的官方回应
OpenAI在其官方叙述中给出了另一个版本:
9月1日星期二,我们听到传闻称两个千禧年难题已被解决。受这些传闻和我们内部模型性能跃升的启发,我们启动了一项工作,用它来评估所有开放的千禧年难题以及一些其他高影响力问题。
智能体在9月5日星期六得出了解答,距首批智能体启动约88小时。Lean形式化验证又额外花费了17小时,通过GPT-6 Astra完成。
这里需要特别说明Lean形式化验证的意义。Lean是由微软研究院的Leonardo de Moura主导开发的交互式定理证明器,基于依赖类型论(Dependent Type Theory)。在Lean中进行"形式化验证"意味着将数学证明的每一步都转化为机器可检查的逻辑推导,由计算机验证其严格正确性。这与传统的同行评审不同:同行评审依赖专家的判断力,而形式化验证提供了数学确定性。近年来,数学界对Lean的采用加速——例如Kevin Buzzard领导的团队在Lean中形式化了大量本科数学,Peter Scholze的液态张量实验也在Lean中完成了验证。OpenAI声称17小时完成形式化验证,如果属实,这本身就是一个重大的技术成就,因为复杂数学定理的形式化通常需要数月到数年。
在所有尝试的问题中,智能体共发送490万条消息,使用约3000亿输出token。在解决纳维-斯托克斯问题的过程中,智能体发送了270万条消息,使用约1300亿输出token。
这里有一个值得关注的数字:虽然我们不清楚这款内部模型的成本结构,但按GPT-6 Astra公开API价格计算,3000亿输出token的成本高达约1500万美元。这意味着,为了抢先解决一个价值100万美元奖金的问题,OpenAI可能投入了远超奖金本身的算力成本——这本身就说明了此举更多是为了展示模型实力,而非奖金。
"无法排除"的数据影响
OpenAI在回应中的一段话尤其耐人寻味(重点标注为原文强调):
我们(研究人员和智能体)在他们公开发布之前,没有通过任何方式看到他们的任何工作——特别是,没有为解决这个问题访问任何特定的用户数据。虽然可能性不大,但我们无法排除,源自他们使用我们产品的去标识化数据帮助改进了我们的模型。 然而,我们的证明有显著差异,甚至在欧拉情形下所证明的精确结果也不同(有强迫项 vs 无强迫项)。
关于"去标识化数据"这一概念,有必要做进一步说明。去标识化(De-identification)是指从数据集中移除或变换个人身份信息(PII),使数据无法直接关联到特定用户。在AI训练语境中,这通常包括删除用户名、IP地址、会话ID等元数据。然而,去标识化并不等于匿名化——研究反复表明,足够独特的内容本身就具有可识别性。例如,一段关于纳维-斯托克斯方程特定技术路径的对话,即使去掉了所有元数据,在数学界仍可能被识别出来源。更关键的是,即使数据完成了去标识化处理,其知识内容已经融入了模型的参数权重中,这种影响是不可逆的、也是难以追溯的。
而OpenAI提到的技术区分——"有强迫项 vs 无强迫项"——也值得解读。欧拉方程是纳维-斯托克斯方程在粘性系数为零时的特殊情况,描述理想(无粘性)流体的运动。"强迫项"(forcing term)是方程右端的外部驱动项,代表对流体的外部能量输入。有强迫项和无强迫项的问题在技术难度和物理意义上有显著差异——无强迫项的情况更"纯粹",因为系统完全由初始条件决定;有强迫项则允许通过精心构造外部输入来"引导"解的行为。两种设置下的证明可能采用不同的数学框架,但核心思路仍可能高度相似。
这段话是整个争议的核心。OpenAI一方面否认直接访问用户数据,另一方面却承认"无法排除"去标识化数据对模型改进的影响。有观察者指出:OpenAI听说有人用LLM解决了千禧年难题,将其视为展示最新模型能力的机会,却没有过多考虑"抢发"一个用了自家模型工作近一年的团队,在观感上会带来什么后果。
更深层的隐患:传闻即漏洞
这一事件折射出一个正在计算机安全领域上演的类似现象。研究者Anil Madhavapeddy最近指出,如今仅凭一个漏洞的传闻就足以找到安全漏洞——因为如果有人知道某软件存在未修补的漏洞,就可以让智能体去专门寻找它。
这一现象在网络安全领域有一个专业术语背景:n-day漏洞利用。当一个漏洞被发现但尚未被公开(0-day状态),仅仅泄露"某软件存在严重漏洞"这一信息,就能极大缩小攻击者的搜索空间。传统上,安全研究社区通过"负责任披露"(Responsible Disclosure)协议来管理这种风险——发现者先通知厂商,给予修补时间后再公开。但当AI智能体可以在几十小时内系统性地扫描代码库寻找漏洞时,从"传闻"到"发现"的时间窗口被压缩到了几乎为零。
数学领域是否也开始如此?仅仅知道某个问题存在未发表的解答,可能就会触发价值数百万美元的LLM算力投入,只为抢先一步到达终点。这种"传闻驱动"的竞赛模式,正在从安全领域蔓延到基础科学研究。当"某个问题可解"这一元信息本身就具有巨大价值时,学术交流中的非正式信息共享——会议走廊里的闲聊、邮件列表中的暗示——都可能成为触发大规模算力竞赛的导火索。
AI时代的数据伦理拷问
这一事件最终指向一个长期被忽视却至关重要的问题:当AI实验室说你的数据被"用于改进模型性能"时,这究竟意味着什么?
几个发人深省的假设性问题值得思考:
- 如果我在运行Codex时,某个API密钥意外进入了上下文,未来会不会有其他人索要API密钥时拿到我的?(OpenAI内部人士称这是"regurgitation(复述)"问题,声称会极力防止,但拒绝透露具体方法。)大语言模型的"复述"问题是指模型在推理时逐字或近似逐字地输出训练数据中的原始内容。这一现象的根源在于Transformer架构的记忆机制:当训练数据中某些序列出现频率较高或处于特定上下文模式中时,模型可能会将其几乎原封不动地"记住"并在适当的提示下重现。研究表明,训练数据中出现次数较少但上下文高度独特的内容(如API密钥、独特的代码片段、专有论证链路)尤其容易被逐字复述。业界应对措施包括去重(deduplication)、差分隐私(Differential Privacy)训练和输出过滤器,但没有任何方法能100%杜绝此类风险。
- 如果我用ChatGPT头脑风暴公司的新方向,这些信息半年后会不会暴露给一个问"X公司下一步可能做什么"的竞争对手?
- 如果我用ChatGPT帮助部分解决一个千禧年难题,我的工作会不会影响训练,从而让后来的模型帮别人抢先解决它?
这些问题目前都没有令人满意的答案。无论OpenAI的纳维-斯托克斯解答最终是否经得起同行验证,这场争议都揭示了一个深刻的困境:在AI能力飞速提升的时代,用户数据、竞争博弈与学术优先权之间的边界,正变得前所未有的模糊。对于任何将敏感研究或商业构想输入AI工具的人来说,这都是一个不容忽视的警钟。
核心要点
相关推荐

OpenAI与Anthropic的AI安全路径对比
深度解析OpenAI和Anthropic在AI责任与安全方面的不同策略:快速迭代与审慎部署的对比,Constitutional AI框架,以及监管压力下的行业分化趋势。

AI视频生成实战:Krea2图生图结合Minimax音频驱动教程
深度解析AI视频制作新玩法:通过Krea2图像转换与Minimax H3 REF2VA音频驱动技术,实现从静态图像到动态视频的创作流程。附实战案例与工具组合技巧。

AI模型蒸馏技术解析:全球竞争与合规边界
深度解析AI模型蒸馏技术原理、应用场景与争议焦点。探讨知识蒸馏如何帮助企业降低训练成本,以及服务条款、知识产权保护等合规挑战。理性看待全球AI竞赛中的技术博弈。