OpenAI Navier-Stokes 证明声明面临一场超越 AI 的考验
- Ethan Carter

- 15分钟前
- 讀畢需時 13 分鐘
据报道,OpenAI 已完成一份约 100 页的 Navier-Stokes 证明,但目前尚无公开论文支持这一非同寻常的说法。该消息来自纽约大学数学家 Tristan Buckmaster;他称,OpenAI 研究人员曾私下向他介绍这一结果。
这一区别至关重要。OpenAI 的 Navier-Stokes 证明若成立,将解决数学七大 Millennium Prize Problems 之一。然而,经由另一位研究者转述、尚未发表的描述,并不等同于已获验证的解答。
这一事件还涉及一项独立且具体的进展。Buckmaster 与 Levent Alpöge 发布了关于三类相关流体方程有限时间爆破的 AI 辅助研究。其结果引发关注,因为同一路径或许能够延伸至 Navier-Stokes。
随后,这一科学事件演变为围绕证据、研究来源和学术署名的争议。Buckmaster 指称,OpenAI 在产出一个高度相关的内部结果前不久,获悉了他的私人项目。OpenAI 研究员 Sébastien Bubeck 则公开否认有关其行为的指控,称其不实且具有煽动性。
因此,核心问题不止于模型是否生成了有效证明,更在于前沿实验室能否在掌控模型、记录以及审计所需证据的同时,提出可信的科学声明。
OpenAI 的 Navier-Stokes 证明仍是一项私人声明
现有公开证据并不能证明 OpenAI 已解决 Navier-Stokes 问题。
Buckmaster 于 2026 年 9 月 8 日发布了一份详细的个人声明。他称,一名 OpenAI 代表告诉他,某个内部研究模型已生成了受迫 Navier-Stokes 方程有限时间爆破的证明。
据 Buckmaster 所述,这份声称的证明涵盖三维欧几里得空间和三维环面上的光滑外力。这些设定对应 Charles Fefferman 对 Millennium 问题官方表述中的若干备选情形。
Buckmaster 称,他获悉这份文档约有 100 页。他还明确表示,发表相关叙述时自己并未看过这份文档。
这一事实界定了当前的边界。没有独立数学家能够审查一份尚未发布的证明。报告所述对话之外的任何人,都无法核查其假设、逻辑依赖关系,或对外力项的处理。
截至本文撰写时,OpenAI 尚未公开发布论文、模型对话记录或技术公告。该公司也尚未通过正式研究发布确认这一内部模型的身份。
因此,这一结果应被描述为一项据称存在的内部证明。宣称问题已经解决,跳过了数学界将有前景的论证与定理区分开来的整个过程。
对于偏微分方程而言,这一区别尤为重要。一份证明在概念上或许很有说服力,却可能在某项估计、正则性假设、边界条件或极限论证中隐藏致命错误。
在纯数学之外,Navier-Stokes 也有多种含义。工程师经常针对特定流动求解方程的近似解。这些数值解并不能解决所有允许初始条件下的整体存在性与光滑性问题。
官方问题询问的是:三维光滑流动是否始终保持光滑,还是会在有限时间内形成奇点。奇点通常被称为爆破,即某个相关数学量变得无界。
若能在 Fefferman 指定条件下构造出有效的受迫爆破解,其分量将远高于又一个数值示例。它将在问题表述允许的官方路径之一中提供反例。
即便如此,也不会立即形成共识。Clay Mathematics Institute 在考虑授予 Millennium Prize 前,要求研究成果发表、经过时间检验并得到广泛认可。
因此,眼下的变化更为有限,但仍具重要意义。一位受尊敬的数学家已公开报告了一项具体的内部声明,其中包括其大致篇幅、适用领域和提出的数学结论。
这足以引发审查,但不足以宣布胜利。
为何三项相关的爆破结果改变了局面
OpenAI 所声称的结果之所以显得可信,是因为 Buckmaster 和 Alpöge 已将一套相近方法推进到了距离 Navier-Stokes 更近的位置。
纽约大学 Courant Institute 教授 Buckmaster 研究流体方程中的奇点形成。Alpöge 是 Anthropic 的数学家,但 Buckmaster 将双方的工作描述为个人学术合作。
9 月 8 日,两人发布了涵盖三套系统的结果:不可压缩多孔介质、二维 Boussinesq 方程,以及三维不可压缩 Euler 方程。每一种构造都采用光滑外力,并产生有限时间爆破。
Euler 描述的是没有黏性的理想流体。Navier-Stokes 加入了黏性,黏性会耗散能量,也会改变控制解所需的估计。
这种差异并非小修小补。这正是 Euler 方程的构造无法自动迁移到 Navier-Stokes 的原因之一。
尽管如此,新的 Euler 结果与 Millennium 问题异常接近。Buckmaster 和 Alpöge 建立在 Diego Córdoba 与 Luis Martínez-Zoroa 的工作之上;后者提出了一种在较粗糙外力下形成奇点的机制。
据报道,较新的工作以光滑外力替代了这种粗糙输入。这个变化十分重要,因为官方 Navier-Stokes 问题的两种反例表述允许特定的光滑外力函数。
Terence Tao 将相关结果描述为一项卓越成就,并在一篇技术评估中审视了其更广泛的意义。他写道,没有显而易见的原则阻止这一方法延伸至 Navier-Stokes。
Tao 同时强调,这类延伸在技术上极其困难。有希望的路径并不能免除让每一项估计成立所需的工作。
这组因素解释了 OpenAI 的声明为何迅速引发关注。所报告的结果并非凭空出现,而是在研究者已找到一种被专家认为有能力触及完整方程的机制之后到来。
Buckmaster 称,他与 Alpöge 大约一年前开始合作。到 2026 年 8 月中旬,两人据称已获得三类相关方程的核心结果。
大型语言模型在论证的开发和核查中发挥了重要作用。Buckmaster 称,两人在反复的数学迭代中使用了 Anthropic 的 Claude 和 OpenAI 的 Codex,包括较新的推理模型。
这种工作流不同于向聊天机器人提一个问题,然后接受其首次回答。研究级证明需要提出引理、定位漏洞、修订估计,并检查长篇论证中各部分的依赖关系。
配套工作的一部分还在 Lean 中完成了形式化。Lean 是一种证明助手,用于检查形式化陈述是否遵循给定的逻辑规则。
公开的 Lean repository为外部人士提供了可供审查的具体材料。不过,机器验证只覆盖研究者已编码并成功检查的部分。
它不会自动认证三篇论文中的每一项非形式化论证,也不会验证据称由 OpenAI 提出的证明;后者是一个独立且尚未发布的对象。
不过,这一公开进展仍对所有追求自动化科学的前沿 AI 实验室形成压力。OpenAI、Anthropic 和 Google DeepMind 都希望获得可信证据,证明其系统能够为原创研究作出贡献。
一项经过验证的 Navier-Stokes 结果将以无可比拟的规模提供这种证据。一项仓促或记录不充分的声明,则会带来相反的教训。
核心冲突是证据与受控披露之间的较量
决定性的较量不是 OpenAI 对 Anthropic,而是私人实验室的声明对公共数学验证标准的挑战。
由于 Alpöge 在 Anthropic 工作,而据称的竞争性结果来自 OpenAI,企业竞争关系显而易见。然而,将其视为模型排行榜竞赛,掩盖了更深层的问题。
数学将权威赋予能够由合格读者审查的论证。前沿 AI 实验室往往将模型细节、提示词、内部工具和算力记录视作保密资产。
这两套权威体系如今发生碰撞。OpenAI 可以拥有一份有效证明,却尚未准备披露其模型或完整研究轨迹。数学家也完全可以在证明本身公开前拒绝接受该结果。
Buckmaster 的叙述又增加了一层复杂性。他称,OpenAI 在向他介绍据称的 Navier-Stokes 结果后,曾提出发表安排。
根据他的声明,其中一项提议是让 Buckmaster 和 Alpöge 在 OpenAI 发表更强结果前先发布他们的 Euler 工作。据称另一项提议涉及联合展示,但由于 Alpöge 任职于 Anthropic,其角色引发疑问。
Buckmaster 指称,在拒绝这些选择并决定公开事件经过后,他面临压力。这些指控仍存在争议。
Bubeck 公开回应称,针对他的指控不实且具有煽动性。这一否认很重要,但并不能解决参与者之间存在的事实分歧。
完整的私人通话记录尚未公开。对于双方叙述相互冲突之处,读者不应将任何一方视为已获独立证实。
这一争议还暴露出新的署名问题。如果 AI 模型扩展了一项未发表的人类想法,谁作出了关键的智力贡献?
传统科学署名会考虑方法的起源、证明的执行、表述、验证以及披露时机。AI 使每一类别都变得复杂。
模型在接收到经过精心选择的问题表述后,可能综合出数千个步骤。提示词或许编码了数月的专家判断,包括正确的机制以及值得攻克的障碍。
反过来,模型也可能只接收到一般性陈述,便在不同思想之间发现真正出人意料的桥梁。这些情况不应得到相同的描述。
如果没有证据链,“最少人工输入”这一说法几乎毫无意义。它可能指经过大量隐藏准备后的一条简短提示,也可能指真正自主的搜索。
OpenAI 最近报告称,截至 8 月中旬,其研究组织每个人工工作日已使用 3.1 个 agent-workdays。其研究指标显示,agents 已多么深入地进入内部科学工作。
这些指标并不能验证 OpenAI 的 Navier-Stokes 证明。它们表明,该实验室既具备追求长期数学项目的基础设施,也有这样做的动力。
因此,披露内容应不止于一篇润色完善的论文。一份令人信服的说明应明确问题规格、人为干预、向模型提供的外部思路,以及验证程序。
数学家审阅该定理并不需要模型访问权限。但要评估该定理是如何被发现的,仍然需要研究溯源信息。
这件事的重要性不止关乎职业署名。实验室将科学成果宣传为日益自主的智能证据。缺失溯源信息,可能让普通协作看起来像自主发现。
在公众获得可审查的证据之前,这场冲突仍将持续。企业声明不能替代证明,而证明本身也无法解答其起源的所有问题。
AI 数学主张并不能证明什么
即便证明正确,也无法表明 AI 已独立掌握流体动力学,或让精确模拟变得毫不费力。
首要的不确定性在于数学有效性。一份 100 页的论证可能包含微妙的依赖关系,专家需要花数月时间审查。
第二个问题是适用范围。Buckmaster 表示,内部结果是在特定条件下讨论受迫 Navier-Stokes 方程。新闻标题很容易忽略“受迫”一词,进而暗示一项范围更广的定理。
受迫项代表施加于流体的外部影响。Fefferman 的表述允许在指定反例选项中采用光滑受迫项,因此受迫爆破仍可能回应官方挑战。
但这并不意味着所有常见的 Navier-Stokes 问题都会消失。研究人员仍需研究无受迫爆破、唯一性、湍流、边界效应、可压缩流体以及计算预测。
一项 Millennium 证明将解决一个被精确定义的数学问题。它不会提供预测天气或设计飞机的通用公式。
第三个不确定性涉及形式化验证。据他们的材料所述,Buckmaster 和 Alpöge 曾在其公开工作的一部分中使用 Lean。OpenAI 据称的手稿尚未发布任何同等的验证产物。
形式化证明系统可以消除许多常规逻辑疏漏。但除非人类检查定理陈述及其假设,否则它们无法判断形式化定理是否涵盖了所有预期主张。
这类工作也需要大量投入。将一份长篇分析证明转化为可由机器检验的形式,可能暴露漏洞,但所需时间也可能超过写出非形式化草稿。
第四个不确定性是独立复现。不同团队应当能够在不获得 OpenAI 内部环境特权访问的情况下,重建其核心机制。
独立审查不要求精确重跑模型运行过程。但必须有足够信息来检验定理、追溯所引用的引理,并质疑最薄弱的估计。
第五个不确定性是 AI 的贡献。Buckmaster 表示,他项目的草稿曾存在于 Codex 会话中。他询问 OpenAI 的内部模型是否接受过这些会话的训练,或是否被授予访问权限。
他的声明称,在他所描述的沟通中,他没有得到明确答复。这并不能证明私人研究曾被使用。
但这提出了一个合理问题,只有 OpenAI 持有的记录才能给出决定性答案。模型训练、临时推理上下文、员工访问和实验输入,是不同的技术路径。
将它们混为一谈是不负责任的。同样,仅因外部人士无法检查相关系统就否定这一问题,也不可取。
使用托管 AI 工具的研究人员应将这场争议视为实际警示。未发表的假设、证明策略、代码和实验结果,都可能具有巨大的智力价值。
团队需要明确规定哪些材料可以输入外部模型。同时还需要保留本地记录,显示每个关键想法由谁在何时提供。
可搜索的知识库有助于保存这段历史。但它不能替代合同保护或实验室的数据治理控制。
因此,关于 AI 的最强版本主张仍未得到支持。公开证据显示,模型已实质性协助了邻近方程的重要研究工作。但它尚未证明 AI 已自主解决 Navier-Stokes 问题。
一份有效证明将先改变 AI 研究,而非流体工程
最早受到影响的将是科学工作流程、署名规则和实验室竞争,而不是日常流体模拟。
数学证明是检验先进 AI 的一个有吸引力的测试场景,因为其最终产物原则上可以逐行核查。这使其比许多关于创造力或通用智能的主张更少主观性。
但研究数学并非完全能够自我验证。专家必须判断定理是否重要、其假设是否符合所述问题,以及证明是否引用了无效结果。
一份获接受的 OpenAI Navier-Stokes 证明,将表明前沿模型能够在诸多技术依赖关系中维持一条长篇论证。它也将证明,模型能够迅速利用新识别出的研究路径。
第二种能力或许更具影响力。科学优势可能转向那些能够结合早期信息、大规模算力预算、专用智能体和专家评估者的组织。
独立学者随后将面临艰难选择。托管的前沿模型可以加快他们的工作,但每次交互都可能涉及保密性和署名问题。
大学可能会通过谈判争取面向研究的专项数据条款。它们也可能投资于本地模型、安全推理系统和可审计的计算环境。
期刊将需要更清晰的信息披露标准。作者已经会说明软件和计算方法,但智能体驱动的研究需要更详细地披露提示词、迭代过程和人工选择。
完整的对话记录并不总是有用。长篇智能体轨迹可能包含数千条死路和重复计算。
结构化的溯源记录会更实用。它可以标明原始猜想、相关的私有输入、模型生成的引理、人工修正以及经形式化验证的组成部分。
编辑还需要制定针对同时发现的规则。AI 系统能够将泄露的线索、研讨会评论或私人草稿,迅速转化为润色完善的结果,其速度可能快于传统发表机制的应对速度。
优先权规范形成于沟通和证明构建仍以人类速度推进的时代。当一个实验室能在一个周末部署数千智能体小时,这些规范便会承受压力。
Buckmaster 的争议预示了这种压力。根据独立报道,即使不考虑 OpenAI 所称的进一步推进,研究人员的公开工作也是迈向 Navier-Stokes 问题的重要一步。
这正是为何这一事件不应被简化为对某一家公司的二元裁决。已获确认的发展是,AI 辅助数学发现已经进入非线性偏微分方程中困难且前沿的研究领域。
存在争议的发展,则是 OpenAI 是否跨越了通向完整受迫 Navier-Stokes 问题的剩余距离。这一主张需要高得多的证据门槛。
如果手稿经受住审查,实验室将竞相在其他著名问题上复现该工作流程。如果它失败,这一事件将成为把模型输出误认为数学知识的教训。
无论哪种结果,都会影响资金投入和人才招募。能够在前沿模型、形式化证明和专业数学之间进行转换的研究人员,将变得更具价值。
因此,眼下的竞争压力落在研究机构身上,而不是飞机设计师身上。它们必须证明,速度并非以牺牲署名、安全性或验证为代价。
数学家接受这一结果之前必须发生什么
三个信号将决定这份据称的证明最终成为定理、部分进展,还是代价高昂的误判。
第一个信号是公开发布。在独立评估开始之前,OpenAI 必须提供精确的定理陈述和完整证明。
读者应密切关注假设。手稿必须清楚说明定义域、受迫函数、初始数据、解的类别以及奇异行为的精确定义。
如果这些要素符合 Fefferman 的某个官方反例选项,该主张将显著增强。如果结果改变了方程或放宽了所需正则性,那么它可能仍有价值,但并未解决该奖项问题。
第二个信号是专家和形式化审查。专家必须检查核心估计,而证明工程师则需要判断哪些部分可以编码进 Lean 等系统。
小幅修正未必会推翻结果。研究论文经常会在审查期间发生变化。
但若漏洞需要一个新的核心思想才能填补,就会削弱“问题已经解决”的说法。若构造中存在矛盾,则可能使其完全失效。
第三个信号是有文档记录的溯源说明。OpenAI 应解释哪些信息传递给了研究人员、模型接收了什么信息,以及人类如何引导运行过程。
这份说明必须区分可验证记录与回忆。它还应回答 Buckmaster 的问题:他的私有 Codex 材料是否影响了内部项目。
在适当审计支持下作出的明确否定答复,会削弱最严重的数据来源担忧。若存在未经署名的访问证据,事件的性质将从科学竞争转向研究不端。
即使项目之间没有私有数据流动,署名问题仍会存在。Córdoba 和 Martínez-Zoroa 提出了早期机制,而 Buckmaster 和 Alpöge 推进了光滑受迫项研究路线。
OpenAI 模型可能进一步延伸了这一脉络。恰当的致谢应描述完整链条,而不是将结果呈现为孤立的机器成就。
Clay 的流程将比新闻周期慢得多。任何奖项考量都要求在符合条件的出版物中发表、获得广泛接受,并经过至少两年的审查。
这种延迟自有其目的。著名难题往往吸引错误解答,而长篇证明通常需要多个专业领域持续审查。
目前,负责任的答案很直接。根据 Buckmaster 的说法,OpenAI 据报道生成了一份严肃的 Navier-Stokes 证明,但该模型尚未公开解决这一问题。
现有证据足以令人对 AI 辅助数学感到振奋。它同样支持人们对手稿、验证记录或完整溯源说明尚未出现前作出的主张保持怀疑。
先关注证明,再关注审稿人,最后关注审计轨迹。在这三者齐备之前,OpenAI 的 Navier-Stokes 证明仍是一项正在接受审查的主张,而非已获确定的定理。


