OpenAI 的 Navier-Stokes 证明加入 Lean 4,但验证尚未完成
OpenAI 在协调约 10,000 个 AI 代理运行 88 小时后,发布了附带 Lean 4 形式化内容的 Navier-Stokes 研究结果。这种组合带来了一种不同寻常的矛盾:该公司提出了一项非凡的数学主张,同时也公开了可由机器检查的证据,从而降低了人们必须信任其模型的程度。
OpenAI 的 Navier-Stokes 证明认为,在平滑外力作用下,三维流体的平滑运动可以在有限时间内形成奇点。奇点是指某个数学量——例如流体速度——在有限时间内变得无界的点。
OpenAI 表示,该结果解决了官方 Millennium Prize 表述中的两种反例路径。不过,这项发布尚未完成获得广泛数学界认可所需的常规发表及社区评审流程。
Lean 部分改变了应当如何理解这种不确定性。Lean 4 是一种交互式定理证明器,用于检查形式化证明是否能够从已声明的定义、定理和公理中推导出来。它的存在并不能解决所有问题,但它提供了一个可独立执行的对象,而非又一篇由 AI 生成的长篇论文。
随着 OpenAI、Anthropic、Google 和学术研究人员推动 AI 系统挑战更高难度的数学问题,这一区别愈发重要。正在出现的竞赛并不只是模型与模型之间的较量,而是可由机器检查的验证,与通过专家解读、署名和时间建立起来的科学信任之间的较量。
OpenAI 的 Navier-Stokes 证明附带了可执行证据
此次发布最重要的部分,不是 AI 生成了一份证明,而是外部人士可以自行运行其形式化版本。
OpenAI 于 2026 年 9 月 8 日发布该结果,同时公布了一篇分析论文和一个含有 Lean 证书的公开仓库。该公司表示,其内部系统为定义在三维空间和周期性三维环面上的 Navier-Stokes 方程构造了有限时间爆破的例子。
Navier-Stokes 方程描述黏性流体如何运动。它支持包括空气动力学、天气预报和血流研究在内的多个领域所使用的模型。其数学行为可能远比熟悉的应用场景所暗示的复杂得多。
Millennium Prize 的核心问题是:在三维空间中,平滑且有限能量的初始条件是否总能产生平滑解。另一种可能是,某些有效的初始条件会在有限时间后导致解发生失效。
OpenAI 选择了第二条路径。根据其 Navier-Stokes release,所构造的流体从静止状态开始,受到平滑外力作用,并在保持有限能量的同时发展出无界速度。
该构造的核心是一个向内收缩、同时沿其轴线拉伸的涡旋。随着其中心区域缩小,速度不断增长。若要留下平滑外力,若干不断增大的项必须以足够精确的方式相互抵消。
这一限定至关重要。OpenAI 并未声称一杯普通的水会突然达到无限速度。它构造的是一个符合该问题形式条件的数学反例。
该结果针对的是受迫方程。外力是构造的一部分,不过 OpenAI 表示该外力本身保持平滑,而不会变成奇异的。无外力的 Navier-Stokes 问题仍未解决。
公开的 Lean repository 将这些结果标记为 Clay 表述中的 C 和 D 两种路径。对于每一个正黏度值,该代码都形式化了全空间和周期性情形下的反例。
该仓库将 Lean 4.34.0-rc2、Mathlib 和 Lake 指定为构建环境,并提供了获取依赖项和编译项目的命令。另设的 comparator 目录支持通过另一条验证路径进行独立检查。
这种程度的披露提供了比新闻声明更具体的起点。研究人员可以检查定理陈述、审计定义、复现构建过程,并将形式化主张与论文进行对照。
它也确立了本文的核心张力:成功构建可以为形式化推导提供强有力的保证,但科学解释和作者归属问题仍超出内核的能力范围。
为什么 Lean 4 形式化证明改变了信任负担
Lean 将验证问题的一部分,从阅读一套有说服力的论证,转化为检查一个精确的计算产物。
传统数学论文使用自然语言、公式、引文以及专家群体共享的惯例。同行评审者会审查每一步、重构被省略的推理,并判断论证是否确立了其所声称的结果。
这一过程有效,但高度依赖专家的注意力。长篇证明可能含有未被察觉的漏洞。评审者还必须判断非形式化定义是否与定理所要求的对象相符。
形式化证明走的是另一条路径。每项相关主张都以精确语言表示,每一个逻辑步骤都必须生成能被检查器接受的证明项。
Lean 的文档说明,其内核会检查提交的证明是否能由环境中的定义、定理和公理推导而来。与帮助用户构建证明的策略和自动化工具相比,该内核被刻意设计得很小。
这种分离对于 AI 生成的数学尤为重要。AI 系统可能会编造解释、误用定理,或生成看似自信却无效的文字。它无法通过文风说服 Lean 的内核。
如果模型提出了不合法的步骤,证明将无法通过类型检查。有缺陷的策略同样会失败,除非它们最终构造出被可信内核接受的证明项。
这在生成与检查之间形成了不对称关系。生成一份大型证明可能需要广泛的搜索和计算;检查所得证书则可以更受控、更具可重复性。
OpenAI 表示,其代理在工作启动约 88 小时后得出了 Navier-Stokes 构造。随后,GPT-6 Astra 又花费了 17 小时进行 Lean 形式化和验证。
该公司报告称,Navier-Stokes 工作产生了 270 万条代理消息和约 1,300 亿个输出 token。在所有测试的问题中,其代理共生成了 490 万条消息和约 3,000 亿个输出 token。
这些数字描述的是一种任何单个研究人员都无法逐条手动重放的搜索过程。Lean 证书为这条庞大的轨迹提供了更小的信任边界。
评审者无需审计每一段代理对话,而可以将重点放在最终定理陈述、导入的基础、定义和被接受的证明项上。他们还可以检查形式化陈述是否与公开展示的数学主张相符。
Lean reference 明确界定了这一边界。被接受意味着内核已使用环境中声明的假设,验证了编码定理的证明。
这并不意味着 Lean 独立理解了流体动力学。它也不意味着该系统判断了该定理是否重要、原创、物理上现实,或是否被标题正确描述。
尽管如此,OpenAI 的 Lean 4 证明提高了未来 AI 数学公告的证据标准。当可执行证书在技术上可实现时,仅发布非形式化文本将显得更弱。
形式化验证与同行评审检验的是不同事物
真正的对立面不是 Lean 与数学家,而是可执行的一致性与更广泛的科学判断。
有效的 Lean 构建回答的是一个狭窄但有价值的问题。它表明,按形式化方式表述的定理能够在证明环境中由指定假设推导出来。
同行评审回答的是更广泛的一组问题。评审者会检查形式化陈述是否代表了目标问题、假设是否隐藏了重要限制,以及工作是否与既有文献正确关联。
这一区别在这里尤其重要。“解决了 Navier-Stokes”这一表述可能让人以为研究人员为所有流体流动得到了一个通用公式。OpenAI 的实际主张则涉及平滑外力下的有限时间爆破反例。
official formulation 允许通过特定的失效陈述来解决问题。OpenAI 表示,其构造确立了涵盖全空间和周期性情形的 C 和 D 陈述。
形式化检查器可以确认编码后的蕴含关系,但无法判断公开摘要是否让读者准确理解了这些蕴含关系。
因此,评审者必须审查论文与 Lean 文件之间的语义桥梁。他们需要检查平滑性、有限能量、外力和奇点等概念是否被忠实编码。
他们还必须检查从 Mathlib 导入的假设,以及任何项目特定的公理。使用成熟数学库是常规做法,但每一项依赖都会成为该证书信任叙事的一部分。
OpenAI 的仓库包含旨在支持更独立检查的 comparator 挑战。这很有用,因为证明验证不应只依赖生成证书时所使用的同一工具链。
即使独立编译成功,也不会完成评审。专家仍需理解该构造、将其与既有的部分结果进行比较,并检验论证是否在形式化层与非形式化层之间存在非预期的不匹配。
评审还涉及原创性维度。一份证明在逻辑上可以有效,却仍可能依赖应获得更充分署名的思想。Lean 会记录以代码表达的依赖关系,而不会记录塑造搜索策略的每一种智识影响。
这一限制立刻显现出来,因为 OpenAI 是在听到有关相关工作的传闻后才启动这项工作。NYU 数学家 Tristan Buckmaster 与个人从事研究的 Anthropic 研究员 Levent Alpöge,此前已发展出一项受迫 Euler 结果。
Euler 方程描述不含黏度的理想化流体运动。Navier-Stokes 包含黏度,后者通常会平滑流动,也使爆破更难构造。
OpenAI 表示,其系统在将资源集中于受迫 Navier-Stokes 之前,已发现一个无外力 Euler 爆破结果。它承认 Buckmaster 和 Alpöge 在受迫 Euler 方面的优先权,同时将自身的 Euler 结果描述为不同的成果。
这些差异在数学上很重要。它们也表明,源代码本身无法解决关于研究行为、激励机制或成果归属的争议。
Lean 证书加强了正确性的论据,但并未消除人工评审的必要性。相反,它让评审者可以少花精力追查局部逻辑错误,更多考察含义、新颖性和背景。
多代理搜索将形式化变成基础设施
OpenAI 的机制将大规模并行搜索与能够在最终阶段拒绝无效分支的证明检查器结合在一起。
OpenAI 表示,它于 8 月 28 日开始训练相关内部模型。9 月 1 日,该公司听到有研究人员已解决两个 Millennium Prize 问题的传闻。
随后,系统启动了对所有尚未解决的千禧年难题及若干相关问题的评估。不同智能体组获得了每道问题的不同版本,其中包括能够证明正则性的路径,以及能够构造反例的路径。
这些智能体可以读取互联网的缓存版本、运行代码,并在组内交流。OpenAI 调整了小组规模,并为最终得出 Navier-Stokes 结果的工作分配了约 10,000 个并发智能体。
这一架构之所以重要,是因为它将数学发现视为一个协同搜索问题。不同小组可以探索彼此不兼容的构造,而不必强迫单一模型对话保留每一条推理线索。
OpenAI 表示,近 100 个智能体最初花费约 50 小时找到了一个无外力 Euler 爆破解。随后,公司将资源从其他问题转向,并把 Euler 结果提供给 Navier-Stokes 小组。
Codex 整合了各小组中有价值的中间思路。评估持续期间,OpenAI 还将底层模型替换为经过进一步训练的版本。
据称,该系统于 9 月 5 日完成了 Navier-Stokes 构造。Lean 形式化工作于次日完成,随后在 9 月 8 日公开发布。
这一顺序表明,形式化证明并非只是装饰性的附录。它充当了庞大且充满噪声的搜索过程的最终验收测试。
这种方法类似于以不同寻常的规模开展软件工程。众多工作单元提出模块、改进或修复方案,而严格的构建系统决定这些组件是否满足形式化接口。
数学仍比普通编译更困难,因为系统必须发现正确的命题和构造。但这一工作流同样受益于一个基本特性:无效输出会产生明确的失败结果。
这正是 OpenAI 的 Navier-Stokes 证明影响超越单一流体方程的地方。未来的科学智能体可以将形式化系统作为筛选器,使大规模并行搜索更加可靠。
形式化也可以支持更好的失败分析。当证明停止编译时,开发者会得到一个局部化的待证明义务,而非“论证感觉不对”的模糊判断。
代价是大量资源消耗。按照 OpenAI 自己公布的数据,Navier-Stokes 工作涉及数百万条消息和 1,300 亿个输出 token。
该公司没有公布完整的成本明细。因此,其结果并不能证明同样的工作流在普通大学、研究团队或独立数学家那里具有经济可行性。
该实验也并未表明,只要增加智能体数量就一定能产出更好的数学成果。并行工作者可能重复劳动、强化共同错误,并压垮协调渠道。
Lean 约束了最终的逻辑,但不会让底层搜索变得高效。该系统仍需要良好的问题拆解、有用的跨组沟通,以及将非形式化想法可靠转化为形式化陈述的能力。
对开发者而言,值得注意的进步在于这一组合式流水线。前沿推理生成候选方案,智能体编排进行广泛搜索,形式化验证则收紧了最终的可信要求。
这一组合给所有宣布先进推理成果的实验室带来了压力。基准测试和精选对话记录提供的是间接证据;可复现的证书则提供了其他研究者可以直接检验的东西。
OpenAI Lean 4 证明尚未解决的问题
机器验证缩小了正确性争议,但仍留下了关于规格、审查、资源和研究贡献的重要问题。
第一个不确定性在于命题本身。独立专家必须确认,OpenAI 形式化的确切是 Clay Mathematics Institute 所描述的那些替代情形。
对一个相近命题的形式化证明同样可以编译通过。如果某个定义弱化了光滑性、改变了时间区间,或修改了能量条件,内核不会提出异议。
第二个不确定性涉及依赖项。审查者需要审计导入结果、项目级公理,以及任何影响可信基础的计算捷径。
Lean 的内核旨在提供一个小型的检查基础。然而,公开审计仍需识别内核究竟接受了什么,以及哪些假设是通过周边环境引入的。
第三个不确定性关乎数学交流。一个可执行证明可以是正确的,却依然难以让专家作为数学成果来理解。
研究人员会希望了解,哪些概念性思路产生了这一构造。他们会追问该方法是否可以推广、是否能阐明相关方程,还是主要只满足了一个形式化目标。
这种区别影响着这项工作超越奖金问题本身的价值。透明的新机制可以催生多年的研究;而一个解释结构有限的大型证书,虽然能够确立正确性,却可能提供较少可复用的洞见。
第四个不确定性是独立验证。OpenAI 提供了构建说明和比较器路径,但公司同时产出了这一主张及其初始证书。
外部团队应当在干净的环境中复现构建过程。他们还应检查形式化命题本身,而不能只报告某条命令成功返回。
单次成功编译无法替代广泛审查。独立团队可以发现规格不匹配、意外公理、依赖问题,或论文与代码之间对应关系不清的问题。
第五个问题是科学界的接受程度。Clay Mathematics Institute 的程序不止于上传预印本或代码仓库。OpenAI 也表示无意主张千禧年奖。
因此,这次发布应被描述为一个由形式化证书支持的拟议解答。若称此事已经完全定论,将会比审查过程走得更快。
最后一个不确定性涉及研究贡献归属。根据 OpenAI 的说法,其工作始于与 Buckmaster 和 Alpöge 相关研究的传闻出现之后。
OpenAI 表示,在该研究公开发布前,其研究人员和智能体都未看过该工作。公司于 9 月 10 日补充更新称,Buckmaster 最近的 Codex prompts 不可能影响该系统。
这是该公司根据其调查得出的结论。公众观察者无法从 Lean 证书推断完整的数据来源脉络,因为证书并不说明思路如何进入搜索过程。
围绕这场争议的报道聚焦于前沿实验室能否与使用其工具的研究者竞争。担忧并不止于蓄意获取私人文件。
实验室可能通过传闻、使用模式、交谈或公开碎片得知某一研究方向很有前景。随后,它可以部署原始研究者无法获得的计算资源。
OpenAI 的形式化证明既不能证明,也不能反驳有关公平行为的主张。正确性与来源是彼此独立的维度。
这一区别应避免两种相反的错误。伦理争议不会自动使形式化定理失效,而有效的定理也不会自动化解伦理争议。
压力不止延伸至 OpenAI 和 Anthropic
形式化证明产物正成为严肃 AI 生成数学主张的一项竞争性要求。
Anthropic、Google DeepMind、OpenAI 和学术团队都在探索能够生成或形式化数学推理的系统。它们的方法各不相同,但面对的是同一个可信度问题。
语言模型能够生成优雅的解释,但其中可能含有细微错误。在精心策划的基准测试上取得进步,并不能保证其在定义陌生、依赖链漫长的研究问题上同样可靠。
形式化方法为绕开其中一部分问题提供了路径。定理证明器能够立即、确定性地反馈某个拟议证明是否满足精确定义的目标。
Google DeepMind 的 AlphaProof 此前已展示了将机器推理与 Lean 结合用于竞赛数学的价值。OpenAI 的新发布则将同一原则推进到利害关系高得多的研究主张上。
区别不仅在于问题难度。奥赛题通常具有简洁的题目陈述和已知的评分标准。开放研究问题则要求对表述、既有工作、重要性和可接受假设作出判断。
这意味着未来系统需要的不仅是证明搜索。它们还需要可靠的工具来完成命题形式化、文献梳理、归属认定、依赖审计和人类可读的解释。
学术团队也面临资源失衡。OpenAI 部署的智能体数量和 token 规模,远超个体数学家的正常预算。
形式化验证在一定程度上平衡了这种失衡,因为验证成本可能低于生成成本。如果大学团队能够检查最终证书,就不需要重新生成 1,300 亿个输出 token。
然而,可访问的验证依赖于可访问的基础设施。项目需要稳定的工具链、公开的依赖项、有文档说明的构建流程,以及外部审查者能够满足的硬件要求。
这正是代码仓库可能与模型公告同样重要的原因。它为研究者提供了一个具体产物,围绕它可以发展可复现性实践。
软件团队也应出于类似原因关注这一点。形式化方法长期以来因劳动成本高和需要专业知识而声名在外。
AI 辅助形式化可能改变这一计算。如果模型能够有效翻译规格并修复证明义务,形式化验证或许会对更多安全敏感型软件变得切实可行。
Navier-Stokes 的发布本身并不能确立这一转变。数学证明与生产软件包含不同类型的歧义、依赖关系和运营风险。
不过,底层工作流具有相关性:生成大量候选解,要求提供机器可检查的证书,并公开结果以供独立复现。
当 AI 产出的研究多到任何人都无法全部阅读时,知识工作者将面临类似挑战。团队需要能够围绕每项生成结论保留来源、假设、修订和分歧的系统。
可搜索的技术知识库可以帮助整理这些材料。它无法取代证明检查器,但可以保留围绕形式化结果的证据与审查轨迹。
因此,竞争压力延伸至三类群体。AI 实验室必须发布更有力的证据,研究者必须调整审查实践,而工具开发者必须让形式化验证更易于复现。
三个信号将表明这是否会成为新标准
下一项检验在于,独立审查者能否不依赖 OpenAI 的权威,复现、理解并扩展这一结果。
第一个信号是对 Lean 文件进行详细的第三方审计。一项有意义的审计应识别可信假设,将形式化陈述与论文进行比较,并独立复现构建过程。
一份仅称“Lean 接受了它”的简单报告,所提供的证据有限。最有力的审查应解释究竟认证了什么,以及哪些科学问题仍在该证书范围之外。
如果多个独立团队得出相同结论,OpenAI 的 Navier-Stokes 证明将获得更高可信度。如果他们发现规格不匹配,那么即使代码能够编译,该发布的核心保证也将被削弱。
第二个信号是专家对该分析论证的回应。流体动力学专家需要判断这一构造是否易于理解、具有新颖性,并且与既有文献相一致。
这一阶段能够揭示一份正确的证书与一项有影响力的数学技术之间的差别。研究人员可能接受该定理,同时对这种方法代表了多大程度的概念进展持不同看法。
应关注修订后的论文、研讨会讨论、正式评审和独立阐释。这些产出将表明,该证明是否会成为实际数学工作的一部分,而非停留为一件令人印象深刻的计算产物。
第三个信号是,其他实验室是否会采用相同的披露标准。Anthropic、Google DeepMind 和学术项目将面临更大压力,需要为类似主张附上形式化产物。
如果机器生成的研究附带公开的定理陈述、固定版本的依赖项、清晰的构建说明和独立验证,那么形式化验证正在成为常规基础设施。
如果后续公告又回到选择性公开的记录和私下评估,OpenAI 的发布看起来就更像一次特殊演示,而非持久的流程转变。
在这一第三个信号中,署名争议值得持续关注。实验室应公布明确政策,说明如何处理其产品、员工和评估系统接触到的未发表研究。
研究人员需要确信,使用 AI 助手不会悄然让工具提供方变成资金更雄厚的竞争者。形式化验证无法建立这种信心,因为它验证的是逻辑,而不是来源。
最理想的未来标准应结合四项要素:精确的形式化主张、可由他人独立执行的证书、易读的数学解释,以及透明的署名实践。
相较于多数备受关注的 AI 研究公告,OpenAI 对前两项的提供更为清晰。其余要素如今取决于外部审查,以及公司如何回应这种审查。
对于开发者和研究负责人而言,实际问题已不再是 AI 能否生成一份看似令人信服的证明文档。更好的问题是,它的结果是否附带能够经受外部执行、专家解读和来源审查的证据。
首先追踪独立构建结果。然后关注数学审计和竞争性发布。这些信号将决定,OpenAI 的 Lean 4 证明究竟标志着一种持久的验证模式,还是一项等待评判的非凡主张。



