OpenAI Navier-Stokes 解答引发历史性宣称与署名之争
OpenAI 表示,1 万个 AI 智能体在 88 小时内得出了一个 Navier-Stokes 解答,而项目启动时距另一支团队取得进展的传闻传出仅不久。这样的时机,让一项本可能载入史册的数学成就立即卷入研究优先权、私人数据与算力集中化的争议。
这项于 9 月 8 日公布的成果,涉及 Clay Mathematics Institute 设立的七个 Millennium Prize Problems 之一。OpenAI 称,其尚未公开的内部模型找到了一个有限时间奇点,即数学流体的速度会增长至无穷大。随后,GPT-6 Astra 使用证明助手 Lean 将论证形式化;该工具会检查每一步逻辑是否均可由既定假设推出。
然而,机器验证的证明并不能解决围绕该结果的所有问题。数学家仍需审查其定义、适用范围、原创性,以及与既有工作的关联。这场争议还引发了一个更大的担忧:当 AI 提供商与使用其系统的研究人员竞争时,会发生什么?
这一冲突的重要性不止于一个方程。OpenAI 控制着围绕这一被宣称结果的模型、基础设施、产品数据和发布流程。独立数学家则提供了令最终攻关成为可能的大部分智力路径。
因此,OpenAI 的 Navier-Stokes 解答同时代表两件事:它是对自动化推理能力的一项非凡宣称,也是当科学工具变成科学竞争者时,署名机制如何运作的一则警示。
OpenAI Navier-Stokes 解答究竟宣称了什么
OpenAI 宣称,自己为一道困扰数学家约 90 年的问题给出了完整的否定答案。
Navier-Stokes 方程描述流体如何在力、压力与黏性的作用下运动。工程师会在模拟飞机、天气、洋流和血液流动时使用这些方程的不同形式。Millennium Problem 所问的是,在规定条件下,光滑的三维解是否始终保持光滑。
OpenAI 给出的答案是否定的。根据该公司的技术说明,其提出的构造从静止且初始光滑的流体出发,并施加平滑的外力;由此产生的运动会在有限时间内形成奇点。
奇点是指数学量变得无界的点。在这一案例中,OpenAI 表示,流体速度会趋于无穷大,同时其总能量仍保持有限。该构造采用了一个不断收缩、拉长的涡旋,其速度会逐步加快。
这一结果针对的是理想化的数学流体,并非预测现实中的水或空气会达到无限速度。真实流体由分子构成,而这些方程将流体视为连续介质。奇点将揭示这种数学描述本身的一个极限。
OpenAI 表示,其智能体测试了该问题的数个官方版本,其中包括旨在证明正则性的路径,以及旨在推翻正则性的路径。据称,成功的证明确立了官方表述中的陈述 C 和 D。
该项目于 9 月 1 日启动。OpenAI 将不同的数学路径分配给多个智能体小组,随后允许这些小组交换有前景的发现。Codex 汇总有用的中间结果,并将其提供给后续的智能体小组。
OpenAI 称,成功的 Navier-Stokes 工作大约涉及 1 万个并发智能体。这些智能体为该问题交换了 270 万条消息,并生成约 1300 亿个输出 token。它们于 9 月 5 日得出了这一拟议解答。
随后,GPT-6 Astra 又用了 17 小时在 Lean 中将证明形式化并进行检查。对于更广泛评估中的所有问题,OpenAI 称共产生了 490 万条智能体消息和约 3000 亿个输出 token。
Lean 验证之所以重要,是因为它能够发现形式化论证中的无效推导、缺失依赖和不一致之处。与要求语言模型审阅普通文本相比,它能提供更强的保障。
不过,Lean 检查的是它接收到的形式化陈述。人类专家仍需判断该陈述是否符合原始 Millennium Problem,以及每一项引入的假设是否恰当。他们还必须评估证明的新颖性及其思想脉络。
这一区别解释了为何审慎的报道将其称为“拟议解答”。OpenAI 已经提供了大量技术材料,但独立评审和机构认可都不会在发布当天发生。
为什么形式化证明尚不意味着赢得 Millennium Prize
机器验证能够确立内部正确性,但数学界的接受还需要解释、审查与时间。
Clay Mathematics Institute 不会直接接受作者提交的拟议解答。其奖项规则要求,成果须在符合资格的刊物发表,接受至少两年的检验,并获得全球数学界的普遍认可。只有到那时,该机构才会开始自身的详细审议。
OpenAI 表示无意申领奖项。这一决定消除了一个财务层面的问题,但并未缩短验证流程。与该成果的科学和商业价值相比,100 万美元奖金更多具有象征意义。
独立数学家首先必须理解这一拟议构造。一份长达 165 页的证明可能包含定义、约化和技术性选择,而其意义并不能仅通过形式化验证得以显现。专家将把这些选择与官方表述及既有文献进行比较。
他们还会检查形式化的 Lean 陈述是否涵盖所有必要条件。证明助手能够确认定理在其编码环境中是否成立,却无法独立判断研究人员是否编码了原本意图中的定理。
这并非 AI 独有的弱点。人类数学家同样依赖严谨陈述的假设、既有引理和被接受的定义。形式化让这些依赖关系更加明确,也因此可能强化审查流程。
差异在于速度和规模。据称,OpenAI 的系统同时探索了许多路径,生成数百万条消息,并在数日内交付了一份形式化成果。人类审稿人无法以同样的速度审查这条智力探索轨迹。
因此,这份拟议证明造成了一种不寻常的不对称性。产出结果的组织可以投入巨量计算资源来生成和完善成果;更广泛的学术共同体随后必须投入稀缺的专家注意力来验证它。
当底层模型仍属私有时,这一负担会更重。研究人员可以审查最终证明,却无法复现完整的发现过程。他们无法在等效条件下测试该模型,也无法检查塑造其搜索过程的每一次干预。
OpenAI 表示,其内部模型的能力显著强于 GPT-6 Astra,且仍在训练中。这一说法使该成果成为未来产品的证据,而不只是一篇自成一体的数学论文。
因此,这项公告同时承担多种功能:它报告了一项拟议定理,宣传了一款尚未发布的模型,并展示了公司协调大规模智能体群体的能力。每一种功能都对应不同的证据标准。
数学正确性取决于证明。关于模型科学能力的宣称需要更广泛的评估。关于自动化发现时代即将到来的说法,则需要在无关联的问题上反复得到验证。
即便是一项卓越的成功结果,也无法同时确立这三项结论。接下来的审查必须将定理本身与其周边的产品叙事区分开来。
署名争议改变了这一里程碑的意义
核心冲突不再是人类与机器之间的较量,而是开放的科学署名与私有化研究基础设施之间的矛盾。
OpenAI 承认,有关另一支团队取得进展的传闻促使其在 9 月 1 日展开这项工作。该团队由纽约大学数学家 Tristan Buckmaster 和独立开展工作的 Anthropic 研究员 Levent Alpöge 组成。
Buckmaster 和 Alpöge 曾借助多个 AI 系统研究相关流体方程,其中包括 OpenAI 的 Codex。他们的工作建立在 Diego Córdoba 和 Luis Martínez-Zoroa 开发的一条较少见的分析路径之上。
Córdoba 和 Martínez-Zoroa 曾通过由各自正则层构成的无限级联构造出奇点。由于组合后的外力函数不具备所要求的平滑性,他们早先的工作并未满足 Millennium Problem 的所有条件。
剩余的挑战是在产生可接受的平滑外力的同时保留这一级联。这正是独立合作团队与 OpenAI 智能体共同追逐的狭窄路径。
在 OpenAI 发布其拟议 Navier-Stokes 解答前不久,Buckmaster 公布了三项相关结果。他表示,该合作团队在 8 月 22 日前已完成一份经 Lean 验证的受迫 Euler 证明。Euler 方程描述不含黏性的流体,与 Navier-Stokes 方程密切相关。
两支团队最终证明的并非完全相同的陈述。OpenAI 承认 Buckmaster 和 Alpöge 在受迫 Euler 结果上的优先权。OpenAI 则主张其自身在无外力 Euler 结果和完整 Navier-Stokes 构造上的优先权。
冲突关乎 OpenAI 如何进入这场竞赛,以及私人研究是否影响了其系统。Buckmaster 表示,有关其合作进展的信息在公开发表前就已传到该公司。OpenAI 确认,这一传闻促使其集中展开攻关。
Buckmaster 认为,所选择的路径过于具体且少见,不能轻易淡化这种重叠。在他的叙述中,研究相关平滑外力方法的数学家极少。
他还质疑,自己大量使用 Codex 是否会让私人研究暴露给 OpenAI 的系统。重要的是,Buckmaster 并未直接指控该公司挪用了他的工作。他写道,自己不知道其数据是否曾被使用。
OpenAI 表示,其研究人员和智能体在公开发布前并未访问合作方的工作。该公司还称,为解决该问题,没有访问任何特定用户数据。
不过,OpenAI 表示无法排除另一种可能性:从研究人员使用产品的行为中衍生出的去标识化数据,可能对模型改进有所贡献。这一让步处于相关争议报道的核心。
目前没有公开证据表明 Buckmaster 的私人材料曾出现在模型或证明中。研究方向的相似性本身不能证明数据被使用。两支团队也都借鉴了已有公开记录的数学工作。
但这种不确定性暴露了一个结构性问题:研究人员可以将 AI 服务作为私人助手使用,而服务提供商同时也在开发与其竞争的自动化研究者。
传统科学工具通常不会变成竞争性的作者。显微镜制造商不会观察未发表的样本,再与客户争抢发表;文献管理工具也不会将存储的草稿综合成一项竞争性的定理。
前沿 AI 平台处于不同的位置。它们处理提示词、笔记、代码、证明尝试以及失败的想法。这些材料可能在任何论文公开之前,就揭示哪些研究方向看起来最有希望。
即使严格的访问控制也无法消除认知层面的问题。研究人员需要知道谁能查看其数据、这些数据是否会用于训练,以及利益冲突将如何处理。模糊的回答可能令专家不愿使用能力最强的系统。
因此,这场争议改变了成功的定义。OpenAI 必须证明的不仅是数学上的正确性,还必须表明科学用户能够信任支撑这项成就的基础设施。
算力已成为一种新的数学优势
这一结果表明,集中的算力可以在较小团队来得及回应之前,将一个研究线索转化为完整证明。
OpenAI 并非从另一团队已发表的突破开始。它起初只是获悉有重要问题已经被解决的传闻。几天之内,该公司便将庞大的智能体群体重新部署到最有前景的路径上。
这些智能体并非作为一个巨型数学家运作。OpenAI 将其划分为多个小组,分配不同版本的问题,并在之后传播成功的思路。这一过程类似于一个实验室协调数千名并行研究人员。
该公司称,近 100 个智能体花费约 50 小时,得出了其无强迫 Euler 结果。这一成功促使 OpenAI 将更多资源投入 Navier-Stokes 问题。
随后,更大的群体工作了约 88 小时,才得出所提出的解。根据独立报道,OpenAI 研究员 Sébastien Bubeck 估计,总计算成本达数百万美元。
这一规模改变了优先权竞争的经济逻辑。大学合作团队通常无法在听说竞争对手接近成功后,立刻调动 10,000 个智能体;而前沿实验室可以立即集中基础设施资源。
金钱本身并没有产生这份证明。智能体依赖数十年的数学研究、一项有前景的分析策略、形式化验证工具,以及人类研究人员的指导。算力放大了这些要素。
这种放大才是关键机制。一旦可信的路径变得清晰,AI 实验室就能以极快速度探索变体、识别有用的引理、整合部分解,并将结果形式化。
因此,未来的数学竞赛可能会变成两阶段的竞争。学术研究人员通过多年的专业工作发现肥沃的研究方向;资金更充裕的组织则在方向变得清晰后,将最终搜索工业化。
这种结果并非不可避免。共享基础设施、明确的合作协议和早期署名可以更广泛地分配收益。公开提示词和证明轨迹,也能帮助独立研究人员评估各方贡献。
OpenAI 表示,它曾向 Buckmaster 和 Alpöge 提供其提示词的访问权限,之后又提出向他们展示证明。在得知双方团队解决的是不同表述之前,它还提议同步发布公告。
这些行动很重要,但都发生在 OpenAI 完成项目之后。它们无法回答:机构应如何应对由未发表研究信息泄露所触发的竞赛。
更好的政策应在计算开始前处理冲突。当员工获悉客户的保密研究时,服务提供商可以建立独立审查程序;也可以记录数据边界,并披露相关的人类干预。
研究机构同样需要更严格的实践。使用托管模型的科学家应将提示词历史、上传笔记和中间证明视为敏感研究记录。产品设置应当获得与实验室访问控制同等的重视。
维护清晰的个人知识系统,也能保留日期、来源和推理路径。这类记录无法解决所有争议,但可以建立可信的研究时间线。
算力仍将是自动化数学中的优势。政策层面的关键问题在于,它会成为推动共享科学的加速器,还是攫取优先权的工具。
AI 数学仍依赖人类的智识传承
智能体的速度快于人类团队,但它们并非从一张智识白纸开始。
OpenAI 的 Navier-Stokes 解延续了多年来形成的一条研究链。这条链包括 Euler 奇点、受迫方程、无限级联和计算机辅助验证方面的进展。
Thomas Hou 和 Guo Luo 在有界圆柱环境下围绕 Euler 方程提出了颇具影响力的证据。后续研究人员则不断完善研究奇点形成的分析与计算技术。
Martínez-Zoroa 的博士研究发展出另一种分析策略。他和 Córdoba 后来利用相关思路构造出受迫 Euler 奇点。他们的级联构造成为最新结果所采用路径的核心。
Buckmaster 和 Alpöge 利用 AI 模型进一步推进了这一研究路线。随后,OpenAI 的智能体沿着高度相关的路径,得出了不同的 Euler 和 Navier-Stokes 结果。
这段层层累积的历史,使得“AI 单独解决了”这一问题的简单说法变得复杂。根据已发表的记录,模型完成了大量数学工作。然而,搜索空间早已由人类的猜想、失败尝试和技术创新塑造。
科学的各个领域都存在同样的问题。一项发现可以是新的,同时仍深深依赖于早期方法。引用规范的存在,正是为了让这种依赖关系可见。
AI 系统让这条链条更难追溯。数千个智能体可以阅读缓存文献、生成中间结论,并交换整合后的洞见。最终证明或许无法呈现究竟是哪一来源改变了搜索方向。
形式化验证保留的是逻辑依赖,而不一定是智识依赖。Lean 可以识别代码中导入的定理和定义,但它无法自动说明哪篇论文启发了一项构造,或哪位研究人员使这条路径显得可信。
这意味着需要超越常规引用的溯源机制。AI 辅助项目应保存提示词、检索来源、智能体通信、人类干预和重大决策节点。独立审查者需要足够的信息来重建发现过程。
公布每一个 token 也会带来新的问题。OpenAI 称,仅 Navier-Stokes 项目就生成了约 1,300 亿个输出 token。如此规模的原始披露会令审查者不堪重负,也会暴露无关或敏感材料。
研究人员需要的应是结构化记录。这些记录可以标明决定性分支、来源检索、人类引导,以及每个核心引理首次出现的时间点。经加密时间戳认证的日志可以支持日后的优先权争议处理。
这场争议也挑战了工具与作者之间熟悉的边界。计算器执行预设操作,而自主智能体会提出策略并评估备选方案。多智能体系统可以在多个智识层面作出贡献。
署名规则需要区分模型输出与机构责任。AI 系统无法回答有关数据访问、披露或研究伦理的问题。运营该系统的组织必须始终承担责任。
贡献认定也应承认开创数学路径的人。撰写官方 Navier-Stokes 问题描述的 Charles Fefferman,将 Córdoba 和 Martínez-Zoroa 视为这一故事中的核心人物。
这一判断并不否定 OpenAI 所声称的贡献。它将该结果置于数学累积发展的结构之中。更快的发现应当强化这一结构,而不是抹去它。
AI 数学的未来将取决于机构能否记录这些层叠的贡献。没有可信的溯源机制,每一项重大结果都可能引发第二场关于谁提供了决定性思路的竞争。
OpenAI 的数学争议对研究人员意味着什么
眼下的考验在于,数学界能否在不接受 OpenAI 关于信任的更广泛叙事的前提下验证这一结果。
首先,专家将审查论文和 Lean 形式化。他们必须确认编码后的定理与官方问题一致,并且每一项关键假设都满足其条件。
严重缺陷会削弱有关模型数学可靠性的说法。广泛认可则会强化这样的结论:智能体系统如今已能够在最高水平上为研究作出贡献。
两种结果都不会迅速到来。官方奖项流程要求持续审查,而不是立即认可。OpenAI 的公告日期开启的是审查流程,而非最终篇章。
其次,研究人员应关注有关溯源和数据处理的披露。OpenAI 关于未访问任何特定用户数据的声明,回应了直接检索的问题;但这并未完全解决去标识化使用数据是否影响模型开发的问题。
详细审计、政策调整或独立审查将增强人们对托管研究工具的信心。持续的模糊性则会让研究人员更谨慎地将未发表工作置于商业模型之中。
即使 Buckmaster 的数据没有发挥任何作用,这一信号也很重要。信任依赖于可验证的边界,而不只是冲突出现后的保证。科学家在提交敏感材料之前,就需要明确规则。
第三,下一个由 AI 生成的重大证明将揭示,此次结果是否代表一种可重复的能力。OpenAI 在同一轮行动中评估了其他 Millennium Problems,但尚未公开确立可比的解法。
另一项沿不同数学路径、并得到独立验证的结果,将支持其具备通用研究能力的论点。若长期没有后续成果,则可能表明 Navier-Stokes 受益于异常有利的时机和既有的人类进展。
竞争者同样重要。Anthropic 和 Google 已报告其在数学推理、形式化证明和科学智能体方面取得进展。来自多家服务商的可用系统,将降低人们对单一实验室主张和基础设施的依赖。
最具影响力的变化或许会发生在大学内部,而非 AI 公司之中。数学系将需要制定有关私密提示词、模型辅助署名、披露以及研究记录保存的政策。
期刊可能要求的不只是最终稿件。它们可能要求说明模型使用情况、检索来源、人类监督和形式化验证。会议则可能需要针对涉及共享 AI 平台的同步发现制定程序。
资助机构同样面临选择。它们可以将大规模智能体实验留给富有的公司,也可以为学术团队资助共享计算资源。更广泛的访问将使自动化数学更容易被复现和检验。
开发者和企业采购者也应出于类似原因关注此事。用于搜索证明策略的同类智能体,也能审视代码、合同、实验和内部计划。生产力提升使数据治理和可追溯输出变得更加重要。
知识工作者在使用 AI 系统处理机密工作前,应提出一些基本问题:使用情况是否会用于训练?管理员能否查看?来源和中间步骤是否得到保留?如果服务提供商开发竞争产品,会发生什么?
OpenAI 的 Navier-Stokes 解法指向了证明成果的丰裕,但丰裕本身并不能保证科学可信。更快的定理生成可能增加验证需求、署名争议,以及对专业审稿人的压力。
未来一到三个月将提供初步证据。数学家将报告这一构造能否经受详细审查。OpenAI 可能会披露更多溯源信息,而竞争实验室或许会展示可比的系统。
应关注这些进展,而不要将这项公告或随之而来的反弹视为最终结论。如果证明成立,数学将跨越一个重要门槛。如果溯源仍不清晰,治理问题同样仍将至关重要。
对研究人员而言,实际的应对方式不是放弃 AI 工具,而是要求可复现的证据、明确的数据边界,以及保留人类贡献的记录。关注独立评审,检查形式化产物,并记录模型如何进入你自己的工作。数学的未来将不仅由能够更快搜索的机器塑造,也将由决定何为证明、署名以及公平科学竞争的机构塑造。



