OpenAI 纳维-斯托克斯证明引发“谁该获功”之争
OpenAI 表示,约 1 万名 AI 智能体在 88 小时内得出了纳维-斯托克斯方程的解,但这一宣布立刻引发了关于研究成果归属的争议。如今,OpenAI 的纳维-斯托克斯证明处于一场更深层争论的核心:如果研究人员与商业聊天机器人分享尚未完成的想法,另一个系统日后能否在无人承认这种关联的情况下利用相关知识?
OpenAI 否认此事在这里发生过。该公司称,其内部模型不可能受到纽约大学数学家 Tristan Buckmaster 近期提示词的影响;Buckmaster 当时正在推进一项相关成果。然而,这场争议并不止于一项指控。它揭示了当模型、私人对话、已发表论文和庞大的智能体系统共同参与发现过程时,归属认定会变得多么困难。
即使专家最终接受证明中的每一行,这个问题依然重要。数学界传统上通过论文、研讨会、引用和有记录的交流来分配功劳。AI 系统则将这些路径压缩进不透明的计算过程。正确性可以检验,但思想谱系却更难重建。
OpenAI 称其智能体解决了什么
OpenAI 声称,其未发布的系统在一次持续四天的智能体行动后,解决了数学六个尚未解决的千禧年大奖难题之一。
纳维-斯托克斯方程描述流体如何运动。它们可用于建模从飞机周围气流到天气和洋流等各种系统。尚未解决的数学问题在于:光滑的三维解是否始终保持良好性质,还是可能在有限时间内出现奇点。
奇点通常也被称为爆破点,指某个数学量变得无界的点。在这一情境中,方程会产生这样的行为,例如速度在有限时间内无限增长。
根据其纳维-斯托克斯说明,OpenAI 于 2026 年 9 月 1 日启动了这项工作。该公司听闻,与 Anthropic 有关联的研究人员可能已在两个千禧年大奖难题上取得进展。随后,OpenAI 指挥多组智能体攻克其余难题及若干相关问题。
该公司称,近 100 名智能体首先花费约 50 小时研究欧拉方程。欧拉方程描述无黏性的流体运动;黏性是使流体抗拒运动的内部摩擦。OpenAI 表示,这些智能体发现了一种无需外力的爆破解。
这一结果促使该公司将资源集中于纳维-斯托克斯方程。它为这一问题分配了约 1 万个并发智能体。这些智能体能够读取缓存版本的互联网、运行代码、在小组内部交流,并交换有前景的中间结果。
OpenAI 称,智能体于 9 月 5 日得出解,距工作开始约 88 小时。随后使用 Lean 进行了 17 小时的形式化和检查。Lean 是一种证明助手,可将数学论证转换为计算机能够逐步验证的陈述。
其规模非同寻常。OpenAI 报告称,其系统在所有尝试解决的问题中交换了 490 万条消息,并生成了约 3000 亿个输出 token。纳维-斯托克斯工作占其中 270 万条消息和约 1300 亿个 token。
这些数字描述的是工业化研究流程,而非与聊天机器人的普通对话。数千名智能体同时探索不同方案,其他系统则汇总有用想法,并将其反馈至搜索过程。
OpenAI 于 9 月 8 日发布了公告和论文。不过,这一结果仍是一项正在审查的主张,而不是获得官方认可的千禧年大奖解答。独立数学家仍需理解其论证、检验其假设,并确定它是否满足原题要求。
该公司还称,无意主张相关奖金。这并不降低该结果的重要性。一项有效解答将解决困扰数代数学家的问题,并为机器生成的研究树立新标杆。
因此,Nature 的原始报道关注的不仅是证明是否正确。它提出的问题是:当机器通过一种其思想输入无法像人类论文中的引用那样追溯的过程得出结果时,会发生什么?
为什么 OpenAI 纳维-斯托克斯证明演变为成果归属争议
争议之所以出现,是因为人类研究人员已经在借助商业和内部 AI 系统探索高度相关的思路。
Buckmaster 与数学家 Levent Alpöge 一直共同研究流体方程。Alpöge 就职于 Anthropic,不过报道称,他是以私人身份而非作为公司正式项目来推进这项研究。
他们的研究同时运用了人类推理和 AI 辅助。Buckmaster 使用了商业可用的 OpenAI 和 Anthropic 产品。Alpöge 则可以使用 Anthropic 的内部模型。据报道,两人在 8 月发现了一个受迫欧拉爆破解,这是一项重要的相关成果:它向流体系统施加外力。
两人尚未完成纳维-斯托克斯方程的解答。他们仍在研究欧拉方程成果,并尝试扩展其中的基础思路。随后,有关其进展的传闻流传开来,OpenAI 启动了大规模智能体行动。
这一时间线造成了核心冲突。传闻并未向 OpenAI 提供一份证明,但似乎帮助其锁定了一个有前景的研究目标。该公司的智能体随后在原研究人员完成项目之前,得出了一个范围更广、但仍属声称的结果。
OpenAI 表示,其于 9 月 6 日完成纳维-斯托克斯证明和 Lean 验证。随后,该公司联系 Buckmaster 和 Alpöge,因为其认为双方解决了同一问题。OpenAI 提议协调发布公告,并提出承认他们在相关欧拉方程成果上的优先权。
双方的交流逐渐变得紧张。Buckmaster 质疑,他在研究期间输入 Codex 的信息是否可能影响了 OpenAI 的系统。若确有其事,机器的结果便会与他尚未完成的工作存在一条隐蔽关联。
OpenAI 调查后否认了这种可能性。该公司称,解决该问题时未访问任何具体用户数据。它还表示,Buckmaster 在发布前两个月内提交给 Codex 的提示词不可能影响内部模型,包括通过训练产生影响。
这一否认回应的是一项狭义的技术性指控,但并未完全解决归属问题。
一个模型可能依赖数十年的论文、讲义、代码、在线讨论和此前模型输出。智能体系统随后可以以任何研究团队都无法手工记录的规模,重新组合这些材料。即使排除近期私人提示词,确定哪些人类想法实质上塑造了一项机器生成的证明仍然困难。
问题并不只是聊天机器人是否复制了一段文字。数学界的功劳通常归于某种方法、化简、概念性洞见或研究方向。这些贡献可能影响系统,却不会以最终输出中可辨认的文本形式出现。
研究人员通常会承认在研讨会或私人交流中获得的想法。模型却无法可靠地提供这种社会性历史。它给出答案,同时隐藏了连接答案与其思想来源的大部分路径。
这正是 OpenAI 纳维-斯托克斯证明成为研究来源可追溯性试金石的原因。来源可追溯性是指关于信息和想法起源的有记录说明。没有它,用户只能接受公司对于系统使用或未使用何种数据的笼统保证。
这一问题与个人和组织知识系统面临的常见挑战相似。当人们能够将答案与其支持记录关联起来时,信息才更有价值。可靠的AI 知识库会保留这些关联,而不是在缺乏上下文的情况下呈现生成文本。
然而,对数学发现而言,利害关系还包括职业生涯、优先权、奖金和历史记录。一条不完整的来源追溯链,可能决定谁被铭记为某个想法的提出者。
AI 的规模正在碰撞数学界的成果归属体系
真正的对手并不是数学家与机器,而是工业化规模的证明搜索与建立在可追溯人类交流基础上的成果归属体系之间的冲突。
数学一直充满竞争。研究人员争相发表,平行发现时有发生,关于优先权的争议早于计算机出现。同行评审从未保证完美的成果归属。
AI 改变了这场竞争的速度和规模。OpenAI 表示,其在听到传闻后调动了约 1 万名智能体,并在数日内获得结果。一名大学数学家无法用传统资源匹敌这种并行搜索的规模。
这种不平衡形成了新的激励机制。一个公开有前景研究方向的实验室,可能吸引拥有更强计算能力的公司发起集中式智能体行动。原创研究人员或许会在完成撰写、验证和解释自身成果之前失去优先权。
加州大学洛杉矶分校数学家、菲尔兹奖得主 Terence Tao 警告称,这种动态可能会抑制早期想法的分享。即使一则传闻也能触发大规模自动化工作,研究人员可能因此避免研讨会、非正式交流和公开进展报告。
这种反应会损害数学最核心的制度之一。难题往往通过多年的局部进展、研讨活动、预印本、失败路径以及不同团队之间共享的改进而得到解决。限制这种流通将以集体进步为代价保护个人优先权。
这种激励问题还延伸至商业 AI 产品。研究人员越来越多地使用聊天机器人测试想法、查找参考资料、生成代码或形式化证明。这些工具可以加快工作,但用户可能不了解其输入会如何被存储、审查或纳入后续系统。
OpenAI 表示,近期 Codex 提示词并未影响这一结果。研究人员仍需要不依赖于争议出现后追溯性调查的政策。
安全研究模式可以提供明确的数据保留保证、可审计的访问日志,以及可强制执行的模型开发排除机制。然而,仅靠隐私无法解决历史归属问题。模型仍可能依赖已发表的人类工作,却无法提供充分引用。
这场争议还凸显了发现证明与将其融入数学体系之间的区别。AI 可以生成一串形式上有效的陈述链,但人类专家仍可能不确定其中的核心思想。一项证明可以是正确的,却依然难以解释、教学、复用或与现有理论建立联系。
布朗大学专家 Javier Gómez-Serrano 告诉《华盛顿邮报》,OpenAI 长达 166 页的陈述难以理解。他的反应说明,形式化验证并未完成科学过程。
人类数学家仍必须识别其中的核心机制。他们需要剔除不必要的结构,将这一构造与早期工作比较,并解释结果为何能够成立。这些工作决定了一项证明能否成为某个领域的有效知识。
这项劳动带来了另一项署名问题。如果外部学者花费数月时间,将 AI 生成的论证转化为可理解的数学,他们的贡献并非事务性工作。他们是在让这项成果变得可用。
现行的署名体系尚无成熟方式,来划分模型开发者、算力提供商、提示词设计者、形式化系统、早期研究者,以及解读最终证明的专家之间的认可。将一家企业列为作者,会把这些不同角色压缩为一个标签。
这种模式便于宣传,却远不利于学术问责。
形式化验证检查逻辑,而非智力成果的归属
Lean 可以发现形式化证明中的逻辑漏洞,但无法判定创意最初来自谁,也无法判断形式化陈述是否与每一项预期主张相符。
形式化验证是 OpenAI Navier-Stokes 证明主张最有力的特点之一。Lean 证明并非模型宣称正确的一段文字。系统会检查每一个形式化步骤是否都能从被接受的定义和既有结果中推导出来。
这一过程能够发现隐藏的逻辑跳跃、遗漏的情形和不一致的假设。它还会生成可复现的成果物,供其他研究者检查和运行。
但形式化验证也有边界。Lean 检查的是以 Lean 编码的定理。专家必须确认,编码后的定理是否准确代表原始数学问题,以及导入的假设是否悄然削弱了该主张。
这一区别之所以重要,是因为 Navier-Stokes 问题存在多种表述方式。OpenAI 表示,其证明建立了具有平滑外力的平滑解在有限时间内形成奇点。专家必须判断这一构造是否满足 Clay Mathematics Institute 规定的条件。
该机构的官方问题描述提供了权威目标。获得认可不止需要通过软件检查。相关工作还必须发表在符合条件的刊物上,经受审查,并得到全球数学界的广泛接受。
Clay 的流程刻意推进缓慢。如此重要的成果,不能只靠一次发布公告和一套内部验证流程。
Lean 也不评价表述质量。一项形式化证明即便正确,也可能几乎无法为人类读者提供概念上的清晰度。它可能包含庞大的构造,即便每一处局部推理都通过,整体结构仍然晦涩不明。
Lean 也无法重建来源脉络。它不知道某个中间想法来自论文、模型训练数据、私人提示词,还是独立搜索。逻辑依赖与历史影响是不同的问题。
OpenAI 报告的流程进一步复杂化了这一区别。多个智能体群组探索了许多路径,交换中间结果,并接收汇总后的洞见。最终证明来自一个由生成消息构成的网络,而不是一条连续的单一论证。
因此,一份充分的研究记录需要的不只是最终形式化文件。它还可能包括时间戳、提示词历史、源资料检索日志、中间猜想、模型版本,以及思想如何在智能体群组间流动的记录。
公布所有这些内容或许并不现实。OpenAI 表示,仅 Navier-Stokes 项目就产生了 270 万条智能体消息。原始数据倾泻会淹没审稿人,也可能暴露安全敏感的系统细节。
替代方案是结构化溯源。系统可以标识实质性塑造最终证明的关键引理、检索来源、决定性分支和人工干预。独立审查者随后便可审计一条可管理的研究轨迹。
OpenAI 曾对近期用户数据作出强有力保证,但外部人士目前仍无法复现其完整的内部搜索过程。该模型本身尚未发布,公司的算力环境也不向学术团队开放。
这种不对称意味着,最终证明可能可供检查,而其发现过程仍是封闭的。数学可以验证产出,却无法全面审计该产出如何诞生。
这是当前争议中最重要的不确定性。证明检查可以裁定正确性,却无法仅凭自身裁定贡献归属。
数学家正在质疑这场基准竞赛
25 位菲尔兹奖得主组成的团体认为,AI 公司正为头条式成果而优化,而数学所重视的是理解、教育和人类能力的累积发展。
他们题为Severe Misalignment的声明在 OpenAI 公告后发布。声明批评将重大数学问题作为前沿模型公开基准的做法。
签署者并不否认 AI 能够产出有效的数学成果。他们担心的是,解决著名问题已成为企业的性能指标,而这些企业的激励机制与研究共同体并不相同。
对 AI 实验室而言,千禧年大奖问题提供了一个令人难忘的模型能力展示。公司可借此获得关注、竞争优势,并证明其系统能够完成超越常规基准的工作。
对数学家而言,最终的真或假结论只是价值的一部分。该领域还依赖于探索过程中发展出的方法、通过参与接受训练的学生,以及与其他领域建立的概念联系。
公开信警告说,仓促推出解答可能无法为清晰表述和恰当引文留下足够时间。它还认为,大规模产出结果可能会挤压构建理解所需的缓慢工作。
这种批评有其力量,但不应演变为只有人类可以解决重要问题的主张。Buckmaster 和 Alpöge 自己也使用了 AI。他们的经历表明,更现实的竞争存在于人类、模型、数据和算力的不同组合方式之间。
AI 可以扩大高难度数学的可及性。规模较小的研究团队或许能够使用智能体检验更多假设、形式化更长的论证,并更高效地检索文献。学生也能获得稀缺的人类导师未必总能提供的详细反馈。
问题在于,谁控制最强大的系统,以及成果如何发布。如果前沿数学能力仍集中在少数私营实验室内部,这些公司便可选择研究目标、披露时间表和署名做法。
过度解读 Navier-Stokes 主张同样存在风险。一次成功证明并不意味着 AI 以人类研究者相同的方式理解数学。它只能表明,一个庞大的协调系统能够在特定条件下搜索、综合并验证结果。
OpenAI 给出的数字使比较变得困难。由 10,000 个智能体和 1,300 亿个 token 生成的产出,无法与一位使用消费级聊天机器人的数学家直接相比。计算成本和运营专业能力仍然高度集中。
该系统还可以访问缓存的互联网,其中包含数代人类数学工作的成果。任何关于自主机器发现的描述,都必须承认这一基础。
与此同时,报告成果的速度也不能被忽视。OpenAI 表示,其智能体从启动到获得经 Lean 验证的证明不足一周。即便这种方法高度依赖既有的人类理论,这一速度仍改变了竞争环境。
数学家如今面临一个实际困境。回避 AI,可能会使他们无法与使用 AI 的团队竞争;在缺乏坚实保障的情况下拥抱 AI,则可能暴露尚未完成的想法,或削弱他们记录原创贡献的能力。
结果并非任何一方的明确胜利,而是对建立新制度的压力。
贡献归属规则需要涵盖什么
科学归属必须从标注最终作者,扩展到记录结果背后的人类、模型、来源和计算决策。
第一项要求是更清晰的披露。研究者应说明使用了哪些模型、这些系统是公开还是内部系统,以及哪些阶段涉及 AI 协助。当模型提出核心引理或执行证明搜索时,一句笼统地称 AI 协助编辑的说明并不充分。
第二项要求是具备来源意识的模型输出。数学智能体应为检索到的定义、技术和中间结果附上候选引文。由于语言模型可能误认来源或编造参考文献,这些引文需要人工审查。
第三项要求是可审计的隐私保护。使用托管系统的研究者需要对敏感工作拥有明确控制权。服务提供商应在用户提交未发表的想法前,使数据保留期限、训练排除机制和员工访问规则易于理解。
第四项要求是基于角色的贡献认可。一篇论文可以区分概念贡献者、形式化人员、模型操作员、来源策展人和表述审阅者。现有贡献分类法提供了起点,但数学需要适合证明工作的类别。
第五项要求是独立复现。外部团队应能够验证形式化成果物,并检验核心方法能否在转化为更清晰的人类论证后依然成立。未发布的模型不应使定理本身无法被评估。
这些措施都无法完美重建影响关系。人类研究者也会忘记想法最初来自何处,引用历来都不完整。目标并非一份毫无瑕疵的账本,而是一份足以支撑信任并解决可预见争议的记录。
出版机构和专业学会需要制定规则。将归属问题完全交给 AI 公司处理,会造成明显的利益冲突。当结果显得具有自主性时,公司会从中获益,而学术共同体则承担遗漏贡献认可的代价。
大学同样需要为保密的 AI 辅助研究提供指引。随着工具不断改进,仅仅告诉学者不要使用模型将变得不现实。机构应当明确哪些系统适合用于未发表工作,以及研究者必须保留哪些记录。
资助机构同样拥有影响力。它们可以要求披露 AI 使用情况、提供溯源计划,并为受资助项目保存机器生成的研究日志。这些要求将使归属问题成为研究设计的一部分,而非发表之后才出现的争论。
OpenAI Navier-Stokes 证明使这些变化变得紧迫,因为它在同一事件中汇集了多个问题:有关私人进展的传闻、外部研究者使用的商业平台、不透明的内部模型、庞大的智能体集群,以及在广泛专家评审之前发布的企业公告。
任何仅处理训练数据或仅处理作者身份的未来政策,都会忽视更广泛的系统。贡献归属沿着一条智力依赖链展开,而 AI 将这条链延伸至产品、组织和时间之中。
接下来值得关注什么
三项进展将表明,OpenAI Navier-Stokes 证明会成为被接受的数学成果,还是主要作为 AI 研究治理的警示而存在。
首先,关注独立专家验证。专业人士必须确认形式化陈述与千禧年大奖问题相符,并确认该证明在定义或假设中不存在任何隐蔽的不匹配。来自 OpenAI 外部研究者的更清晰表述,比又一次公司公告更能增强这项主张。
其次,关注 OpenAI 如何记录溯源信息。该公司否认 Buckmaster 最近的 Codex 提示词影响了该系统。它尚未提供一个具有广泛适用性的框架,说明研究人员如何在未来争议中验证类似说法。一项持久的政策应包括在项目启动前就确立的数据控制、审计程序和署名规则。
第三,关注期刊、大学和数学学会的回应。25 位菲尔兹奖得主将此定性为一个制度性问题,而非一场单独的分歧。具体的披露标准和安全的研究实践将表明,学术共同体正在适应。沉默则会让每位研究人员不得不私下与规模大得多的科技公司协商。
数学本身需要时间来定论。Clay 的认可要求成果发表并获得持续接受,而研究人员也需要从形式化工具中提炼出易于理解的论证。
署名问题等不了那么久。科学家已经在与 AI 系统分享未发表的想法,实验室也已开始扩大基于智能体的研究。问题不再是机器能否为重大科学发现作出贡献,而是围绕这些发现的制度能否保留关于谁贡献了什么的证据。
在专家审查 OpenAI 的 Navier-Stokes 证明时,读者也应同时关注两项结论:该定理是否正确?它从人类知识走向机器输出的路径,能否得到可信的解释?AI 辅助科学的未来,取决于这两个问题能否都得到回答。



