top of page

OpenAI 的 Navier-Stokes 解法引发关于 AI、署名与数学证明的争论

3天前
讀畢需時 15 分鐘

OpenAI 表示,其内部 AI 系统在 88 小时内给出了 Navier-Stokes 方程的解法,向这个困扰数学家约 90 年的问题发起挑战。若获专家认可,这一结果将解决六个尚未攻克的 Millennium Prize Problems 之一。然而,庆祝情绪很快让位于围绕验证、研究署名、企业权力以及数学目的的争论。

OpenAI 的 Navier-Stokes 解法尚未完成数学界传统的同行审查流程。现有一个通过 Lean 机器验证的版本;Lean 是一种能够验证形式逻辑步骤是否正确衔接的编程语言。这为其内部一致性提供了有力证据,但并不能自动解决有关定义、假设、署名或重要性的所有问题。

这些区别主导了 9 月的 Heidelberg Laureate Forum。Fields Medal 获得者与年轻研究人员共同面对这样一个未来:OpenAI、Anthropic 和 Google 能够调动远超多数大学的计算资源。核心冲突不只是人类与机器的对立,而是 AI 产出答案的能力,与数学对理解、可追责的署名和公开审视的要求之间的张力。

OpenAI 称其 AI 实际解决了什么

OpenAI 声称,其系统发现了一个有限时间奇点,表明在允许条件下,光滑的流体方程可能出现数学意义上的失效。

Navier-Stokes 方程描述流体如何运动。工程师和科学家在研究飞机、天气、水流和血液流动时都会使用它。该方程将流体视为连续介质,而非逐一追踪每个分子。

尚未解决的问题涉及三维不可压缩流体运动。数学家想知道,光滑的初始条件是否总会产生光滑的演化行为。另一种可能是出现奇点,即速度等数学量会在有限时间内增长至无界的点。

黏性通常会平滑流体运动。这种平滑效应使构造奇点尤其困难。一个有效的反例还必须满足官方问题陈述中的精确条件。

根据 OpenAI 的解法公告,其系统构造了一个向内螺旋、同时不断被拉伸的涡旋。中心区域在速度上升时持续收缩,但总能量仍保持有限。OpenAI 表示,这确立了官方 Millennium Prize 问题陈述中的两种反例表述。

该构造包含一个光滑的外力。这一细节很重要,因为 Clay 问题允许特定的受迫形式。OpenAI 表示,即使最终速度变得无界,该外力仍然保持光滑。

将方程称为“错误”会过度简化这一结果。Navier-Stokes 方程仍广泛适用于科学和工程领域。奇点所揭示的,是连续数学模型停止平滑运行的一条边界。

OpenAI 于 2026 年 9 月 1 日启动该项目,此前其听闻了与相关流体方程进展有关的传闻。它使用一款尚未发布的内部模型,测试了每一个公开的 Millennium Prize Problem 以及若干相关问题。

该公司称,约有 10,000 个并发智能体参与 Navier-Stokes 工作。智能体是被分配给不同任务的模型实例,配有工具,并只能以有限方式交换发现。不同小组探索了该问题所允许的证明与证伪路径。

OpenAI 报告称,智能体在 9 月 5 日得出结果,即首批智能体启动约 88 小时后。使用 GPT-6 Astra 在 Lean 中完成形式化和验证又耗时 17 小时。

其声称的规模极为庞大。OpenAI 表示,系统在 Navier-Stokes 工作期间交换了 270 万条消息,并生成约 1300 亿个输出 token。若计入所有尝试的问题,总计达到 490 万条消息和约 3000 亿个 token。

这些数字来自 OpenAI,尚未经过独立审计。但它们揭示了这种方法的核心特征:结果并非源自一条对话提示词,或某次格外出色的聊天机器人回答。

相反,OpenAI 组织了一次计算搜索,遍及众多提出的论证、被舍弃的路径、技术检查与形式证明义务。这类似于将一项研究计划压缩至数日内完成,尽管大部分探索由机器执行。

据该公司称,这一结果还来自一款能力强于 OpenAI 公开提供的 GPT-6 Astra 的模型。因此,外部研究人员无法通过普通访问权限复现完整过程。

这种不对称性正是争议的一部分。OpenAI 发布了论文和形式证明,却没有发布生成它们的系统。数学家可以审查所声称的结果,却无法在相近条件下重复这项搜索。

为什么 OpenAI 的 Navier-Stokes 解法尚未尘埃落定

经 Lean 验证的证明能够消除许多逻辑错误,但数学界的认可不止于一次成功的软件检查。

Lean 将数学推理转化为精确定义的对象和规则。它的证明检查器确认每个形式步骤都遵循获准的基础。这一过程可堵住许多普通文字审查中可能遗留的缺口。

不过,形式验证的效用取决于被检验的形式陈述。审稿人必须确认,编码后的定理是否对应原始 Millennium Prize Problem。他们还必须审查定义和假设是否保留了原有意图。

形式化无法裁定署名。它无法确定谁最先提出某种策略、哪些未发表的想法影响了搜索,或公开说明是否给予了足够的认可。

它也不会立即形成共识。Millennium Prize 规则要求在符合资格的刊物上发表,并获得数学家群体的广泛认可。一个拟议解法必须经受至少两年的严格审查,Clay Mathematics Institute 才会考虑进行详细评估。

OpenAI 表示无意申领奖项。这一决定消除了一个财务问题,但并未取消机构层面的标准。专家仍需要时间分析证明,并将其与官方问题进行比较。

验证与理解之间的区别同样重要。即使很少有研究人员理解其组织思路,检查器也能确认一个庞大形式对象的正确性。数学传统上重视能够揭示方法、让他人可以复用、教学、简化或延伸的证明。

一个非常长的证明仍然可能有效。人类数学家早已借助计算机进行计算和穷尽性分类。问题并不在于机器验证以某种方式令论证失效。

人们担心的是,证明的产出速度可能超过人类的解释能力。研究人员或许会比理解结论为何成立更快地获得正确结论。这种失衡将改变数学知识的传播方式。

在 Heidelberg Laureate Forum 上,Fields Medal 获得者 Geordie Williamson 谈到了解决问题与产出理解之间正在出现的分化。他担心数学会奖励未解问题的答案,即便由此产生的机器工作可能只能提供有限的可复用方法论。

Heidelberg 讨论显示,顶尖数学家对此并无一致反应。Jacob Tsimerman 强调能力提升之迅速,并将 Navier-Stokes 问题得到解决视为一个决定性信号。Peter Scholze 则质疑,在理解已经成为瓶颈时,更快的产出是否本身具有内在价值。

这场分歧并非乐观与恐惧之间的简单对立。两种立场都承认这种能力的重要性;差异在于,何种产出应被视为数学进步。

对 OpenAI 而言,正确结果展示了高级推理能力,并为即将到来的系统提供证据。对许多数学家而言,其科学价值取决于研究人员能否吸收其中的思想,并在此基础上继续构建。

因此,独立审查至少必须处理三个层面。专家必须检查形式定理、非形式化的数学解释,以及该构造与既有工作的关系。

第一层考察 Lean 是否在可信基础下接受了该证明。第二层考察这些基础是否编码了预期的问题。第三层考察该结果在既有技术之外贡献了什么。

在这些审查逐步展开之前,“OpenAI 解决了 Navier-Stokes 问题”仍是一项拥有大量支持材料的主张,而非得到普遍接受的历史事实。审慎措辞并非否定这项工作,而是反映了数学如何避免过早的确定性。

署名争议不止关乎一个证明

最尖锐的批评涉及企业 AI 研究如何与学术界关于优先权、署名和私下沟通的规范发生冲突。

OpenAI 表示,它是在听闻两个 Millennium Prize Problems 已被解决的传闻后启动相关工作。该公司后来将这些传闻与 NYU 数学家 Tristan Buckmaster 及 Anthropic 员工 Levent Alpöge 联系起来。

Buckmaster 和 Alpöge 当时正在研究一个与 Euler 方程有关的问题;Euler 方程描述不含黏性的流体运动。他们的工作涉及受迫版本,而非 OpenAI 宣布的完整 Navier-Stokes 主张。

OpenAI 称,其智能体在完成 Navier-Stokes 构造之前,已独立得到一个无外力 Euler 结果。该公司表示,其证明方法不同于二人的 Euler 工作,尽管更广泛的 Navier-Stokes 策略采用了相关的受迫方法。

OpenAI 还表示,参与者在完成项目之前无人看过 Buckmaster 和 Alpöge 的私下工作。经过内部调查后,该公司称,Buckmaster 早先使用 Codex 的提示词不可能通过训练或其他路径影响模型。

Buckmaster 对事件发展过程提出异议,并对 OpenAI 在得知平行研究后的行为表示担忧。这场分歧从技术优先权扩展到有关施压、署名和沟通的指控。

独立报道呈现了其中的不确定性。一篇Scientific American 报道称,Buckmaster 认为 OpenAI 在开发其结果前已得知二人的进展。OpenAI 数学家 Sébastien Bubeck 否认他们的提示词或证明被使用。

Diego Córdoba 和 Luis Martínez-Zoroa 此前曾发展出这一研究路线背后受迫方法的若干方面。Córdoba 向该刊表示,OpenAI 所声称的完成结果令他们感到意外。这段历史使作者归属比将结果归于单一模型或实验室更为复杂。

大多数高等数学成果都源于一连串的方法、阶段性结果、交流讨论和未发表的实验。人类作者会引用这条链条,因为署名有助于研究人员评估创新性。学术贡献也会影响就业、资助、邀请和职业声望。

AI 实验室为这一体系带来了新的不透明性。其模型可能在预训练期间吸收公开文献,检索缓存的网络材料,在数千个代理之间生成不同变体,并组合那些难以追溯来源的想法。

即使系统中没有进入任何私人数据,从文献到输出的路径仍可能不清晰。人类研究人员通常能够说明是哪篇论文启发了某项技术。模型的数百万次交互却无法提供同样的叙事。

这带来了两个彼此独立的问题。第一个问题是,OpenAI 是否不当获取了未发表的工作。OpenAI 否认这一说法,而公开可得的证据尚未对此作出决定性证明。

第二个问题是,该公司是否负责任地处理了同期进行的学术工作。数学家可以批评其沟通方式、署名归属或权力关系,而无需证明私人材料进入了模型。

Williamson 向 IEEE Spectrum 表示,OpenAI 的行为“极其糟糕”。Michael Harris 称,许多公开报道将该公司描绘为以强势手段扰乱学科规范。OpenAI 在该文章发表前未向 IEEE 发表评论。

这些都是严肃的批评,但它们仍是对行为方式的评价,而非技术层面的反驳。即使其公布过程违背了学界预期,Navier-Stokes 证明也可能依然正确。

反过来也同样成立。礼貌的沟通并不能证明一项错误的证明有效。技术评估和伦理评估应当独立进行,尽管二者都会影响信任。

这种区分之所以重要,是因为企业研究公告往往将能力展示、宣传和科学贡献混为一体。一项引人瞩目的成果在将自己呈现为学术研究的同时,也在营销模型能力。学术规范原本并非为能够一夜之间部署数千个专有代理的组织而设计。

OpenAI 决定不争取该奖项,缩小了一项冲突。但这并未回答谁应因该方法获得历史性的贡献认定、如何承认同期工作,或未来公告应提供何种透明度。

AI 数学正在成为一场资源不对等的竞赛

更大的压力落在那些无法匹敌领先 AI 公司模型、算力、专有访问权限或投入规模的研究人员身上。

OpenAI 的 Navier-Stokes 解法出现于 AI 辅助数学成果快速涌现的时期。相关系统已经处理 Erdős 问题、对研究级问题作出贡献,并将重要的既有证明形式化。

Anthropic 也曾用内部 Claude 模型测试黎曼猜想。该尝试并未解决这一千禧年大奖难题,但据报道在一个相关界上取得了进展。Google 和专业项目则通过不同系统推进定理证明、形式化和数学发现。

这场竞争为公司提供了一个明确的测试环境。与论文、商业建议或开放式预测相比,数学答案往往可以得到更客观的检验。证明助手还提供了另一层验证机制。

著名问题也能带来宝贵的宣传价值。帮助解决一个知名猜想的模型,看起来会比在冷门基准上获得更高分数的模型更有能力。这种激励推动实验室瞄准更显眼的目标。

Scholze 在 Heidelberg 批评了这种趋势,将困难问题描述为基准测试和宣传活动。他的反对并非认为著名问题没有价值,而是担心企业激励机制会重新定义什么样的研究值得关注。

一个千禧年大奖难题拥有清晰可辨的终点线,而许多有价值的数学项目并非如此。它们可能构建一种理论、连接不同领域、澄清定义,或开发需要数十年才能成熟的工具。

为显著成果而优化的 AI 系统,可能更偏向于具有可衡量终点的问题。资助、媒体关注和招聘随后也可能遵循同一模式。

年轻研究人员面临更直接的挑战。IEEE Spectrum 报道称,开普敦大学数学家 Mita Ramabulana 发现两项已公布的 AI 进展与自己的工作重叠。他担心,有人可能把研究人员的问题输入模型并抢先发表。

密码学博士研究员 Ailsa Robertson 描述了同事们在模型访问权限上的大量支出。她表示,一些研究人员觉得自己必须使用这些系统,否则会在申请同一批职位的竞争者面前落后。

根据 IEEE 的报道,OpenAI 已向学术研究人员提供 100,000 个前沿模型许可证。访问计划能够扩大参与范围,但也使实验室成为它们日益与之竞争的领域的基础设施提供者。

大学研究人员可能依赖于同一家企业,而该企业能够利用更强的内部模型超越他们的项目。公开工具可以提升研究人员的生产力,但私有系统仍保留着决定性的优势。

这在科学中并非前所未有。天文学、粒子物理学和基因组学都依赖昂贵仪器和大型机构。研究人员早已在争夺稀缺的望远镜、加速器和专业数据集访问权。

不同之处在于治理方式。大型科研设施通常在公共、学术或国际框架内运行。专有 AI 系统则可以在没有公共监督的情况下改变、撤回访问权限,或将最强能力留给内部团队。

从历史上看,数学较少依赖昂贵设备。一本笔记本、文献访问权限和由同事构成的社群,便足以支持重要工作。大规模代理系统如今正在挑战这种相对平等。

对就业的影响也迅速显现。招聘委员会长期以来通过论文、已解决的问题、原创性以及专家推荐信来评估研究人员。AI 辅助让每一种信号都更难解读。

一名候选人可能使用模型探索数百种路径、形式化细节或发现证明。另一名候选人可能无法访问同一系统。两人都可能提交传统格式的论文,却掩盖了截然不同的产出过程。

大学将需要更明确的披露标准。期刊可能需要描述模型、提示词、外部工具和人类贡献的来源记录。这些政策必须区分常规辅助和实质性的自动化发现。

目标不应是保留所有旧有工作流程。AI 可以消除繁琐的形式化工作、检验猜想,并揭示被忽视的联系。它也能赋予小型团队过去仅属于大型协作项目的能力。

但好处不会自行得到均衡分配。如果缺乏透明的访问和贡献认定规则,AI 数学可能沦为一场竞赛:胜者拥有设备、基准测试和公告渠道。

正确答案并不等同于数学理解

核心权衡在于速度与理解,而非机器能力与人类自尊之间的较量。

一项证明同时承担多种任务。它验证一个命题、解释各种关系、传授方法,并为其他研究人员开展新工作提供平台。这些功能并不总会同时出现。

OpenAI 的系统似乎针对第一项任务进行了优化。它搜索了巨大的空间,构建候选结构,并将论证转化为 Lean。如果审稿人确认该结果,这一流程将代表一项重大成就。

然而,形式化对象可能难以阅读。研究人员或许会相信其逻辑有效性,却难以识别使其成立的少数关键思想。证明因而更接近经过验证的软件,而非人类共享的解释。

数学界早已接受由计算支持的结果。四色定理依赖穷举式计算机检验。后来的证明助手项目已将大规模数学体系形式化,其细节无人能够逐行检查。

新的规模改变了平衡。一个能够生成大量重要证明的系统,可能产生理解上的积压。人类专家可能花更多时间审计和翻译机器工作,而非创建自己的研究计划。

Tsimerman 的回应暗示了一种可能的未来。能力的快速增长变得无可否认,因此数学家学会引导它并管理风险。AI 负责探索,而人类选择问题、阐释结构并连接成果。

Williamson 的担忧则指向另一种未来。即便求解与理解已经分离,机构仍继续奖励被解决的问题。由于职业生涯依然取决于传统指标,研究人员便会为机器输出进行优化。

Torsten Hoefler 在 Heidelberg 预测,所有可验证的事物都将被自动化。如果这一预测成立,拥有形式化成功标准的领域可能会比实验科学更早发生变化。

验证仍然无法选择社会重视什么。它无法决定一个问题是否值得关注、一种解释是否具有启发性,或某个数学方向是否服务于公共利益。

它也无法解决治理问题。正确的证明并不能为不透明的数据实践、胁迫式谈判或不平等访问提供正当性。技术有效性和负责任的研究行为仍是彼此独立的义务。

因此,这场讨论超越了数学。软件工程、芯片设计、物理学及其他技术领域正日益使用能够生成可验证成果的 AI 系统。

经过验证的程序仍可能难以维护。有效的芯片布局仍可能掩盖脆弱的开发流程。正确的科学计算仍可能缺乏透明的来源记录。

知识工作者将需要更好的系统,以保留机器输出周围的人类语境。当最终成果快速出现时,研究笔记、被舍弃的假设、来源线索和决策过程会变得更有价值。

一个个人知识库可以帮助个人整理这些语境,但软件本身无法建立科学规范。社群必须决定何种披露和解释才算充分。

一种务实的回应是分层发布。研究人员可以发布形式化证明、可读的论证、来源声明和独立复现报告。每一层回答不同的信任问题。

另一种回应是延后宣传。实验室可以在将结果呈现为已解决的重大挑战前,邀请保密的专家审查。这种做法会牺牲一部分公告优势,但能提高可信度。

第三种回应是扩大访问范围。独立研究人员需要足够强大的工具来复现核心主张。仅发布证明允许验证,但发布有用的评估基础设施则能支持更深入的审查。

这些改变都不要求拒绝 AI 生成的数学。它们将自动化发现视为需要更强而非更弱制度支撑的科学。

该领域的成功将取决于能否保存两种稀缺资源。一种是由企业控制的算力。另一种是任何多代理系统都无法为社群制造的、知情的人类关注。

三个信号将显示这是否会改变数学

下一阶段将由专家认可、透明的来源记录,以及超越单一著名成果的可重复发现来决定。

第一个信号是独立的技术审查。专家必须确认,正式陈述与 Clay 的表述一致,且非正式构造能够支撑正式结论。公开分析、研讨会与同行评审报告的重要性,将超过社交媒体上的共识。

Clay Mathematics Institute 的时间表决定了不可能立即作出官方裁定。其规则要求符合条件的发表成果经过至少两年的严格审查。OpenAI 决定不申请该奖项,并不会缩短学术界的智识审查过程。

如果专家广泛接受这一证明,OpenAI 的 Navier-Stokes 解将成为自动化推理的里程碑。如果他们发现假设或解释之间存在不一致,这一事件则会成为一个警示:机器验证的结果不应过早宣布。

第二个信号是可信的溯源标准。OpenAI 披露了智能体数量、token 总量、时间线,以及部分有关并行研究的信息。批评者仍质疑,这些说明是否足以解释该方法的来源,以及该公司的沟通方式。

未来的报告应记录系统可访问哪些内容、候选思路如何产生,以及已知的人类技术在何处进入流程。报告还应区分独立生成的步骤与已存在于公开文献中的方法。

一份有用的溯源记录不需要包含每一个 token。数百万条原始消息会让审查者无从应对。它需要提供一条清晰的链条,连接来源、关键决策、人工干预与最终主张。

第三个信号是可重复性。一项备受瞩目的证明,可能只是模型、方法与海量资源恰好匹配的幸运结果。持续性的变化要求系统能够在不同数学领域产出获得认可的结果。

OpenAI、Anthropic 与 Google 很可能会继续瞄准可进行客观验证的问题。真正有意义的衡量标准,将是独立专家验证结果并复用相关方法的频率。

还应关注这些公司是否向外部研究者发布更强大的系统。私有模型可以证明某种能力主张,但广泛的科学影响力需要可访问性、可复现性或可靠的合作机制。

同样应关注期刊和大学如何修订其政策。披露规则、署名标准和招聘标准,将揭示机构是将 AI 视为普通工具,还是视为实质性的研究参与者。

Heidelberg 论坛让一个事实变得清晰:数学家们不再讨论遥远的假设情境。当企业系统已经以前所未有的速度提出研究主张时,他们正在决定应如何回应。

这场 AI mathematics debate 应当引起所有依赖可验证知识开展工作的人关注。开发者、研究人员和技术团队都将面对同样的分野:正确的输出与可理解的过程之间的差距。

眼前的任务并非在人类数学与 AI 数学之间二选一,而是在机器搜索速度快于社群吸收能力时,建立能够维护审查、署名、访问权与解释的规则。

关注独立的证明审查,而不只是下一次企业公告。要追问该方法是否变得可理解、外部研究者能否复现,以及贡献归属能否经受审视。这些答案将决定 OpenAI 所宣称的解法会成为共享的数学进步,还是仅仅是一项令人印象深刻的专有成果。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page