top of page

OpenAI 数学研究刚刚以 722 篇手稿席卷了整个领域

6小时前
讀畢需時 14 分鐘

OpenAI 发布了 722 篇数学手稿,覆盖 372 个问题家族,使 OpenAI 数学研究成为检验科学界如何吸收机器生成发现的一场考验。

据 OpenAI 称,这批于 10 月 6 日发布的材料涵盖代数、几何、数论、逻辑、微分方程和理论计算机科学,其内容由一款尚未发布的内部模型生成。

规模是眼前最引人注目的故事。更深层的冲突则在于:产出一个证明,与推动数学发展,是否是同一种成就。

数学家仍须核查正确性、追溯既有思路、识别重要论证,并说明结果为何重要。这个过程所需时间,可能远超生成原始手稿的时间。

OpenAI 表示,希望这些结果能够推进人类知识。批评者则认为,一款专有模型可能压垮那些负责将技术产出转化为共同理解的机构。

这场争议如今已超越数学范畴。类似系统还将瞄准软件验证、物理学、工程学及其他建立在复杂推理之上的领域。

OpenAI 数学研究以 372 个结果家族的形式到来

OpenAI 并未发布一项广受赞誉的证明,而是一次性抛出了一整套等待数学界评估的研究积压成果。

该公司的发布声明介绍了一批由内部前沿模型产出的广泛成果。OpenAI 通过 GitHub 发布这些材料,而非将每项结果都经由传统期刊发表。

其公开仓库列出了 722 篇手稿,并将其组织为 372 个家族。一个家族可包含主要结果、相关论证、推论或替代性证明。

这一区别解释了不同报道中的标题数字。提及超过 300 项结果的报道通常是指问题家族,而仓库则统计每一篇独立手稿。

该合集覆盖数学的众多分支。其目录包括解析数论、数理逻辑、组合数学、概率论、几何学和理论计算机科学等领域的工作。

部分论文涉及既有猜想。另一些则改进已知界限、证明相关命题,或连接此前分属不同研究领域的方法。

该仓库还包括概述、手稿地图、源文件和引用说明。OpenAI 为选定结果提供了 10 份删节版推理摘要。

许多论文附带相关 Lean 工件。Lean 是一种证明助手,可将数学主张转化为软件能够逐步核查的形式化陈述。

不过,OpenAI 并未声称每篇手稿都已完成这一过程。其仓库明确表示,该合集中的结果处于不同的验证阶段。

该公司还警告,一些未形式化的结果可能存在问题。这一限定很重要,因为一个论证即使看上去令人信服,也可能隐藏细微的逻辑漏洞。

OpenAI 表示,平均每项结果消耗的计算资源,大致相当于 ChatGPT Pro 约三小时的思考。这一数字描述的是计算投入,而非专家审查或数学重要性。

此次发布之前,OpenAI 已在个别研究问题上取得进展。该公司此前曾公开涉及 Erdős 猜想、单位距离问题及其他长期问题的成果。

这些早期案例让专家能够一次聚焦一项结果。新发布改变了分析单位:从一篇论文转变为庞大的研究组合。

这一转变构成了本文的核心张力。AI 生成候选数学成果的速度,可能快于现有学术系统解读、验证和整合它们的速度。

《华盛顿邮报》的初步报道重点介绍了一项与修正后的 Riemann 假设相关的结果。原始的 Millennium Prize 问题仍未因这次发布而得到解决。

这一澄清限制了一种可能的误解。该合集规模可观,但并不包含对任何尚未解决的 Millennium Prize 问题的新近宣布解答。

它的重要性更多来自广度。据报道,单一内部模型在众多专业领域产出了相关工作,其中包括通常需要多年专注训练的领域。

由此产生的问题已不再是 AI 能否偶尔为高等数学作出贡献,而是该领域能否以负责任的方式处理如此规模的机器产出。

瓶颈已从发现转向理解

生成候选证明正变得更便宜、更快速,而人类理解依然缓慢、专业化,并且难以规模化。

传统数学出版将责任分配至多个阶段。作者核查论证、引用先前工作、解释关键思路,并将论文提交给专家评审。

随后,其他数学家会检验该证明。他们会在研讨会上讲解、重写困难步骤、与既有方法比较,并判断结果是否改变了领域格局。

OpenAI 压缩了这一过程中的产出端,却没有压缩发表之后所需的人类工作。

形式化证明可以确立特定步骤在形式系统中能够推导成立。它无法自动确立该形式化陈述是否对应预期的数学问题。

形式化验证也不会评定重要性。一项正确的改进可能在技术上很有意思,却对未来研究影响甚微。

研究者必须判断,一篇论文究竟解决了其所声称的问题、复现了已知论证,还是悄然依赖于被忽略的假设。他们还必须检查归属问题。

当数百篇论文同时到来时,这些任务会更加困难。专业人士不能仅因为底层文件可公开访问,就负责任地评估陌生的子领域。

OpenAI 表示,通过发布摘要、计算估算、尝试统计和形式化工件,它提高了透明度。这些材料提供的证据多于一则简单公告。

然而,重要的不对称性依然存在。模型本身并未公开,外部研究者无法独立复现其完整的问题求解过程。

只有 10 个结果家族获得了删节版推理摘要。这使得合集的大部分内容缺乏同等程度的过程可见性。

该仓库也只代表一次发布时点。数学需要一份持续更新的记录,其中包括与每项主张相连的修正、批评、修订和解释。

GitHub 支持修订,但它不能替代学术共识。仓库可以分发文件,却不能决定专家接受哪些结果。

因此,这次发布更像是一项验证挑战,而非已经完成的科学里程碑。正确性、新颖性、归属和实用性都必须分别评估。

这种区别也解释了为何不同反应看似互相矛盾。一位数学家可以认为模型能力令人瞩目,同时批评其发布流程。

在同一合集内,OpenAI 数学结果可能同时包含重要发现、常规延伸、重复思路和有缺陷的论证。总体数量无法区分这些情况。

这一问题同样影响学术界之外的读者。即使底层贡献差异巨大,庞大的数字仍会制造成果整齐划一的印象。

手稿家族并非科学价值的标准化单位。一个家族可能重塑一个领域,另一个则可能只是带来适度的技术改进。

因此,公众需要的不只是总数,还需要独立评估来解释哪些结果经受住了审查,以及专家为何认为它们具有意义。

这种解读并未淡化该技术的价值。生成数百篇看似可信的研究手稿,本身就是一个重要的能力信号。

但它确实恰当地界定了责任所在。这次发布开启了一项科学评估过程,而不是完成了它。

专有模型让数学家处于守势

核心冲突在于:AI 实验室内部的机器规模化产出,与实验室外部社群规模化验证之间的矛盾。

OpenAI 控制着内部模型、开发环境,以及用于这些实验的计算资源。数学家只能在生成过程结束后收到最终手稿。

这种安排使实验室对哪些问题获得关注拥有相当大的影响力,也让公司能够选择何时以及如何发布其发现。

独立机构 Advisory Group on Mathematics and Artificial Intelligence 对这一结构提出了质疑。该团体成员包括来自多所顶尖机构的知名研究人员。

其发布指南称,前沿实验室应停止在无法访问的专有模型上测试高等数学问题。这一建议反映了对研究力量不平等的担忧。

该团体认为,实验室应披露模型、提示词、处理时间、计算估算,以及每项结果背后的推理摘要。

它还建议在可行情况下将证明形式化。当无法立即完成形式化时,每篇论文都应明确说明其验证状态。

这些指南同样涉及失败尝试。如果读者不知道模型在多少类似问题上尝试失败,一组成功案例就可能夸大其能力。

OpenAI 对其中几项担忧作出了回应。它发布了尝试统计、选定的推理摘要、Lean 工件,以及基于 ChatGPT 使用情况的估算。

该公司还表示,在规划发布时咨询了该咨询团体。不过,该团体强调,咨询并不等于背书。

顾问们将发表描述为纳入数学知识体系的第一步。他们拒绝接受“上传结果就完成了这一过程”的观点。

他们的担忧既关乎制度,也关乎技术。一个专有系统可以选择研究方向,却不向数学家提供平等的能力访问权。

这形成了双层结构。AI 实验室可以以工业速度生成新工作,而外部专家则承担较慢的解读与验证。

这些专家也可能面临更低的动力去研究高风险问题。一位研究者可能花费数年发展某种方法,却发现内部模型率先完成了它。

这种可能性并不意味着 AI 系统不正当地获取了研究者的想法。但它确实意味着模型访问权与计算资源能够重塑学术署名、时机和职业回报。

Anthropic 提供了最具相关性的竞争参照。其模型也曾对研究级数学作出贡献,包括与困难猜想相关的发现。

因此,这场竞争并不只是 OpenAI 与学术数学家之间的竞争。前沿实验室彼此也在竞相展示科学推理能力。

这场竞赛奖励引人注目的结果和快速披露。相比之下,学术数学更重视归属、阐释、可复现性和持久的理解。

这些激励有时会重叠,但并不完全相同。即使专家需要数月才能评估,一项惊人的证明也能为模型造势。

竞争压力同样推动了大范围的问题搜索。模型可以尝试大量问题并展示成功案例,而人类研究者通常会深入投入较少的研究方向。

这种策略类似于自动化探索。当证明步骤能够通过代码、符号计算或形式化系统进行核验时,它尤其有效。

然而,访问权限决定了谁能参与。如果只有少数实验室能够运行最强大的系统,它们就会在自己声称衡量的前沿领域获得影响力。

当模型不再局限于解决已被认可的问题时,冲突将会加剧。选择有价值的问题本身就是数学创造力的核心部分。

一个能够选择研究方向的系统,会影响资金、声望、招聘和合作。这些后果无法仅凭基准测试分数来评估。

证明可以正确,却未必成为人类知识

最艰难的检验并不在于 AI 生成的论证能否通过检查器,而在于人们能否理解并复用其中的思想。

数学将证明视为不止是证书。一份有用的证明能够解释关系、引入技巧,并帮助研究者在其他地方识别相似的结构。

机器生成的证明可以满足形式要求,却无法提供更广泛的洞见。它可能依赖冗长的变换链条,使专家也难以解读。

哈佛大学数学家 Melanie Matchett Wood 此前曾描述过一个相关的表述问题。领先模型可能会对简单步骤过度解释,却在最困难的推理环节快速略过。

这种失衡会使审阅变得低效。恰恰是在论证包含最具原创性或最脆弱思想的地方,人类读者最需要细致的解释。

当前发布试图通过概述文件和精选推理摘要解决这一问题。OpenAI 还承诺举办研讨会、会议和特别项目。

这些承诺承认,仅靠发表无法带来理解。研究者需要时间和支持,才能将机器输出转化为传统的数学叙述。

顾问小组认为,实验室应为这项工作提供资金,但不应控制它。独立机构应决定哪些解释性项目获得支持。

这种分离至关重要。一家公司不应同时决定哪些结果算重要,以及社区应如何解读这些结果。

形式化可以减少一类不确定性。经过 Lean 检查的证明能更有力地保证,一个形式化定理确实由既定假设推导而来。

但它无法解决该定理是否准确捕捉了原始非形式化问题。将数学主张翻译为形式语言,本身也可能引入错误。

形式化同样无法确立新颖性。一份经过验证的论证,可能只是以不同方式重现了早期文献中已有的思想。

因此,文献引用审查仍然必不可少。模型可以整合来自众多来源的概念,却无法为每一步提供可靠的思想来源追溯。

该仓库的规模使这项工作颇为困难。数百篇手稿可能与早期论文、讲座以及未发表的社区知识之间存在数千条关联。

OpenAI 表示,未来发布将改善引用、论述和呈现方式。这一承诺也表明,当前材料作为学术产品仍不完整。

目前有证据支持的最强主张较为有限:一个内部模型生成了大量研究手稿,其中一些附有可由机器检查的证明工件。

现在断言其中有多少个系列包含正确、新颖且具有重要影响的数学成果,还为时过早。这些属性需要分别评估。

Nature 的独立报道描述了围绕此次发布的争议。这样的反应反映了工作量、访问权限和治理方面的担忧,而不只是对模型能力的怀疑。

一些数学家可能很快会发现有用的思路。另一些人则可能发现错误、遗漏的引用、不清晰的定义,或是比标题所暗示更弱的结果。

对于一个规模庞大且未经审阅的合集来说,这种混合情况很正常。不寻常之处在于,整个语料库由一个系统一次性产出。

对于从事研究的学者而言,管理这一语料库会成为知识管理问题。团队必须连接主张、注释、更正和既有文献,同时不丢失其来源脉络。

个人知识管理工具可以帮助组织阅读工作。它们无法取代专家对于证明有效性或重要性的判断。

所需的工作流类似于协作式软件审查。研究者需要问题跟踪、版本历史、可复现的检查、明确的责任归属和清晰的验收标准。

但数学无法将每一项洞见都简化为一套测试。解释与判断仍然居于核心位置,尤其是在结果引入陌生概念时。

因此,由独立专家解读 OpenAI 数学成果的重要性,将超过又一个汇总数字。理解必须成为下一项可衡量的产出。

这些结果检验的是 AI 的机制,而不只是它的分数

此次发布表明,前沿模型能够沿着长推理路径搜索、组合并验证数学策略。

早期 AI 基准测试通常呈现答案已知的独立问题。研究数学则不同,因为正确的路径,有时甚至最终主张本身,仍然未知。

一个开放问题需要文献意识、策略选择、错误修正和持续推理。进展可能取决于发现远隔子领域之间隐藏的联系。

OpenAI 将近期进展归因于更强的长程推理和更系统的检查。长程推理意味着在多个相互依赖的步骤中维持连贯的方法。

该公司此前的科学论文将测试时计算视为另一项重要因素。模型可以在回答前探索替代方案并审阅自己的工作。

这种方法不同于立即生成一次回应。更多计算可以让系统生成候选路径、淘汰失败方案,并完善有希望的论证。

工具使用又增加了一层能力。模型可以调用符号系统、运行代码、检索参考资料,或将证明翻译为形式语言。

随后,Lean 会依据明确规则检查形式化论证。如果某一步失败,系统可以修订证明或识别遗漏的假设。

这种混合过程与数学的契合度异常高。许多陈述拥有精确的成功条件,论证中的部分内容可以进行机械测试。

然而,该仓库并未披露所有运行细节。读者无法获得全部 372 个系列的完整推理记录。

公众也无法访问生成这些结果的模型。独立团队不能在同一问题集上重新运行同一系统。

这种限制妨碍了对一致性的直接测量。模型可能能够可靠地解决某个问题,也可能是一项成功结果从大量失败尝试中偶然出现。

尝试统计数据提供了有用背景,但专家仍需要更细粒度的证据。他们需要知道问题是如何选择的,以及输出是如何筛选的。

对人类参与的描述也需要谨慎。人们可能会选择提示词、识别有希望的输出、清理符号,或在失败尝试后引导模型。

这些活动都不会使结果失效。但它们会影响有关自主性以及模型实际研究角色的主张。

“AI-generated”一词可以涵盖多种工作流。一项结果可能来自近乎自主的运行,另一项则可能依赖大量专家干预。

有用的评估应当区分生成、选择、验证、编辑和解读。将它们合并为一个标签,会掩盖劳动分工。

尽管如此,这一合集仍改变了预期。研究级数学不再只由少数经过精心策划的演示来代表。

OpenAI 已展示,一个内部系统能够生成足以形成自身审查瓶颈的大型语料库。这是一种运行能力,而不只是基准测试分数。

竞争对手如今面临展示相当深度、透明度或可访问性的压力。学术机构则面临为评估这些系统建设基础设施的压力。

开发者也应当关注。类似的智能体工作流可以面向形式化软件规范、算法设计和安全证明。

其局限性也会随之转移。当用户无法追溯假设、复现过程或明确错误责任时,生成结果依然具有危险性。

因此,企业买家应询问验证路径,而不只是推理主张。冗长的回答并不能证明过程正确或可问责。

知识工作者也面临类似启示。随着生成变得充裕,价值会转向筛选、来源追溯、验证和清晰解释。

数学发布使这种转变格外可见,因为正确性具有严格含义。其他专业领域通常缺少如此决定性的检查机制。

三个信号将显示此次发布是否重要

下一阶段取决于独立验证、可用的模型访问权限,以及论文能够催生更多由人类主导研究的证据。

第一个信号是覆盖全部 372 个系列的验证记录。研究者需要一份持续更新的记录,涵盖已接受结果、更正、撤回以及尚未解决的异议。

少数备受称道的成功案例无法代表整个合集。结果的分布比最强的单个案例更重要。

如果专家验证了许多彼此无关的结果,那么其具备广泛研究能力的证据会更有力。如果错误集中在未形式化的论文中,验证覆盖率将成为核心限制。

关注 OpenAI 扩展 Lean 目录的速度。也要关注外部数学家能否在不使用内部基础设施的情况下复现检查。

形式化验证无法回答所有问题。不过,经过检查的证明占比不断增长,能够缩小正确性争议,并将注意力转向新颖性。

第二个信号是对该模型或同等能力的访问权限。OpenAI 表示正努力实现负责任的发布,但尚未提供公开时间表。

有意义的访问权限将让数学家选择自己的问题,也会降低他们对实验室研究优先级和发表进度的依赖。

访问权限必须包含足够能力以支持持续实验。计算资源受限的接口,无法匹配已发布语料库背后的环境。

如果合格研究者能够复现结果并探索新方向,关于双层体系的担忧将会减弱。持续的排他性则会强化这些担忧。

第三个信号是下游数学应用。重要的证明应当引发新问题、简化早期理论,或提供被其他研究者采纳的方法。

仅凭引用无法解决这一问题。早期关注可能反映争议性、新颖性或 OpenAI 的名称,而非持久的科学价值。

应当关注研讨会、独立解读、后续论文和新应用。这些产出表明研究者理解并能够扩展这项工作。

OpenAI 承诺举办的研讨会将提供证据,但独立项目更具分量。社区主导的解读不应完全依赖公司赞助。

未来一到三个月的结果很可能并不均衡。有些论文家族会立刻受到审视,而高度专业化的论文可能要等更久,才能迎来具备相应资质的读者。

这种不均衡的节奏不应被误解为否定。跨越众多学科评审 722 篇手稿,本身就是一项规模可观的研究工程。

同样的谨慎也应适用于早期赞誉。一项引人注目的证明,无法验证每篇论文,也不能证明该模型像人类一样理解数学。

OpenAI 的数学研究已跨过一个重要的产出门槛,但尚未跨过同样重要的、获得广泛独立吸收与理解的门槛。

对读者而言,实际问题很简单:专家能否验证这些结果,解释其核心思想,并在此基础上构建新的数学?

关注公开的修正记录、模型访问政策,以及独立的后续研究。这些信号结合起来,将揭示这究竟是一次知识发布,还是一场手稿洪流。

答案的影响不止于数学。它将为所有这样的领域确立预期:在这些领域中,AI 系统生成技术性主张的速度,快于专家审阅它们的速度。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page