OpenAI 数学论文涌入学界,数学家正在反弹
OpenAI 于 10 月 6 日发布了 700 多篇数学论文,在提出其迄今规模最大的 AI 生成研究主张之际,也引发了一场验证危机。
这些 OpenAI 数学论文涵盖数论、几何、拓扑、计算机科学及其他领域的数百项相关成果。它们来自一款尚未发布的内部模型,该模型接受了约 4,000 个开放问题的测试。
OpenAI 将这批论文定位为对人类知识的贡献。许多数学家却认为,这是一家私人实验室将巨大的审稿负担转嫁给公共研究社群。
这一冲突比论文数量本身更重要。研究人员如今必须判断哪些论证正确,哪些成果具有原创性,以及哪些论文值得关注。他们还必须在保护自身项目、学生和职业发展的同时完成这项工作。
这次发布也发生在 AI 生成数学尚存未解争议之际。此前 OpenAI 的公告已引发了关于署名、未发表的人类研究成果,以及“产出证明”与“创造理解”之间差异的疑问。
数学社区博客 Proofs and Prompts 在数日内收集了 100 多条反应。这些回应从兴奋到悲伤、愤怒和职业焦虑,不一而足。
核心分歧并不只是人类与机器之间的对立,而是 OpenAI 的高产量成果生成模式,与数学作为一个更缓慢的解释、批评、教学和共同所有过程之间的冲突。
OpenAI 数学论文先于其审查体系到来
OpenAI 并未发布一项供专家审阅的著名证明,而是一次性抛出了整套研究议程。
该公司最初发布了 722 篇论文,归入 372 个成果家族。一个家族可以包含主要成果、配套论证、推论和替代证明。
目前的公开代码库列出同样 372 个家族中的 719 篇论文。这一变化表明,该合集已经在修订之中。
OpenAI 表示,这些论文及配套材料由一款尚未发布的内部前沿模型生成。该公司是在既有数学测试对模型而言变得过于简单后,对其进行评估的。
评估期间提出了约 4,000 道问题。OpenAI 表示,平均每项成果消耗的计算能力相当于 ChatGPT Pro 三小时的推理。
这些数字展现了非同寻常的产出能力,但并不能证明每篇论文都正确、新颖、可读或重要。
OpenAI 明确承认,该合集中的工作处于不同验证阶段。它还警告称,一些尚未形式化的成果可能包含问题。
形式化是将论证转换为证明检查软件可逐行验证的语言。OpenAI 为此使用了 Lean,这是一种专为该目的设计的编程语言和证明助手。
根据代码库信息,其约 42% 的顶层成果已完成形式化。这一比例相当可观,但也意味着大多数核心成果仍不属于这一验证类别。
即便 Lean 检查成功,也只能回答研究问题的一部分。前提是定义和形式化陈述准确捕捉了预期定理,它可以验证编码后的逻辑论证。
它并不能自动确立新颖性、重要性、恰当署名或有用的阐释。这些判断仍依赖于人类对文献的了解。
代码库还包含十份简化推理摘要,涵盖涉及圆周率无理性指数和矩阵乘法等主题的精选成果。
十份摘要无法为数百个成果家族提供智识地图。研究人员仍需面对一份陌生的目录,其中不同专业领域的成果重要性差异极大。
在其发布声明中,OpenAI 表示希望这项工作能推进人类知识。它还承诺提供修订流程、引用说明和进一步形式化。
该公司表示,未来发布内容将改善引用、阐释和呈现方式。这一承诺隐含承认了当前材料包的不足。
OpenAI 还咨询了普林斯顿高等研究院的独立顾问小组。然而,这种咨询并未阻止研究人员将发布过程形容为令人难以承受。
这一规模立即制造了核心张力。模型生成候选成果的速度,可以快于相关专家阅读、置于语境并加以解释的速度。
因此,发布只是第一步。尚未解决的问题是谁必须为后续的一切付出代价。
验证负担已转移给数学家
这次发布使专家注意力成为稀缺资源,而 OpenAI 仍掌控着创造供给的模型。
一篇传统论文会进入由可识别作者、学科社群、研讨会和同行评审构成的体系。这些机制并不完美,但它们分担了责任。
作者通常会解释方法、回应异议、修订含糊段落,并在知情受众面前捍卫主张。读者可以追问某个引理为何重要,或一个想法如何产生。
OpenAI 数学论文打破了这种关系。署名作者实际上是公司,而模型仍不向外部研究人员开放。
发现晦涩论证的数学家无法向生成它的系统提问。OpenAI 员工或许可以提供澄清,但他们无法重建每一条内部推理路径。
这一问题在大规模情况下更加严重。一篇困难论文可能需要数周甚至数月的专注阅读,即便它由人类专家撰写也是如此。
数百篇论文在验证开始前就制造了筛选难题。研究人员必须决定哪些主张足够可信,值得投入有限的时间。
有些论文涉及塑造了整个职业生涯的问题。当资助申请、博士论文和未来发表成果都依赖某项结论时,专家无法简单忽视一项声称的解决方案。
这造成了不对称激励。某项成果经得起审查时,OpenAI 可以受益;而独立研究人员则承担了发现错误的大部分成本。
Enrico Fatighenti 认为,一篇写得糟糕的人类投稿可能会很快被拒绝。相比之下,AI 生成的工作可能会迫使专家重建其含义,因为人们相信模型具备能力。
Tristan Humbert 描述了自己遇到一份他认为无法阅读的材料,该材料涉及其博士论文核心问题。他还不得不重新考虑博士后的研究计划。
这些反应揭示了自动化研究的一个现实后果。论文生成变得廉价,并不意味着验证无需成本。
瓶颈从产出文本转向建立信任。这一转变已经出现在软件领域:生成代码比审查、保障安全和维护代码更容易。
数学提出了更高的标准。一篇论文必须将形式化结果与现有理论、相关引用和可理解的思路链条连接起来。
OpenAI 表示将记录修订并保留早期版本。这对可审计性很有价值,尤其是在论文消失或发生变化时。
版本历史无法替代可问责的学术互动。研究人员仍需要有人能够回答有关意图、依赖关系和相关工作的详细问题。
这些社区回应显示,这种负担分配并不均衡。最接近某项声称成果的专家,感受到最大的调查压力。
他们获得的回报仍不确定。确认 OpenAI 的工作可能强化该公司的主张,而纠正它所获得的认可,可能少于最初的公告。
还存在选择问题。专家可能优先审查轰动性的主张,而较为低调但有效的成果则鲜少受到关注。
因此,该合集可能同时包含重要数学成果和长期未被检查的错误。数量使这两种结果更难区分。
这就是为什么论文数量是衡量科学进步的薄弱指标。可用的成果需要验证、语境、解释,以及能够承接它的社群。
证明的丰裕正在与数学理解相撞
OpenAI 创造了证明的丰裕,但数学家正在追问:丰裕会产生知识,还是只会制造更多待处理的对象。
一些回应将这次发布视为能力真正转变的证据。Roman Sauer 认出自己开发的一项技术出现在两个截然不同问题的解答中。
他称这些应用极具创造性,并表示自己深受震撼。这一反应反驳了将这些论文简单视为自动化模仿的说法。
据报道,Ben Green 发现了一些成果触及一项重大研究资助背后的大部分议程。他将该合集的某些方面形容为令人震惊。
Alvaro Lozano-Robledo 强调了模型朝黎曼猜想取得的进展,同时保留了一个重要区别。准黎曼结果将具有重要意义,但不会解决原始猜想。
这一区别在整份目录中都很重要。一篇论文可能解决特殊情形、改进界限,或建立条件定理,而并未解决那个著名的母问题。
新闻标题可能会将这些差异压缩为“解决开放问题”这一说法。研究人员不能这样做。
最积极的解读是,AI 现在可以以个人学者无法达到的规模搜索数学可能性。它可以测试路径、组合技术,并跨专业领域生成候选论证。
这种能力或许能帮助数学家发现原本不会看到的联系,也可能让被忽视的问题接触到新方法。
Danny Calegari 讲述了值得庆祝人类与 AI 协作的理由。在一个项目中,Anthropic 的 Claude 为一段带有音乐配乐的数学动画编写了代码。
Constantin Kogler 表达了与先进模型合作、随时接触新想法的兴奋。对于能够使用这些模型的研究人员而言,这种体验可能像是拥有了一个扩展的创作环境。
怀疑论的解读始于生成结束之处。Stephen Wolfram 指出,产出大量定理并不能确定人们会重视其中哪些。
数学的重要性部分取决于品味。研究人员选择问题,是因为答案能够阐明结构、连接领域,或创造富有成效的新问题。
一款针对解决现有猜想进行优化的模型,继承的是由人类创造的研究议程。因此,它的成功可以衡量搜索能力,却不能证明其拥有独立的数学判断力。
Johannes Schmitt 提出了相关解读。OpenAI 使用开放问题,主要可能是因为更简单的评估已无法检验其前沿模型。
按照这一观点,这些论文首先是模型开发的产出,然后才是对学术社群的贡献。这两类活动的激励机制并不相同。
实验室希望拥有高难度基准、可衡量的进展,以及通用推理能力的证据。数学家则希望得到同行能够审阅、讲授并进一步拓展的解释。
结果可能在技术上令人印象深刻,却无法支撑这些社会功能。这正是 OpenAI 数学论文背后更深层的冲突。
据报道,陶哲轩看到了其中一些巧妙思路;研究人员消化后,它们可能会结出成果。但他也对缺少能够展示和讲授这些工作的人员感到沮丧。
Ian Agol 将这一挑战比作学界对格里戈里·佩雷尔曼关于庞加莱猜想工作的回应。团队花了多年时间扩展并澄清佩雷尔曼简练的论文。
这种历史类比也有局限。佩雷尔曼是一位拥有连贯智识规划的人类作者,而不是一个能产出数百篇论文的系统。
不过,它说明发表与共同理解从来不是一回事。AI 通过改变规模,进一步拉大了两者之间的距离。
问题已不再是模型能否产出看起来严肃的数学成果。更紧迫的问题是,机构能否将其输出转化为持久的知识。
反弹关乎职业、署名与控制权
许多数学家并不反对自动化本身。他们反对的是一种可能重塑职业路径、却不分享决策权的发布模式。
Hugo Duminil-Copin 写道,他预计机器终将在人类研究者的某些方面实现超越。但他没有想到,如此多重大问题会在一次发布中同时出现。
他的反应捕捉到了这一事件中的情绪不对称:实验室将此次发布视为一次展示,而研究人员则将其视为生活被突然改变。
Matt Zaremsky 将多年来谨慎推进的研究比作考古发掘。在他的比喻中,一家富有的公司到来,使用炸药,交付了骨架,然后离开。
抱怨并非完整骨架没有价值,而是这一过程抹去了那种缓慢发现的历程——正是它赋予工作职业与智识意义。
Tasmin Chu 作出了类似区分:知道一个命题是否为真,与拥有亲自思考这一问题的时间,是两回事。
对许多研究者而言,这种思考并非附带劳动,而是吸引他们投身数学的活动本身。
博士生面临的是更尖锐版本的冲突。他们的资历取决于能否在有限时间内产出原创工作。
一篇 AI 生成的论文可能毫无预警地抵达同一个问题。即使其中的论断是错误的,也可能迫使学生改变投入方向,直到专家厘清问题。
博士后招聘进一步加剧了不确定性。申请者必须说明未来的研究计划,但一个大型私有模型可能突然在其拟议研究议程的多个方向发布论断。
资深研究者拥有声誉与人脉,能帮助他们适应变化。职业早期数学家受到的保护更少,且可能在新成果得到验证前就被评价。
署名形成了另一条分界线。这些论文借鉴了已发表的数学成果、既有猜想,以及数十年人类研究发展出的技术。
OpenAI 提供了引文信息,但恰当的归属远不只是生成一份参考文献。专家必须判定哪些思路确属新颖,哪些只是对已知论证的重新包装。
此前关于 Navier-Stokes 的争议加剧了这一担忧。研究人员指称 OpenAI 的工作与未发表的人类研究存在交集,并引发了优先权问题。
当前发布并不能证明个别论文存在不当行为。但它解释了为何数学家带着有限的信任审视这份目录。
Henry Wilton 批评其中没有具名的人类作者,也没有详细的失败率信息。对他而言,这种呈现方式暗示数学不再被视为一项人类事业。
OpenAI 确实披露,约有 4,000 个问题被尝试解决。它还说明了论文如何被汇总为结果族。
但这些数字仍留下重要疑问。读者难以重建选择标准、失败路径、被丢弃的输出,或发布背后的人类决策。
这种不透明性影响了应如何解读成功。一个模型从数千次尝试中产出数百项有前景的结果固然令人印象深刻,但这一比例本身说明不了太多。
研究人员需要知道问题如何被选定、输出如何被筛选。他们还需要对正确性和原创性进行独立检验。
最尖锐的批评关乎研究议程的控制权。Martin Bridson 警告,不应让 AI 实验室决定哪些结果值得共同体关注。
这并非理论风险。研究人员已经在重新分配时间,用于阅读、核查和解释私下生成的成果。
这些关注可能挤占那些因智识、教育或社会价值而被选择的问题。它也可能奖励那些拥有模型最能高效攻克的基准的领域。
OpenAI 表示,计划资助围绕理解重大 AI 生成结果的研讨会、会议和专项项目。这类支持或可减轻一部分负担。
但资助也强化了公司对回应方式的影响力。同一机构既产出论文、控制模型,也为解读这些论文的工作提供资金。
根本问题在于治理:谁来选择问题、验证论断、分配署名,并决定何时一项结果已准备好进入公众视野?
若没有共享控制权,证明的丰裕可能演变为依赖。数学家获得了输出,却失去了对塑造其领域条件的影响力。
在此次发布成为数学转折点之前,必须发生什么
三项信号将决定,这批论文会成为持久的研究成果,还是一场庞大而不稳定的展示。
第一项信号是独立验证。专家必须在不完全依赖 OpenAI 内部评估的情况下,确认具有代表性的头条结果。
Lean 形式化可以支持这一过程。不过,审稿人还必须确认形式化陈述是否对应于读者认为已被确立的数学主张。
OpenAI 应继续发布形式化工件和修正记录。外部团队则应使用透明配置与有文档记录的依赖项复现核查。
撤回或修订数篇论文并不会否定整个集合。科学工作会在审查过程中发生变化。
但若修正率很高,将削弱关于自主研究可靠性的主张;若在不同领域中维持低修正率,则会显著增强这种主张。
第二项信号是数学家能否继承这些思路。这意味着举办报告、撰写更清晰的阐释、识别可复用技术,并产出后续研究。
一项无人能够解释的正确证明,仍然难以融入一门活着的学科。它或许能解决一个命题,却未必能催生富有成效的研究计划。
Proofs and Prompts 提供了这一消化过程的早期记录。其汇集的反应包括技术层面的兴奋、针对特定问题的批评,以及对职业后果的反思。
反应概览也表明,公共报道应避免将回应简化为恐惧。研究人员对于工作的质量与意义都存在分歧。
应关注围绕特定结果族展开的研讨会和独立综述论文。这些产出将表明,共同体能够将论文转化为共享的理解。
若缺乏此类工作,则可能意味着产出已超越吸收能力。这些论文或许仍具技术趣味,却与学术文化脱节。
第三项信号是 OpenAI 的模型发布政策。该公司表示,正致力于以负责任的方式发布生成这些结果的系统。
获得访问权限将让研究人员能够测试新问题、检查失败模式,并比较协作式使用与自主批量生成。
受限访问则会延续当前的不平衡。OpenAI 将继续作为主要生产者,而大学和独立研究人员则成为下游审阅者。
一个可用的发布还必须包含足够的方法细节,以支持有意义的评估。仅有品牌化界面无法提供科学可复现性。
竞争将在这里发挥作用。Anthropic、Google DeepMind 和专注于定理证明的项目也在开发面向高等数学的系统。
不同的发布模式可能迫使 OpenAI 提供更好的访问方式、更强的来源追溯能力,或更具问责性的发表实践。它们也可能加剧产出规模的问题。
外部分析将数学与软件开发作比较:在软件领域,AI 很快从辅助走向自主生产。
这一比较颇有启发,但数学上的成功不能仅以产出衡量。定理没有相当于在生产环境运行程序的部署测试。
其价值通过证明核查、解释、引用、教学与进一步发现逐步形成。即使论证正确,这些过程也需要时间。
因此,读者应避免两个过早结论。此次发布并未证明数百个著名问题已被确定无疑地解决。
但也不能仅因数学家不喜欢其呈现方式,就将它斥为毫无意义的文本。一些专家已识别出看似真正重要的结果和技术。
OpenAI 的数学论文既是一次自动化研究发表的实验,也是一次数学推理的实验。模型生成了论文,但机构必须决定接下来会发生什么。
对开发者和知识工作者而言,这一教训超越数学:低成本生成使审查、来源追溯和情境判断变得更有价值,而非更不重要。
对大学而言,当务之急是在建立独立验证能力的同时保护职业早期研究者。等到每项主张都尘埃落定,学生将持续暴露于风险之中。
对 OpenAI 而言,标准如今已高于再产出一份目录。它必须证明,研究人员可以审阅、质疑、理解并在这些工作基础上继续建设,而不会沦为无偿保管员。
未来几个月应回答一个具体问题:这些论文会创造新的探究共同体,还是会让专家们忙于整理一条输出队列?
这一答案将界定,10 月 6 日究竟标志着一种新的数学协作形式,还是一场注意力危机的开始。



