OpenAI 试图倾听时,仍在不断碾压数学家
尽管成立了一个由九人组成、旨在修复与数学家关系的顾问小组,OpenAI 仍在不断碾压数学家。该公司称,一款尚未发布的模型已经解决了 100 多个长期未解问题;但这一公告立刻让研究人员对究竟由谁掌控该小组感到困惑。
这种困惑很重要,因为数学与人工智能顾问小组(Advisory Group on Mathematics and Artificial Intelligence,简称 AGMAI)的职责,本应是协助评估和传播新兴 AI 成果。其成员坚称,该组织独立运作、无偿参与,并可自由批评 OpenAI。然而,OpenAI 对双方关系的呈现如此突出,以至于一些研究人员起初以为这个小组由该公司任命。
这一事件延续了一场在 OpenAI 宣布机器生成的 Navier-Stokes 存在性与光滑性问题解答后加剧的冲突。这一说法展现了该公司在数学领域的雄心规模。围绕署名、发表标准和人类理解的争议,则暴露出其运作方式与学术数学之间的严重不适配。
OpenAI 现在需要数学家来解读其系统产出的结果。数学家则需要获得访问权限、充足时间和可靠的信息披露,才能评估这些结果。新顾问小组正处于这些需求之间,但它拥有的是建议权,而非决策权。
OpenAI 的数学顾问小组一开始就面临身份问题
AGMAI 被设计为一座独立的桥梁,但 OpenAI 的发布方式让它看起来与这家它可能需要挑战的公司关系过于密切。
AGMAI 于 2026 年 9 月 21 日宣布成立。该小组由九名数学家组成,并由位于新泽西州普林斯顿的 Institute for Advanced Study 托管。
其首批成员包括 François Charles、Camillo De Lellis、Timothy Gowers、Martin Hairer、Nikhil Srivastava、Ulrike Tillmann、Ravi Vakil、Edward Witten 和 Melanie Matchett Wood。他们分别来自 Harvard、Stanford、Oxford、Cambridge、Berkeley、Imperial College London 和 EPFL 等机构。
根据其独立小组声明,AGMAI 可为 OpenAI 和其他前沿 AI 实验室提供建议。其职责包括审查新兴成果、协调沟通,以及为 AI 辅助数学研究制定标准。
该小组表示,它可以与任何 AI 实验室合作。AGMAI 成员、Fields Medal 获得者 Martin Hairer 向 The Verge 表示,与其他前沿实验室的对话已经开始,但他没有透露这些公司的名称。
Hairer 还强调,AGMAI 未获得 OpenAI 的任何资金或技术支持。除为提前接触未发表工作所必需的保密条款外,成员没有签署限制其公开评论的协议。
OpenAI 的公告中也包含类似保障。该公司表示,成员可以公布自己的建议、批评其影响,并提供 OpenAI 未曾征求的指导意见。它还表示,成员将继续无偿参与,并掌控小组成员资格。
这些条款确立了有意义的组织距离,但并未消除 AGMAI 诞生过程中的混乱情形。
OpenAI 最初曾接触一些数学家,讨论组建顾问委员会。这些数学家随后自行成立了一个独立组织,并招募了更多成员。双方均未公开指出哪些 AGMAI 成员曾收到最初的接洽。
随后,OpenAI 为该小组提供的曝光度,远超其自身发布渠道所能带来的程度。许多观察人士最初是通过该公司的公告,而非该小组声明或 Terence Tao 的数学博客,得知 AGMAI 的存在。
这一发布顺序促成了一种不准确但可预见的印象。由于 OpenAI 发起了这些对话并主导了公开呈现,AGMAI 看起来像是 OpenAI 的一个小组。
Hairer 形容公告发布后的几天令人沮丧且紧张。他向 The Verge 表示,相关措辞无助于该小组确立独立性。
时机也加剧了混乱。在成立后不久被问及 AGMAI 的计划时,Hairer 指出,该组织当时仅成立两天。面对即将涌来的需求,它尚未建立完善的运作框架。
这种困惑不只是品牌层面的不便。AGMAI 需要在本就不信任 OpenAI 发表实践的研究人员中建立信誉。每一句含糊的表述,都会让赢得这种信誉更加困难。
OpenAI 的顾问小组公告明确承认了数学家提出的担忧。然而,在独立审稿人尚未解释其范围或重要性之前,它也宣传了公司所宣称的成果。
这种混合姿态抓住了核心问题。OpenAI 希望获得外部判断,但也希望立即宣布其成就的规模。
OpenAI 为何持续碾压数学家
OpenAI 将已解决的问题视为模型能力的证据,而数学家则将证明视为需要语境、署名、审查和持久理解的学术贡献。
OpenAI 表示,它于 8 月 28 日开始训练最新的内部模型。到 9 月 21 日,该公司声称该模型已解决了横跨数学大多数领域的 100 多个长期未解问题。
该公司尚未公开发布这些问题的完整目录。因此,独立研究人员无法评估这一集合的整体难度、新颖性、正确性或重要性。
这个数字本身也难以解读。“未解问题”可能是一道令专家数十年来束手无策的著名难题;也可能是一条尚未解决的狭窄命题,其解答只是将既有方法连接起来,而未改变所属领域。
OpenAI 早期的工作表明,这一区别至关重要。在一份 1 月报告中,该公司称 GPT-5.2 为若干与 Paul Erdős 相关问题的解答作出了贡献。Terence Tao 验证了所列四个问题的工作,尽管该公司承认,Erdős 问题的难度差异很大。
同一份报告也为当前能力划出了有用边界。OpenAI 表示,其模型有时能够将已知方法组合成正确的论证;它也表示,创造全新的数学框架仍超出当前系统的能力范围。
这种区别很少能在标题中保留下来。模型利用已知技术解决一个冷门猜想,与模型创造数学的新分支,都可能被概括为“AI 解开未解数学难题”。
对学术研究人员而言,一项证明不能只达到形式上正确的终点。它还应将结果置于既有工作之中,指出背后的核心思路,承认相关贡献者,并帮助其他人据此继续研究。
OpenAI 的传播往往更强调终点。当未解问题被用作模型基准时,这种做法可以理解;但它与一个重视证明如何拓展集体理解的社群相冲突。
University of Connecticut 数学教授 Álvaro Lozano-Robledo 批评该公司关于拥有大量成果却不知如何发布的说法。他认为,学界通常不会在尚未确立成果重要性之前就宣传一批库存成果。
研究人员也反对就未解问题宣称取得“实质性进展”。在数学中,不完整的论证可能包含宝贵洞见,也可能因一个隐藏漏洞而彻底崩塌。
这种敏感并非吹毛求疵。数学证明的力量来自每一个逻辑步骤。一段看似有说服力的叙述无法替代有效的论证。
形式化验证提供了一种回应。Lean 等系统以软件可逐步检查的语言编码证明。这一过程能够发现隐藏在流畅、貌似合理的文字中的漏洞。
然而,形式上的正确性并不能解决所有学术问题。一项经机器检验的证明仍可能掩盖其核心洞见,也可能忽略相关文献,或以人类研究人员难以复用的形式呈现结果。
因此,挑战有两个层面。第一,是确定证明是否正确;第二,是判断它是否增进了数学知识,而非只是增加了一件经过验证的产物。
OpenAI 加快了产出结果的第一环节,但尚未证明周边的学术体系能够以同样速度处理其输出。
这种失衡解释了为何即便其技术主张被证明具有实质意义,OpenAI 仍在不断碾压数学家。该公司生成、资助、包装和宣传成果的速度,快过研究人员审视其含义的速度。
Navier-Stokes 争议耗尽了人们原本的善意判断
顾问小组进入的是一段已因抢先发表、署名、仓促发布和不透明修订等指控而受损的关系。
直接背景是 OpenAI 在 9 月关于 Navier-Stokes 存在性与光滑性问题的公告。Navier-Stokes 方程描述流体运动,而这道著名未解问题则询问某些三维解是否始终保持光滑。
该问题是 Clay Mathematics Institute 于 2000 年提出的 Millennium Prize Problems 之一。在最初七个问题中,此前只有 Poincaré conjecture 获得了被接受的解答。
OpenAI 表示,一个由 10,000 个智能体构成的系统在不到四天内产出了解答。这里的智能体,是指被分配去推进、评估或完善大型任务某一部分的模型实例。
即使撇开周边争议,该公司的主张依然意义重大。若该解答有效,将标志着 AI 参与研究级数学能力的一次重大转变。
然而,数学家 Tristan Buckmaster 和 Levent Alpöge 此前已就相关思路研究了大约一年。Buckmaster 指控 OpenAI 得知他们的进展后,抢先加速发表。
他还担忧,与 OpenAI 系统的互动可能泄露了其研究路径的信息。OpenAI 表示,在推进自身成果时,并未查看 Buckmaster 的输入内容。
相互矛盾的说法尚未得到独立裁定。因此,它们应被视为指控,而非既定事实。
OpenAI 表示,它是在听闻 Anthropic 已解决其中两个问题的传言后,开始瞄准 Millennium Prize Problems。据报道,该公司先是在这一系列问题上投入了大量计算资源,随后将重点集中于 Navier-Stokes。
这一来龙去脉令数学家感到担忧,因为它听上去像是 AI 实验室之间的竞赛,而非围绕学术需求组织的研究计划。一道著名难题带来了声望、可量化的难度,以及极具话题性的终点。
据报道,最终证明长达 166 页。研究人员随后不得不面对缓慢而艰巨的工作:评估论证、追溯其与早期方法的关系,并提炼出人类能够理解的思路。
一项证明的价值可以远远超出其最终定理。例如,在解决 Fermat’s Last Theorem 的过程中发展出的工具,影响了数论的其他领域和后来的应用。
一份冗长的机器生成证明也可能包含可复用的思路。但这些思路不会仅因最后几页得出正确结论就自动变得有用。专家必须找到、解释它们,并将其与既有知识联系起来。
这种劳动造成了一种不对称。AI 公司付费生成输出,并因其主张获得关注。随后,学术界却承担了大量无偿工作,以确定这些输出究竟意味着什么。
Navier-Stokes 争议之所以升级,是因为研究人员将这种不对称与署名争议联系起来看待。批评者看到的不只是一个令人印象深刻的证明。他们看到的是一家公司将社区知识和计算规模转化为宣传。
OpenAI 此前的发布已经引发担忧。研究人员告诉 The Verge,一些论文写作质量不佳,对相关文献的讨论也过于浅薄。
他们还称,OpenAI 在发布后修改了文档,却未清楚记录每一次修订。Hairer 将这种做法的某些方面形容为不严谨的学术实践。
对于 AI 生成的研究而言,透明的修订历史尤为重要。它能让读者区分原始主张与外部批评后作出的修正。
没有这类记录,审稿人就难以判断某个缺陷是否轻微、论证是否发生实质性变化,或者公开描述是否仍与最新版文档一致。
OpenAI 创建 AGMAI,部分原因正是为了避免再次出现此类失误。然而,该公司自己的公告又重现了这一模式:在该组织尚未形成工作流程之前,便宣传了超过 100 项声称取得的成果。
这正是其中的反转。原本旨在修复问题的举措,反而成了其本应修复的行为的又一次展示。
OpenAI 的“100 道问题”主张将负担转移给学界
超过 100 个声称已解决的问题积压,并不只是技术里程碑。它还是一条大学从未同意处理的审查队列。
同行评审本就依赖稀缺的专家注意力。前沿成果需要理解相关领域、文献以及证明中细微失效模式的专家。
OpenAI 的主张横跨数学的大多数领域。因此,对其进行评估需要多个学术社群,而不是由九位杰出研究人员组成的单一集中委员会。
AGMAI 可以帮助分流这些输出。它可以识别合适的审稿人、建议披露规范,并就某项成果是否值得获得广泛关注向 OpenAI 提供建议。
但它无法亲自验证每一份证明。九名成员也无法吸收一个以机器速度运行的工业系统所产生的全部解释性工作。
这造成了规模错配。OpenAI 可以同时运行数千个智能体。数学判断仍分散在人们之间,而他们还承担着教学、指导、发表和机构职责。
这些成果的体量还可能扭曲研究优先级。如果 OpenAI 宣布某个领域的成果,相关专家可能会感到必须暂停自己的工作,转而审查该公司的输出。
圣安德鲁斯大学数学教授 Colva Roney-Dougal 将尚待公布的消息形容为令人煎熬。她表示,研究人员面临不确定性:是加快论文进度、等待 OpenAI 披露信息,还是照常继续工作。
这种不确定性影响的不仅是资深教授,也包括研究生。一名学生可能花费数年围绕某个问题积累专业能力。一条模糊的企业暗示,可能突然给项目蒙上阴影,却又没有提供足够信息让其作出明智调整。
风险不只是 AI 解决了研究人员选择的问题。科学研究始终面临他人抢先发表的可能性。
不同之处在于规模、保密性和宣传的结合。OpenAI 可以私下推进许多目标,暗示取得了重大进展,并以一个全球知名品牌的名义发布精选成果。
公司外的研究人员无法知道哪些领域正面临迫在眉睫的竞争。他们也无法匹配可用的算力或传播能力。
由 25 位菲尔兹奖得主签署的数学公开信将这种激励结构形容为严重失调。信中认为,将开放问题用作 AI 基准可能损害数学及其社群。
这种担忧并非要求停止 AI 辅助研究。许多数学家已经使用模型进行文献检索、实验、形式化以及证明开发。
相反,这封信质疑的是将知名问题当作战利品的做法。这一目标奖励速度和可见度,而学术数学同样依赖署名、阐释、指导和累积性的理解。
AI 实验室有动力宣布最重大、最广为人知的成果。研究人员则有动力投入时间,核查该成果是否配得上这种描述。这些激励将工作推向相反方向。
OpenAI 表示,AGMAI 将帮助其在对外沟通前评估成果的重要性。如果公司始终遵循该组织的建议,这将是一项有意义的改进。
然而,AGMAI 在 OpenAI 内部没有决策权。公司仍对其发布什么、发布速度以及如何突出呈现每项主张负有责任。
OpenAI 还表示,该组织不会就其内部数学进展的节奏提供建议。这一边界保护了公司的研究自主权,却没有触及最大的压力来源。
输出可以继续加速。顾问团只能建议由此产生的浪潮该如何抵达岸边。
没有权力的独立性是核心权衡
AGMAI 只有挑战 OpenAI 才能提供可信度,而 OpenAI 可以接受这种可信度,却不必交出控制权。
该组织的独立性在若干实际层面是真实存在的。成员不领取报酬,可以发表自己的意见,也可以与竞争实验室合作。
这些条件使 AGMAI 有别于传统的企业顾问委员会。它们降低了 OpenAI 能够直接控制其成员构成或公开结论的风险。
不过,独立性仍不能保证影响力。OpenAI 可以征询该组织的意见,却不采纳其建议。它也可以决定成员接收哪些信息,以及何时接收。
保密的早期访问也带来另一种张力。如果审稿人被期望阻止误导性公告,他们就需要在发布前获得访问权限。但保密义务可能暂时限制他们向更广泛社群发出警示的能力。
因此,这一安排依赖于流程。AGMAI 需要关于回避、披露、发布、更正以及与参与实验室产生分歧的明确规则。
它还需要一种方式,将初步筛查与背书区分开来。如果 AGMAI 审阅了一篇论文,外界不应因此假定每位成员都核实了每一行内容,或认可 OpenAI 的公开表述方式。
OpenAI 的公告称,该组织将帮助评估重要性。重要性并不像证明是否通过检查器那样,是一种机械性质。
它取决于背景、新颖性、方法以及对某一领域的影响。即使合理的数学家都认同某项论证正确,他们仍可能对这些因素存在分歧。
AGMAI 必须精确传达这些区别。否则,它的名称可能沦为一种通用标识,被附加在只获得有限咨询的主张之上。
该组织在数学界还面临合法性问题。据报道,在 AGMAI 成立前,最初成员中只有一人签署了公开信,尽管 Hairer 后来将自己的名字加入了签署者名单。
这本身并不意味着成员构成缺乏代表性。然而,它凸显了为一家公司提供建议与代表广泛、去中心化研究社群之间的差距。
数学界没有一个能够授权 AGMAI 代表所有人发声的单一管理机构。该组织必须通过行动赢得信任,而非依靠成员名单的声望。
OpenAI 还需要避免将成员的声誉作为透明证据的替代品。顾问关系无法验证未披露的证明。
这正是怀疑论观点最有力之处。OpenAI 可能真心希望提升学术标准,同时也能从外部监督的表象中获益。
这两种说法可以同时成立。公司可以推进严肃的咨询流程,同时仍以有利于其公共叙事的方式呈现这一流程。
Hairer 似乎意识到了这一风险。他承认 AI 公司会尝试以有利方式呈现该组织的参与,同时坚持认为 AGMAI 仍能保护更广泛的数学社群。
这一安排值得获得一次发挥作用的机会。OpenAI 的能力进步如此迅速,以至于某种协调机制总好过一连串突如其来的公告。
不过,衡量成功的标准不能只是 OpenAI 是否避免了又一次尴尬新闻。它必须是研究人员是否获得足够的预先通知、文档和署名,以便在不承担不合理成本的情况下理解每项成果。
对开发者和企业 AI 采购者而言,这场争议提供了一个更广泛的评估启示。系统的输出不会仅仅因为通过正确性测试就自动变得有用。
组织必须保留生成工作背后的来源、修订、假设和人工决策。可检索的 AI knowledge base可以支持这类记录,但软件无法取代可追责的审查。
无论输出是证明、法律备忘录、市场分析还是生产代码,同一原则都适用。只有当验证和机构层面的理解能够跟上时,生成速度才有意义。
接下来会发生什么,将显示该组织是否真正重要
三个信号将决定 AGMAI 是否改变 OpenAI 的行为,还是仅仅帮助包装下一波主张。
第一个信号是 OpenAI 如何发布其声称积压的成果。该公司表示,其模型解决了超过 100 个开放问题,但研究人员仍缺乏完整清单。
可信的发布协议应按领域、难度、验证状态、新颖性以及对既有工作的依赖程度对结果进行分类。它还应避免将整个集合呈现为同等重要。
预先协调应让受影响领域的专家有时间审查论文并解决署名问题。不应演变成一次私下预览,随后又匆忙发布公告。
如果 OpenAI 以可管理的批次发布成果,并提供清晰文档,这将加强 AGMAI 具有实际影响力的论点。围绕总数量展开的突然宣传活动则会削弱这一论点。
第二个信号是公司如何处理更正。AI 辅助论文会像人类论文一样,包含错误、表述不清之处和不完整的引用。
关键问题是 OpenAI 是否会公开记录变更。每一次修订都应说明改了什么、为何修改,以及该更正是否改变核心主张。
这种做法将回应此前发布中最具体的一项批评。它也会让研究人员相信,他们审查的是一份稳定且可追溯的文档。
值得关注的是,AGMAI 是否会发布参与实验室可以遵循的标准。公开标准将使该组织的工作超越单一公司而更具价值,并让外界能够评判合规情况。
第三个信号是 AGMAI 如何回应分歧。一个独立组织并不会因为同意 OpenAI 而证明自身价值。
它独立性的最有力证据,将是公开反对夸大的表述、不充分的署名、过早发布,或缺乏支持的“重要性”主张。
这一检验不需要敌意。它需要在该组织的分析与公司的对外沟通之间,存在清晰可见的区分。
其他 AI 实验室同样将影响这一进程。Anthropic 已经成为研究级数学竞争格局的一部分。Google 以及专注于形式化数学的项目也在持续推进各自的方法。
如果 AGMAI 与多家实验室合作,它有望成为该领域的共享基础设施。如果其公共角色仍主要与 OpenAI 绑定,人们对其独立性的疑虑将持续存在。
在这些治理问题逐步明朗的过程中,底层能力不会消失。OpenAI 的模型已经为一些工作作出贡献,而专家数学家认为这些工作是严肃且有趣的。
核心不确定性在于,这家公司能否将这种能力转化为学术成果,而不压倒那些赋予结果意义的人类判断。
目前,OpenAI 仍在“碾压”数学家,因为它掌控着这项行动的速度、规模与宣传声量。AGMAI 可以在控制台旁提出建议,却无法接过方向盘。
读者应关注下一批证明,而不是下一项承诺。这些文件是否易读、标注了归属、经过独立评估,并附有透明的修订记录?
这些细节将揭示 OpenAI 是否改变了其研究做法。它们也将表明,AI 生成的数学将成为共享知识,还是只会成为一堆不断增加、等待人类修补的主张。
请保留有关公告、手稿、更正和外部回应的记录。将公司最初的描述与数周后专家得出的结论进行比较。两者之间的差距,而非标题数量,更能衡量这场令人不安的实验是否正在奏效。



