Terence Tao 对 AI 数学的警告:追逐答案正在伤害数学
Terence Tao 尽管欢迎 AI 日益增强的科研能力,却就 AI 数学发出了异常直率的警告。他担心的并非机器会解决重要问题,而是 AI 公司生成答案的速度,可能超过数学家验证、阐释、署名和吸收这些答案的速度。
Terence Tao 对 AI 数学的警告,出现在 OpenAI 于 9 月 8 日公布其声称解决纳维-斯托克斯方程存在性与光滑性问题之后。该问题是数学七大千禧年大奖难题之一。OpenAI 表示,其内部模型协调了约 10,000 个智能体,并在约 88 小时后完成了所提出的解决方案。
该结果尚未完成将一项候选证明转化为被接受的数学成果所需的传统流程。然而,它已成为 OpenAI、Anthropic 和 Google DeepMind 竞争中的一项佐证。这正是 Tao 批评的核心矛盾。
AI 实验室通过可见成果、著名难题、基准分数和模型能力演示来衡量进展。数学家所需的却是一种更缓慢的过程:审查、阐释性工作、署名、讨论,以及其他研究者能够复用的方法。
这并不是支持 AI 的人与拒绝 AI 的人之间的争论。Tao 在自己的工作中使用 AI,也预计它将成为研究数学的一部分。争议在于,这项技术被优化来产出什么。
如果 AI 在没有相应增加理解的情况下制造出大量证明,数学将面临新的瓶颈。稀缺资源不再是候选答案,而是判断该答案含义所需的人类注意力。
Terence Tao 对 AI 数学的警告源于一项声称具有历史意义的结果
OpenAI 的公告让人们对 AI 科研激励机制日益增长的担忧,变成了数学界面临的一项即时考验。
纳维-斯托克斯方程描述流体的运动,包括空气和水。这个开放问题探讨的是,平滑的三维流体运动是否必须始终保持平滑,还是可能在有限时间内形成奇点。奇点是指数学描述产生无界速度的点。
OpenAI 的纳维-斯托克斯主张称,其系统构建了一种会形成此类奇点的平滑流体构型。该公司发布了书面论证及其在 Lean 中的形式化版本。Lean 是一种证明助手,用于检查数学步骤是否遵循明确陈述的规则。
该公司称,研究人员在听到有关重大数学问题取得进展的传闻后,于 9 月 1 日开始工作。其多智能体系统将不同的问题表述分配给不同小组。随后,Codex 汇总有价值的中间发现,使后续小组能够在此基础上继续推进。
OpenAI 表示,参与的智能体在纳维-斯托克斯工作期间生成了 270 万条消息和约 1,300 亿个输出 token。据报道,GPT-6 Astra 又花费了 17 小时,才在 Lean 中将该结果形式化并完成验证。
这些数字说明了 Tao 为何认为节奏已经改变。人类研究团队无法在四天内生成、筛选并呈现如此规模的候选推理。当数千个智能体同时搜索时,发现速度的既有局限便不再适用。
然而,计算规模并不能决定该结果在数学上的地位。形式化验证可以表明,一个证明在指定的形式系统内成立。它并不能自动确认形式化陈述是否符合原问题的每一项条件。
它也无法判断该证明是否提出了有意义的新思想、是否依赖被忽视的既有工作,或是否配得上人们赋予它的历史意义。这些问题需要既理解形式论证、也熟悉其所属领域的专家来回答。
OpenAI 将这一结果表述为一项解答,并将其视为模型快速进步的证据。它还表示不会追求相关奖项。这个决定并不能消除独立审查的必要性。
一项重大的数学主张通常会经历研讨会、审稿报告、修正、替代表述以及持续的社区评审。这些过程可能持续数月或数年。它们常常会发现,证明需要修改、仅涵盖更狭窄的陈述,或依赖一项此前未获充分重视的结果。
因此,Tao 的警告并不以该证明是错误的为前提。事实上,如果结果正确,问题反而更加紧迫。一个在数日内生成的有效证明,仍可能比该领域能够负责任地消化它的速度快得多。
这一事件让讨论从 AI 能否为研究数学作出贡献,转向数学界应如何大规模处理机器生成的工作。这比赢得单一基准测试更具深层的制度性挑战。
证明数量激增创造了新的研究瓶颈
核心稀缺资源正从寻找证明,转向理解、审查和整合证明。
Tao 曾将数学问题求解描述为一条流程,而非一次单独的行为。一项结果必须被生成、验证、阐释、接受并纳入该领域。只有这样,其他人才能可靠地从中学习并加以使用。
传统数学将这些阶段彼此连接。研究者尝试解决难题时,通常会在寻找证明的过程中了解其结构。失败的方法揭示了边界,部分结果则创造出工具;即使最终目标仍未解决,这些工具也可能留存下来。
如果唯一想要的产出只是“是”或“否”的答案,这一过程确实低效。但若目标是更丰富地理解数学图景,它就极具生产力。
AI 将答案与旅程分离。大型模型可以探索数千条路径,舍弃其中大多数,最后交付一份打磨完成的论证。输出结果可能掩盖了哪些失败尝试重要,或是哪种概念联系使结果成为可能。
在一次AI 数学访谈中,Tao 将这种损失比作只看一部电影的开头和结尾。故事抵达了结局,但大量体验消失了。
他担忧的不是对缓慢计算的怀旧。数学家早已依赖计算、数值实验、符号软件、数据库和证明助手。自动化一再消除了常规劳动,却从未终结这个领域。
不同之处在于,规模与由声望驱动的选择结合在一起。AI 实验室有强烈动机瞄准那些能够产生易于理解新闻标题的著名问题。每一项成功结果也会成为模型拥有更广泛推理能力的证据。
这种激励将巨大的计算资源引向最终答案,却无法保证对阐释、历史研究、署名、教学或后续工作的投入同样充足。
Tao 的AI 时代论文描述了一种可能的转变:从证明稀缺走向证明泛滥。在这种条件下,既有的专业信号可能不再衡量社区真正看重的事物。
过去,一个著名难题被解决,意味着多年的洞见、技巧以及对一个领域的投入。当自动化系统能够并行搜索许多问题时,同样的信号可能更多地代表了一次大规模计算资源配置。
这是古德哈特定律的一种表现:当一种衡量指标成为目标时,它可能不再是有用的衡量指标。解决享有声望的问题是数学进步的一个代理指标,但并不等同于数学进步本身。
Terence Tao 对 AI 数学的警告提出了一个问题:实验室是否在优化这个代理指标,同时将昂贵的阐释性工作转移给大学和个体研究者?如果是这样,证明产出在增长,而审查体系几乎未变。
这种失衡会形成积压。每一篇机器生成的论文,都要与人类工作、教学、指导以及既有审稿义务争夺注意力。即使最终只有很小一部分具有价值,大量看似可信的证明也会消耗海量时间。
同样的动态也出现在软件安全和科学出版中。生成一项候选漏洞或假说或许成本很低;确认它、复现它并解释其实际重要性,仍然代价高昂。
对知识工作者而言,更广泛的教训并不陌生:更多产出并不会自动创造更多可用知识。挑战在于知识融合:新材料必须与可信的上下文建立联系,而非成为孤立的结果。
数学让这个问题格外明显,因为正确性通常可以被精确表述。即便如此,验证本身也无法取代阐释。
AI 实验室为能力优化,而数学为理解优化
主要冲突并非人类对抗机器,而是能力展示对抗更缓慢的共享理解形成过程。
OpenAI 有合理理由去攻克艰深的数学问题。数学提供了精确的问题、可检验的论证和漫长的推理链。经受住专家审查的结果,比模型自报的信心提供了更有力的证据。
该公司还认为,数学推理可以迁移到纯研究之外。能够维持连贯论证的系统,可以帮助科学家探索物理学、生物学、工程、材料和医学。因此,一项艰难的证明既是研究,也是模型评估。
有证据支持这种乐观看法。今年 5 月,OpenAI 报告称,其内部系统推翻了一项与 Erdős 单位距离问题有关、长期存在的猜想。外部数学家审查了这一论证,并称其对代数数论的运用既令人意外又意义重大。
这个较早的案例之所以重要,是因为人类研究者提供了配套解释,并将结果与相邻领域联系起来。该证明不只是改变了一个真伪答案;它揭示了不同领域之间的一种关系,数学家可以进一步研究。
Google DeepMind 提出了类似的协作模式。其科学发现工作强调由数学家引导模型、评估输出,并将结果发展为可用的研究成果。
这些例子表明,AI 对数学的影响并非天然具有攫取性。这些系统可以检验猜想、搜索文献、形式化论证,并提出意想不到的联系。它们也可以扩大人们参与大型协作项目的机会。
冲突出现在新闻标题式的结果成为主要产品之时。实验室可以宣布其模型在数日内解决了一道著名难题。数学界随后必须判断形式化陈述是否恰当,以及该证明是否增进了理解。
这种劳动分工造成了不对称的激励。实验室从公告中获得关注度。审稿人则得到更多无偿或回报微薄的工作,以及快速回应的压力。
Tao 曾用一个刻意带有强烈感官色彩的比喻来描述这种失衡:将原始解答比作留给一个社区去处理的未经处理的食物。他的观点是,生成和初步检查只是开始。
其制度性后果不止于工作量。著名未解难题有助于凝聚研究社群。研究生研究部分情形,研究人员发展专门技术,研讨会则围绕尚未攻克的障碍建立共同语言。
一个即时答案可能会在其周边思想成熟前,就终结这个核心问题。证明或许是正确的,但原本会围绕该问题发展的研究环境却会变得不那么肥沃。
这并不意味着数学家应当人为保留未解难题。它意味着实验室应当认识到,速度会改变发现发生的环境。
最有力的回应,是让模型开发与完整的研究流程保持一致。实验室可以资助独立验证、发布中间推理过程、记录相关文献,并在提出广泛主张前支持配套的解释性工作。
它们还可以奖励能够识别有用引理、梳理失败路径或生成易于理解的简化方案的模型。这些产出不如解决一个千禧年大奖难题那样引人注目,却更贴合知识推进的实际方式。
这正是 Terence Tao 对 AI 的担忧不同于泛泛自动化恐惧之处。Tao 并非在捍卫人类对答案的排他性所有权。他质疑的是,周边体系是否保留了那些让答案值得被发现的价值。
速度引发关于署名、审查与研究文化的问题
AI 系统生成结果的速度越快,机构就越必须谨慎保护署名归属与独立审查。
Navier-Stokes 公告发布时,正值围绕同期研究的一场争议。OpenAI 表示,有关纽约大学数学家 Tristan Buckmaster 和 Anthropic 研究员 Levent Alpöge 研究工作的传闻,促使其启动了相关工作。
据 OpenAI 称,其系统在生成证明之前并未接触到他们的私人工作。OpenAI 此后调查了先前用户交互是否可能影响模型,并更新了其说明。
Buckmaster 公开质疑了相关流程的若干方面,包括 OpenAI 处理作者身份和署名归属的方式。OpenAI 研究员 Sébastien Bubeck 对这一说法提出了异议。即使两份相互竞争的证明在技术上并不相同,这场分歧仍具有现实意义。
AI 研究使优先权问题变得复杂,因为模型可能吸收广泛的公开文献、私密用户输入、研究人员提示词以及机器生成的中间工作。每种来源都可能以不同方式促成最终结果。
传统引文实践是围绕人类作者设计的,他们能够说明自己阅读了什么,以及一个想法如何发展而来。大型多智能体系统让这种追溯变得更困难。数百万条消息无法像数学家的笔记本那样被解读。
OpenAI 表示,其 Navier-Stokes 智能体可以访问互联网的缓存版本。它还表示,内部模型是在一个经过预训练的模型基础上,通过大规模强化学习训练而成。这些事实并不能证明存在不当使用,但它们说明了为何溯源需要审慎记录。
AI 生成的证明可以独立重构一项已知技术。它也可能综合多种线索,而这些线索的影响会变得难以追踪。没有透明记录,外部研究人员很难区分这两种情况。
风险还会波及学生和职业生涯早期的数学家。他们往往通过攻克大型问题中较易切入的部分来培养专业能力。如果工业系统迅速收割最受关注的目标,年轻研究人员就需要不同的路径来建立声誉和技能。
25 位菲尔兹奖得主组成的团体认为,这些激励机制与数学目标严重错位。他们的联合警告聚焦于理解、署名归属、教育以及思想的人际传承。
不过,怀疑论的论证也需要有边界。一场高调争议并不能证明每一家 AI 实验室都会忽视解释。它也无法证明机器生成的证明必然会损害研究文化。
形式化验证相比发布未经核验的文字,确实提供了改进。公开论文和证明文件让专家能够审查这些主张。竞争也可能促使实验室披露原本会保持私密的能力。
悬而未决的问题是,这些保障措施能否随产出规模同步扩展。审读十份正确证明所需的解释工作多于一份。数千份看似合理的证明,甚至可能压垮一个组织良好的国际社群。
另一个不确定性涉及模型实际的自主性。OpenAI 将一套内部模型描述为能力显著强于 GPT-6 Astra。外部研究人员无法独立评估该系统、其成功率,或塑造其搜索过程的人类决策。
一项惊人的成果并不能揭示同一流程失败的频率。它也无法说明该方法能否跨数学领域泛化。选择性发布可能会让能力看起来比实际更加稳定。
因此,适当的回应既不是一概否定,也不是立即接受。所声称的证明应接受技术审查,而其生产过程则应接受制度审查。
正确性回答的是论证是否成立。治理回答的是相关实践是否公平分配了功劳、责任与劳动。数学如今两者都需要。
这场辩论关乎人类为何从事数学
Tao 更深层的挑战,是在人们通过自动化系统的产出重新定义数学工作之前,界定数学工作的目的。
如果数学的存在只是为了产出正确命题,那么一个更快生成更多命题的系统看起来无疑是有益的。在这种定义下,人类对过程的偏好显得次要。
从事数学工作的数学家通常会描述一种更广泛的目的。他们寻求解释、可复用的方法、令人惊讶的联系、好问题、优雅的结构,以及能够传递这些思想的社群。
一份证明之所以重要,部分原因在于它改变了人们所能看见的东西。最强的证明能够压缩复杂性,并揭示某个主张为何必然为真。它们让其他研究人员能将其底层思想应用于别处。
这一标准解释了,为什么同一定理的两份证明可能具有不同价值。一份可能简短却晦涩。另一份则可能创造出重塑整个领域的方法。
AI 系统可以促成任一种结果。它们可能产出晦涩但正确的形式化对象,也可能发现一座清晰的概念桥梁。开发者选择的目标,将影响哪种结果变得常见。
Tao 的框架将 AI 能力视为一个工作假设,而非辩论的核心。假设机器很快承担具有实质意义的一部分研究级任务,那么紧迫的问题就变成:这些工具应服务于哪些人类目标。
这种框架避免了围绕某个特定模型是否真正智能的无效争论。即便当前系统仍表现不均,数学界也必须为更高产出做好准备。
它也拒绝了保留人类角色应成为唯一目标的观点。历史上的工具曾反复改变数学家的工作方式。计算器减少了手工算术,而计算机则使此前不可能规模的实验成为可能。
这一职业得以延续,是因为它转向了不同的问题。研究人员更加重视问题表述、抽象、诠释与联系。AI 将进一步推动这一转变。
然而,适应需要机构奖励这些剩余工作。期刊、大学和实验室目前将声望赋予首个成果和以人命名的定理。它们对验证、阐释、数据集构建和形式化给予的认可较少。
在证明大量涌现的情况下,这种奖励结构会变得不稳定。如果生成变得廉价,筛选与解释的价值就会上升。职业体系必须反映这一变化。
同行评审也需要新的基础设施。当这些材料影响一项主张时,审稿人应能获得形式化工件、提示词历史、模型版本和溯源记录。出版物应区分机器生成与人类验证、诠释。
该领域也可能需要分阶段披露。实验室可以通知领域专家、资助独立审查,并在将结果作为定论呈现前准备解释材料。这会放缓宣传节奏,但不会阻碍发现。
教育面临类似选择。向学生即时提供答案可能削弱富有成效的挣扎,但完全不使用 AI 又会让他们缺乏准备。课程需要设置评估问题形成、批判和解释能力的作业。
这一变化将辩论延伸至每一种知识密集型职业。软件工程师、科学家、律师和分析师同样面对这样的系统:它们生成润色完善的答案,比组织审查它们的速度更快。
因此,AI 对数学的影响提供了一个普遍问题的早期视角。当生产变得充裕,判断就成为昂贵的一层。忽视这一层的组织会积累令人印象深刻的产出,以及不确定的知识。
Tao 的警告归根结底是建设性的。它要求数学界清晰阐明自身价值观,以便 AI 系统能够朝向这些价值观被引导。没有这项工作,商业基准将填补这一真空。
三个信号将显示 AI 数学能否走向成熟
下一阶段将取决于独立验证、更好的研究实践,以及模型创造理解而非仅仅制造新闻的证据。
第一个信号是 OpenAI 的 Navier-Stokes 证明将如何被接受。专家必须确定该论证是否符合官方题目、其 Lean 形式化是否涵盖每项必要条件,以及是否需要修正。
成功的独立审查将加强这样一种观点:多智能体系统能够在数学最高层级产出成果。它不会化解 Tao 的制度性批评,却会让这一批评更加紧迫。
重大缺陷将削弱关于当前能力的主张。它也会表明,在正常审查流程尚未走完前宣布结论所蕴含的危险。
第二个信号是 AI 实验室如何处理下一批数学成果。读者应关注是否有早期专家参与、清晰的署名归属、易于获取的解释,以及对系统搜索过程的披露。
配套论文尤其重要。一份原始证明可以终结一个问题,而强有力的配套分析则能够识别新方法,并将其与现有文献联系起来。
实验室还应报告失败率和筛选标准。知道一项结果成功,对整体评估说明甚少。研究人员需要了解尝试了多少问题,以及每次尝试获得了多少人类指导。
第三个信号是数学机构是否改变其激励机制。期刊和会议可以为 AI 生成工作、溯源、作者身份、形式化验证和审稿人访问权制定更清晰的政策。
大学可以对阐释、验证以及共享数学资源的维护给予更多认可。资助机构可以支持消化机器生成结果所需的人类工作。
这些改革将强化 Tao 的观点:证明的充裕需要新的制度。若缺少这些改革,工业生产与学术吸收之间的鸿沟将不断扩大。
最有价值的 AI 系统,不会只是抢在竞争对手之前解决那些备受瞩目的难题。它们还将帮助人们发现有前景的问题、检验研究路径、暴露错误,并理解一项结果为何重要。
这一标准并不会削弱技术成就的意义。围绕艰难的数学目标协调数千个智能体,是一项重要的工程进展。产出一份有效证明,则将成为重大的科学事件。
然而,速度本身无法定义进步。一个结果只有在人们能够审查、解释、建立关联并加以教学时,才会真正成为数学的一部分。
Terence Tao 对 AI 数学的警告,正是将这一区别置于 AI 研究竞赛的核心。未来几个月将揭示,各实验室究竟会把数学理解视为核心产出,还是视为一项需要事后补做的外部清理工作。
开发者、研究人员和知识工作者也应当就自身的 AI 工作流提出同样的问题:这些系统是在产出更多材料,还是在帮助人们建立更可靠的理解?
这一区别将决定,证明数量的激增究竟会拓展人类知识,还是只会扩大等待审查的队列。



