top of page

ICM 数学家挑战 2026 年 AI 替代论

8月11日
讀畢需時 13 分鐘

Kai Williams 在 ICM 2026 期间采访了 20 多位数学家,他们的回答让 Techmeme 2026 关于 AI 取代专家的叙事变得更加复杂。

一些研究人员已在使用 AI 搜索陌生文献、测试示例、审阅草稿,以及填补证明中的缺口。但大多数人仍不愿将这些系统视为独立的数学同行。

最尖锐的分歧在于下一步会发生什么。一方预计,AI 将接管技术性工作,而人类负责选择问题与发展理论。另一方则认为,随着模型进步,这条边界终将消失。

这场争论的重要性不止于数学。数学证明为检验机器推理提供了格外清晰的测试,因为结论有时可以被精确验证。这个领域正成为理解 AI 如何改变专家工作方式的早期实验室。

ICM 访谈揭示了一个正在转型的职业群体

数学家已不再争论 AI 是否会影响自己的职业。他们争论的是,职业中的哪些部分仍将保持鲜明的人类属性。

Williams 参加了在费城举办的国际数学家大会,会议时间为 7 月 23 日至 7 月 30 日。大会官方页面显示,举办地点为 Pennsylvania Convention Center。

该大会每四年举行一次,汇聚数学各分支领域的顶尖研究人员。其议程包括重要奖项、研究讲座、公开演讲,以及关于数学职业未来的讨论。

Williams 于 8 月 4 日发布了他的 20 位数学家访谈。呈现出的图景比“自动化胜利”的故事或对传统学术工作的辩护都更为细腻。

开篇的例子恰好捕捉了这种张力。Jacob Tsimerman 在 7 月 23 日的新闻发布会上宣布,他将加入 OpenAI 的安全团队。就在此前,他刚刚获得 Fields Medal。

Tsimerman 告诉 Williams,他预计 AI 在专业数学家当前从事的工作上将变得“稳健地超越人类”。他还表示,希望借由自己新获得的关注度,引导更多注意力投向 AI 安全。

这一观点来自站在该职业最高层级的人,而非外部预测者。这使得数学界更难忽视大范围自动化的可能性。

不过,这些访谈并未显示数学家即将过时这一观点已形成共识。Williams 发现,许多参与者仍对自己的工作保持乐观,尤其是在短期内。

一些人已经从 AI 获得了实际帮助。他们举出的例子,比公众想象中一个无需人类引导、独自发现完整理论的自主系统要狭窄得多。

研究人员描述了如何使用模型定位相关论文、解释陌生技术、构建专门示例,以及审视更大论证中的局部环节。这些应用加快了项目进展,但项目目标仍由人类定义。

这种区别改变了人们应如何解读 Techmeme 2026 的相关叙事。眼下的变化并非全面替代,而是实用系统进入严肃研究工作流。

这一变化依然意义重大。能够将数天文献探索压缩为一个聚焦起点的工具,会改变研究人员能够探究哪些问题。

它也可能降低在不同数学专长之间转换的成本。现代数学包含许多深奥的子领域,其术语和方法很难被领域外人士掌握。

能够帮助研究人员跨越这些边界的模型,可以提升广泛好奇心的价值。它能够将一个领域的问题,与别处发展出的技术联系起来。

Williams 报道称,文献发现是受访者提及最多的应用。这种模式更像高级研究助理,而非自主定理工厂。

其他用途则更接近数学产出。Alonso Castillo-Ramirez 表示,ChatGPT 构建了一个具备其研究所需性质的细胞自动机。

他说,单靠常规编程很难找到这样的例子。不过,它仍只是一个由人构想和主导的大型项目中的组成部分。

研究生 Vasiliy Neckrasov 描述了如何使用 AI 进行文献检索、草稿审阅、补全证明及其他数学任务。在让模型追查细节之前,他会先形成对项目整体的理解。

这种工作流将人类判断置于机器执行之前。数学家选择问题、决定哪些来源重要,并评估生成的步骤是否服务于预期论证。

因此,这些访谈同时揭示了两种变化。AI 已足够实用,能够影响真实研究;但其最可信的用途仍依赖大量的人类专业知识。

这种组合解释了费城复杂的氛围。研究人员可以欢迎更快的探索,同时担忧当模型开始自行选择方向时会发生什么。

为什么 Techmeme 2026 如此密切关注 AI 数学

数学已成为高价值测试场,因为近期系统正从课堂题目迈向开放性研究问题。

三年前,领先的语言模型还经常在基础算术上失误。到 2025 年,前沿系统已能在顶级高中竞赛中取得可与最优秀参赛者媲美的成绩。

研究数学是更难的目标。问题往往需要漫长的论证、专业知识、创造性的重新表述,以及判断哪些路径值得投入注意力。

正确答案并不够。数学家需要经得起细致审查、并能与既有知识形成有意义联系的论证。

近期的一些说法表明,AI 系统正开始跨越这条边界。Williams 引用了关于 Erdős 单位距离猜想的工作,以及一项据称涉及 Jacobian 猜想的反例。

这些例子需要谨慎限定。一些结果涉及尚未公开的系统、公司提供的说法、大量计算资源,或仍需长期人工审查的证明。

一个有力的数据点来自 Google DeepMind 研究人员。他们的 智能体数学系统被设计为一个有状态工作空间,用于文献检索、实验、定理证明和理论构建。

该系统协调多个智能体、维护工作文档、记录失败方案,并让输出经历审查循环。它更像一个研究环境,而非单次聊天机器人的对话。

研究人员报告称,在 FrontierMath Tier 4 上,系统在 48 道非公开题目中答对了 23 道,准确率为 48%。Epoch AI 通过系统接口进行了盲测评估。

论文还披露了一项重要限制。该系统使用的推理工作量高于普通基准测试框架,而且对生成 token 数量或模型调用次数没有固定上限。

这一限制并不能抹去结果。它表明,系统设计、工具、并行探索和反复审查都对性能作出了重要贡献。

同一篇论文还描述了与专业数学家的早期合作。研究人员使用该系统考察开放问题、定位被忽略的文献、进行数值实验,并形成候选证明。

作者也报告了参差不齐的满意度。一些数学家认为该系统对自己的工作效果有限,部分证明仍在接受细致的人类审查。

这些细节说明了为何 AI 数学不断出现在 Techmeme 2026 的报道中。该领域提供了醒目的里程碑,但每个里程碑都会引发关于评估与归属的问题。

是谁选择了问题?是谁提供了关键表述?使用了多少计算资源?是否有独立专家审查了每一个步骤?

一则标题可能将这些区别压缩为“AI 解决了一个问题”。数学实践则要求对完整研究过程进行更审慎的核算。

最强大的系统如今结合了多种能力。它们检索文献、生成猜想、编写代码、测试示例、起草论证,并要求形式化证明工具验证具体步骤。

形式化验证是指用证明检查器能够以机械方式验证的语言表达论证。Lean 是为此目的使用的一种重要系统。

证明检查器可以确认形式化步骤是否遵循其逻辑规则。它不会自动判断定理是否重要、假设是否恰当,或解释是否富有洞见。

非形式化证明带来了另一种挑战。它们以在职数学家惯用的方式传达思想,却可能借助自信或压缩的语言掩盖缺口。

这正是专家审查仍不可或缺的原因。一个看似合理的论证,可能包含即使经过数轮表面检查仍未暴露的细微错误。

Google 的研究人员描述了其系统中一种相关的失败模式。审稿智能体有时会在某个存在缺陷的论证上达成一致,却再也无法发现其中残留的错误。

这一承认很重要。当审查者共享相似盲点时,重复的机器审查并不能保证正确性。

基准测试的进展是真实的,但它并不支持“研究数学已被自动化”这样简单的结论。它表明,复杂的 AI 工作流如今已能够为过去专属于受训专家的工作作出贡献。

核心分歧在于人类引导与自主发现

决定性的竞争并非数学家与机器之间的竞争,而是人类主导的增强与日益自行选择数学目标的系统之间的竞争。

Yu Deng 在 ICM 新闻发布会上提出了更乐观的看法。他预计 AI 将处理技术细节,而数学家将发展新想法、理论和框架。

这种分工类似于早先几波自动化。计算器降低了手工算术的价值,而符号软件则自动化了许多代数运算。

这些工具并未终结数学。研究人员转向需要不同概念、抽象能力和判断形式的问题。

Jordan Ellenberg 在当前这波浪潮之前数年就描述过这一过程。一旦计算机让某项操作变得例行化,数学家往往会将其重新归类为计算,并将注意力转向别处。

许多 ICM 受访者似乎将这种历史模式延伸到了生成式 AI。他们将当前模型视为能够扩大人类可驾驭工作范围的工具。

问题在于,生成式系统正在超越固定计算。它们可以寻找策略、连接遥远的思想、批评草稿,并产出冗长论证。

这些活动占据了数学家过去视为创造性工作的领域。技术执行与智力方向之间的边界正变得不稳定。

Tsimerman 对“理论构建将提供永久人类避风港”的假设提出了质疑。早先的预测认为,语言模型永远无法处理数学或研究级问题。

随着系统进步,这些预测被削弱。他认为,对理论构建的新强调是另一条不断移动的边界,而非持久的限制。

Epoch AI 的 Greg Burnham 提出了类似担忧。仅评估当前能力,可能会掩盖能力增长的方向和速度。

不过,外推也有其限度。现有证据尚不能证明,规模扩展将产生能够稳定提出有价值理论或选择重要研究计划的系统。

生成一个新定义的能力,不同于认识到该定义能够重构一个领域。其重要性部分取决于它与其他思想和社群之间的关系。

数学中充满了困难但未必特别有用的问题。选择一个值得研究的问题,需要技术品味、历史意识,以及对共同优先事项的判断。

模型可以学习与这些判断相关的模式。它们能否形成可靠的数学品味,仍未有定论。

提出可能性与持续推进研究议程之间也存在差别。一个成功的研究计划可能需要多年的重构、沟通、指导与联盟建设。

因此,人类引导仍是 AI 对数学产生最可信影响的核心。专家提供目标、解读失败,并决定某项结果是否值得进一步关注。

如果模型在这些任务上变得可靠,压力将随之上升。届时,增强式应用可能转向自主发现。

这种转变影响的不只是个人生产力。它还可能改变招聘、研究生培养、经费分配、发表标准以及科技公司的影响力。

如果管理者相信商业系统能够以更低成本产出结果,大学可能会减少对探索性项目的资助。学生可能失去那些传统上用于培养研究判断力、难度可控的问题。

私营 AI 实验室也可能在决定哪些数学问题获得大规模计算预算方面拥有更大影响力。它们的模型访问权限和基础设施已经超过许多学术团队。

这些担忧塑造了 Nature Machine Intelligence 所指出的 AI research tensions。其社论强调了人类选择、验证,以及激励机制失衡的风险。

因此,对立格局既是制度性的,也是技术性的。人类主导的研究重视开放、理解、教育和社群发展。

自主系统通常通过已解决的问题、基准分数和可衡量产出来评估。这些指标只涵盖了这一专业所珍视价值的一部分。

核心问题是谁来设定目标。如果数学家主导这些工具,AI 可以扩展人类探索。

如果基准性能和企业优先事项设定议程,该领域可能会产出更多答案,却削弱其形成共同理解的能力。

更快的证明可能制造知识瓶颈

一个生成正确证明的速度快于人类理解速度的系统,会在一个环节创造富余、在另一个环节制造稀缺。

Terence Tao 在其公开 ICM 演讲中聚焦了这一张力。数学服务于多重目标,包括解决问题、构建解释、教育人才以及维系知识社群。

从历史上看,这些目标往往相互强化。解决一个重要问题可以催生新技术、培养研究者,并加深集体理解。

AI 可能将它们分离。一项机器生成的证明或许能解决某个猜想,却无法提供人类能够吸收或复用的解释。

Tao 警告称,数学正接近这样一种局面:一项重大结果可能在无人理解的情况下被证明并验证。

形式上的正确性仍然重要。然而,一份经过检验的证明并不等同于一套对人类有用的理论。

在影响研究流程之前,这一区别听起来可能显得哲学化。数学家需要可理解的概念来教育学生,并连接不同领域的成果。

如果机器产出扩张得比专家理解更快,期刊和大学将面临注意力问题。它们必须决定哪些证明值得占用稀缺的人类审阅资源。

William Thurston 对数学进步的论述提供了一个历史警示。他认为,这一专业真正的工作在于帮助人们理解和思考数学。

Thurston 曾在叶状结构领域产出重大成果的速度,快于他传达其背后思想的速度。其他研究者离开了该领域,其支撑性社群也随之缩小。

AI 可能以更大规模重现这种动态。大量结果的涌现,可能降低人们探索那些答案已经存在于不透明机器输出中的问题的动力。

Timothy Gowers 描述过一种相关的可能性。数学文献可能持续扩张,而社群却缺乏对其中大部分内容的共同专业理解。

这将是一种不同寻常的技术成功形式。人类将拥有更多经过验证的命题,却更缺乏对连接它们的结构的实际掌控。

风险早于完全自主、超越人类的数学能力就已出现。研究生教育已经依赖于这样的题目:它们足够困难,能够培养技能;又足够有限,学生可以解决。

如果 AI 能即时处理这些问题,教师就必须设计新的方式,来教授猜想形成、错误识别和数学品味。

完全回避 AI 并不能解决问题。进入研究领域的学生需要积累使用工具的经验,而这些工具将在他们整个职业生涯中不断出现。

不加批判的依赖则会带来相反的危险。将过多推理委托给 AI 的学生,可能完成任务却未能形成评估模型输出所需的判断力。

验证基础设施也仍不均衡。一些领域拥有成熟的形式化库,而另一些领域则缺少高效形式化所需的定义和支撑定理。

非形式化评估依赖少数专家。随着系统生成越来越复杂的主张,他们的时间可能成为限制性资源。

这一瓶颈类似于软件维护。生成代码很便宜,但理解依赖关系、验证行为并承担责任依然成本高昂。

数学提高了风险,因为错误可能长期潜伏在冗长的技术论证中。信心十足的表达和精致的文风,几乎不能作为正确性的有力证据。

Leiden Declaration 试图为这一转变确立社群原则。它涵盖研究、教育、出版、资助、政策以及与 AI 公司的关系。

Leiden Declaration 认为,数学家仍然可以选择是否以及如何采用 AI。它将理解、开放、署名和人类能动性视为值得保留的价值。

国际数学联盟于 6 月认可了该倡议。它于 7 月 26 日在 ICM 上发布并进行了讨论。

该宣言并未为 AI 时代的数学提供完整的运行模式。它为各机构在决定应要求何种证据、披露和访问标准时提供了起点。

实际政策可以包括记录模型参与情况、将机器生成的猜想与经验证的结果区分开来,以及在形式化证明之外保留人类可读的解释。

研究人员还需要在可能的情况下获得可复现的访问条件。由未发布模型产出的结果,无法由独立团队在相同条件下进行审查。

这在科技公司宣传研究里程碑时尤为重要。公司的演示可以是有价值的证据,但不能作为最终验证。

审慎的立场并非认为机器生成的数学没有价值,而是证明产出不应成为衡量数学进步的唯一标准。

人类理解决定了一项结果能否支撑教育、进一步发现和负责任的应用。缺少这一层,持续扩张的证明库可能沦为无法访问的库存。

下一批 AI 数学成果必须证明什么

下一阶段将由独立复现、持久的人类理解,以及 AI 能够塑造研究而非仅完成指定任务的证据来评判。

第一个值得关注的信号,是重大开放问题主张能否获得独立验证。专家需要获取完整论证、假设、计算记录和清晰的署名信息。

当一个未发布系统产出结果时,外部数学家应当判断证明是否正确,以及方法是否包含真正的新思想。

成功复现将强化这样一种观点:AI 已进入可靠的研究型数学领域。反复修正或撤回主张则会削弱这一观点。

第二个信号是,AI 系统能否构建有用的理论。解决一个定义明确的问题,始于有人已经选定目的地之后。

理论构建需要能够揭示隐藏结构的定义、能够组织证据的猜想,以及其他研究者可以延展的解释。

一次不寻常的提议无法回答这个问题。更有力的检验在于,人类专家是否会在多个项目中采用机器生成的概念。

这种采用必须超越好奇心。研究者应发现,所提出的框架能够澄清旧结果、提出富有成效的问题,或连接此前彼此分离的领域。

第三个信号关乎机构。大学、期刊、资助方和数学学会必须决定如何对待 AI 辅助工作。

披露标准将显示,社群能否区分常规协助与实质性的机器贡献。审稿政策将揭示谁为正确性承担责任。

培训实践同样值得关注。项目需要找到方法,在教导学生将 AI 用作研究工具的同时,保留深度推理能力。

资助决策将暴露权力平衡。如果资源主要流向专有系统,学术数学可能会依赖于无法审查的工具。

更广泛的访问将支持增强模式。研究者可以测试系统、比较方法并调整工作流,而不必放弃自己的议程。

受限访问将加剧对企业影响力的担忧。少数实验室可能决定哪些项目获得先进的机器支持。

这一结果对开发者和其他知识工作者同样重要。数学预示了当 AI 在专业身份核心任务上变得胜任时将会发生什么。

专家可能变得更高效,却失去对入门级工作的控制。即使原始产出变得更便宜,验证与判断也可能变得更有价值。

同样的模式可能出现在软件、法律、科学和金融分析中。组织将需要能够保留来源、决策、修订和人类语境的系统。

个人知识库 可以通过让人类推理与 AI 检索或转换的材料保持连接,来支持这类工作。

Techmeme 2026 的启示并非 AI 已经完成了数学,而是可信的研究者已从否定这种可能性,转向协商其后果。

一些人看到了更快的发现路径。另一些人则看到了对职业、教育、资助和共同理解的压力。

两种反应都可以由同一证据支撑。系统已经足够有用,能够改变当前工作,但其长期上限仍然未知。

实际的应对方式是检验大胆主张,同时不忽视这一轨迹。研究者应要求可复现性、保留可理解的解释,并明确人类价值。

关注下一项经过独立审查的证明、第一套被广泛采用的 AI 生成理论,以及有关署名和访问的政策。这些信号将揭示 AI 是扩展数学文化,还是仅仅扩展其产出。

如今,每个知识密集型领域都面临着类似的问题:专家工作中哪些环节应由机器加速,哪些环节又必须让人能够理解?

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page