top of page

AlphaGo 的第 37 手在 AI 驱动的数学发现中回响

8月11日
讀畢需時 13 分鐘

2016 年,AlphaGo 下出了第 37 手,违背了数百年的围棋直觉,随后以 4 比 1 击败李世石。这篇 techmeme 观察探讨:数学是否正在接近属于自己的“第 37 手”时刻。

这一类比之所以愈发有分量,是因为更新的系统不只是复现已知解法。它们会搜索庞大空间,生成出人意料的候选结果,并将最有力的结果交给形式化评估器或人类专家。有些系统已经改进了数学界限,或找到了优于既有方法的算法。

这改变了围绕 AI 推理的核心争论。重要的较量不再是 AI 与封闭棋类游戏中的冠军之间的对决,而是机器生成的新颖性与数学用以确认知识的标准之间的较量。

AlphaGo 提供了一个长久的画面:专家最初难以解释的一手棋,却被证明在战略上是正确的。数学提出了更严苛的要求。一个令人惊讶的答案,只有在研究人员能够验证它、理解其适用范围,并区分发现与重新发现时,才具有意义。

第 37 手将一个陌生选择变成了制胜之举

第 37 手之所以重要,是因为 AlphaGo 的奇特决策经受住了严酷结果的检验。

2016 年 3 月,Google DeepMind 的 AlphaGo 在首尔对阵李世石。李世石曾获得 18 个围棋世界冠军头衔,是同时代最强棋手之一。DeepMind 表示,超过 2 亿人观看了这场五番棋对局。

AlphaGo 在第二局下出了著名的一手。它将一枚棋子落在第五线,远离塑造职业棋手判断的传统定式。评论员起初将这一选择视为可能的失误。

DeepMind 后来称,第 37 手被人类棋手选中的概率大约只有万分之一。这一手帮助 AlphaGo 控制棋盘,并最终赢得该局。它的重要性来自惊喜与可衡量成功的结合。

李世石认识到了这种差异。他原本预计机器只是由计算驱动,但第 37 手让他形容 AlphaGo 具有创造力。这种反应捕捉到了基准分数很少能够传达的一点:系统提出了一个在熟悉的人类实践之外、却有用的想法。

这场对局最终以 AlphaGo 4 比 1 获胜结束。李世石凭借自己极不寻常的第 78 手赢下第四局,这一手有时被称为“神之一手”。这次交锋避免了故事沦为机器至上的简单叙事。

AlphaGo 使用神经网络评估棋盘局面,并使用蒙特卡洛树搜索考察有希望的后续变化。蒙特卡洛树搜索通过反复模拟决策树中选定的分支,来估计哪些行动更优。强化学习随后通过经验与自我对弈改进系统。

该系统并不通过人类语言来推理围棋。它为局面赋值,搜索可能的未来,并选择预估结果最强的一手。这一机制让它得以摆脱一些嵌入专家样本中的惯例。

DeepMind 对 AlphaGo 对局的介绍称,第 37 手颠覆了数百年来沿袭的围棋智慧。结果不仅仅是更高的胜率。职业棋手研究了这一手,并调整了他们理解棋盘的方式。

这正是这一事件十年后依然有用的原因。这一手为观察者提供了一个紧凑的例子:机器生成的新颖性可以由人类测试、复盘,并最终吸收。

数学没有像一场结束的围棋对局那样即时的记分牌。它的决定性问题在于,一个不寻常的构造、算法或猜想是否能在形式化分析下保持正确。这一差异让当前的发现更具影响力,但也更难判断。

为什么这篇 techmeme 观察超越了围棋

现代“第 37 手”问题关注的是 AI 能否产出可验证的知识,而不是它能否令观众感到惊讶。

围棋为 AlphaGo 提供了固定规则、完全信息和明确目标。每一个合法棋盘局面都可以通过最终的胜负进行评估。数学包含更广阔的空间,即便定义一个有用目标也需要专家判断。

一个数学系统还必须应对上下文缺失的问题。研究人员关心的是一个构造为何有效、哪些假设支撑它,以及它是否可以推广。数值上的改进可能很有价值,却未必能回答这些更深层的问题。

不过,这一领域已经跨越了几个重要门槛。AI 系统如今能够生成候选构造、搜索算法、解决高难度竞赛题,并协助数学家研究开放问题。它们最强的结果依赖验证循环,而不只是流畅的输出。

这种区别将发现系统与普通聊天机器人区分开来。语言模型可以写出看似自信的数学论述,其中却隐藏着错误。评估器则可以执行代码、测试构造,或检查证明是否遵循允许的规则。

Google DeepMind 的 FunSearch 将语言模型与自动化评估器及进化搜索过程结合起来。语言模型提出程序,评估器对其打分并淘汰不合适的候选结果。更好的程序会回到提示池中,形成迭代搜索循环。

同行评审的 FunSearch 研究报告了针对帽集问题的新构造;帽集问题是极值组合学中的一个经典问题。研究人员还发现了在线装箱启发式算法,在所研究的分布下优于广泛使用的基线方法。

这些结果之所以重要,是因为评估器建立了外部标准。模型无法凭借有说服力的语言获得认可。它的程序必须生成超过既有基准的结果。

FunSearch 还生成了程序,而不是孤立的答案列表。程序可以呈现可复用的模式,并帮助研究人员考察结果是如何生成的。这使它比一组原始的成功对象更具可解释性。

不过,可解释性是相对的。可读代码并不保证存在简洁的数学解释。研究人员可能需要投入大量工作,才能将计算结果转化为定理、证明或一般性原则。

正是在这里,与第 37 手的比较变得精确。AlphaGo 选择的一手棋,其价值在一局棋剩余的进程中显现出来。一个数学候选结果可能需要数月的检验、完善,以及向既有理论的转化。

压力同时落在 AI 开发者和数学家身上。开发者必须构建输出可审计的系统。数学家则必须决定多少计算证据才算数、谁应获得署名,以及哪些输出值得占用稀缺的专家注意力。

一个有用的个人知识系统可以帮助研究人员保存这些假设、未通过的检查和支撑论文的轨迹。不过,整理证据并不能替代数学验证。

因此,对这一转变的 techmeme 观察不能止步于一台有创造力机器的形象。它必须考察将机器变异转化为可信知识的机制。

评估器是 AI 发现背后的机制

决定性的进展,是一个探索与评估循环:它生成大量想法,同时对每个存留下来的结果施加严格测试。

AlphaEvolve 将这种方法从单个函数扩展到更大的算法代码库。Google DeepMind 于 2025 年 5 月推出该系统,将其描述为由 Gemini 模型驱动的进化式编码智能体。它结合了程序生成、自动化评估和反复筛选。

更快的模型可以生成范围广泛的候选程序。能力更强的模型则会对有前景的候选结果做出更深入的修订。评估器运行程序、衡量其表现,并在共享数据库中保留有用的变体。

这一过程类似自然选择,但其环境由研究人员设计。人类指定任务、可执行框架,以及用于判断候选结果的指标。随后,系统探索的变体数量超过了一个小团队能够手动检查的范围。

根据 DeepMind 的 AlphaEvolve 发现,该系统被应用于 50 多个开放问题。据称,它在约 75% 的实验中重新发现了领先解法,并在 20% 的实验中实现了改进。

其中一个结果涉及使用 48 次标量乘法来相乘两个 4×4 复值矩阵。DeepMind 表示,这改进了该特定场景下已知的最佳方法,其脉络可追溯至 Strassen 在 1969 年的工作。

另一项实验处理了接吻数问题。该问题问的是:在选定维度中,有多少个彼此不重叠的单位球可以接触一个中心单位球。AlphaEvolve 在 11 维空间中发现了由 593 个外层球组成的构型,改进了一个已知下界。

这些例子揭示了数学为何适合基于评估器的 AI。候选构型通常可以通过机械方式检查。算法的运算次数可以测量,其正确性也可以独立审查。

评估器也缩小了“创造力”的含义。它不要求机器具有人类动机或审美判断。它要求系统生成一个有效候选结果,而这一结果并非设计者直接提供。

然而,评估器也划定了自身边界。AlphaEvolve 最适合那些能够通过代码和可量化目标表达成功的领域。许多重要数学问题难以这样处理。

研究人员也可能优化了错误的代理指标。系统可能获得高分,同时利用评估器中的漏洞,或忽略专家所看重的品质。这类似于奖励黑客行为,即智能体满足了既定指标,却没有实现预期目标。

人类选择始终贯穿整个流程。专家提出问题、编码约束、选择基线、检查输出,并决定数值改进是否具有数学意义。AI 扩展了搜索,而非消除了研究判断。

这种分工与大众叙述所暗示的相比,更接近 AlphaGo 的情形。人类设计了 AlphaGo 的架构和训练过程,而系统则在常见棋路之外搜索。棋手随后解释所得策略,并吸收有用经验。

这些较新的系统在控制程度较低的领域重复这一循环。它们生成不寻常的候选结果,将其提交给评估器,并邀请专家解释哪些结果能够成立。这个循环才是第 37 手真正的继承者。

主要较量是新颖性与验证之间的较量

一个令人惊讶的输出,只有在独立检查确认其正确、新颖且有意义后,才会成为一项发现。

对于在大量人类作品集合上训练的模型而言,新颖性很难证明。一个系统可能复现某个鲜为人知的构造,却无法说明自己在哪里接触过这一想法。因此,研究人员需要比模型自身解释更有力的证据。

改进有记录的现有最先进结果,提供了一种有用检验。如果候选结果在相同条件下击败已发表的基线,那么单纯记忆便不再是那么有说服力的解释。但这仍不能证明其具有广泛的科学重要性。

形式化证明提供了一条更严格的路径。证明助手可以依据明确规则检查每一个逻辑步骤。然而,将非形式化的数学思想转换为形式语言,往往仍需要大量人工投入。

AlphaGeometry 展示了一种混合方法。它将神经语言模型与符号推理引擎结合,后者会应用形式化的几何规则。当符号搜索抵达困难的分支节点时,模型会提出有用的辅助构造。

在一项包含 30 道奥林匹克竞赛级几何题的测试中,AlphaGeometry 解出了其中 25 道。此前领先的方法只能解出十道,而该系统的表现已接近一名平均水平的金牌得主。其输出还包括由专家评估的人类可读证明。

已发表的 AlphaGeometry study 还报告了一个经过推广的 2004 年国际数学奥林匹克竞赛定理的转译版本。该结果表明,搜索不仅能完成既定考试题,也可能揭示更深层的结构。

不过,奥林匹克竞赛题与开放研究不同。前者被设计为具有简洁解法,评审者也早已知道答案存在。研究问题则可能定义不清,或难以用现有证明方法攻克。

因此,竞赛表现衡量的是一种有用能力,却无法就“发现”这一问题下定论。一个系统可以精通已知的题目风格,却几乎不对这些风格之外的数学作出贡献。反过来,一个狭窄的优化器也可能产出有价值的结果,而不代表它具备广泛的推理能力。

当公司将单项成就与通用人工智能联系起来时,怀疑论的理由就更充分了。DeepMind 的回顾性文章 AlphaGo anniversary 将第 37 手描述为一条从游戏通向科学发现和 AGI 的路径的一部分。

这是公司的解读,而非经独立确立的结论。受限算法搜索的进展,并不能证明一个系统能够自主选择重要的研究问题,也不能说明它以数学家的方式理解一项发现。

实践中还存在验证成本。自动化系统生成候选结果的速度,可能快于专家审查它们的速度。如果验证成本仍然很高,研究者面对的将是注意力瓶颈,而非创意短缺。

这一瓶颈改变了 AI 输出的价值。最有用的系统未必是提出最多猜想的系统,而可能是能提供简短证书、可复现代码,以及与既有研究清晰关联的系统。

署名仍是另一个悬而未决的问题。一项结果可能涉及模型开发者、基础设施团队、将问题形式化的数学家,以及证明最终定理的专家。现有的作者署名惯例并不是为这种链条而建立的。

正确的回应不是否定机器生成的结果,而是要求与其主张相匹配的证据。“找到了更好的候选项”需要可复现的比较;而“发现了一条定理”则需要经过验证的陈述和证明。

第 37 手通过了一项透明测试,因为所有人都能观看比赛展开。数学同样需要清晰可读的测试,才能让自己的惊人一步获得相称的地位。

AI 正在重塑研究工作流,而非取代数学家

直接影响在于研究者搜索、测试和确定想法优先级的方式发生改变,而不是人类数学家被移除。

传统上,数学家会在直觉与有针对性的计算之间取得平衡。AI 发现系统通过降低大范围计算探索的成本,改变了这种平衡。研究者可以在确定证明策略之前,测试更多候选不等式、构造或算法。

Terence Tao 在 DeepMind 关于 AlphaEvolve 的 2026 年更新中描述了这一工作流的实用版本。他表示,这类工具能帮助数学家为可能成立的不等式寻找反例,并研究可能的极值对象。极值对象是指取得最大或最小可能值的对象。

这种支持能够磨砺直觉。研究者可能带着一个猜想而来,要求系统搜索反例,并在反例出现时修订陈述。这样,在正式证明开始前,最终定理就会变得更精确。

同样的工作流也有助于暴露虚假的信心。数学中存在一些看似合理、却会在遥远边角情形失效的模式。大规模计算搜索可以比人工分析更早定位这些失败之处。

DeepMind 表示,AlphaEvolve 已协助处理 Erdős 问题,并改进了与旅行商问题和 Ramsey 数有关的下界。其扩展应用还包括计算和科学领域的优化工作。

这些说法需要逐项审查。下界可以获得改进,却不意味着相关问题已经解决。一项有用的计算观察可以引导证明,却未必本身就构成定理。

这种压力也延伸到纯数学之外。更优的矩阵乘法方法可能影响软件库、专用硬件和 AI 训练。即使是狭窄的改进,只要相关操作以极大规模运行,也可能意义重大。

这为 Google 和其他 AI 公司投资发现系统创造了激励。算法收益可以改进内部基础设施,同时也为更广泛的推理能力提供证据。科学声望与运营效率相互强化。

其他实验室面临着提供超越已知问题的精致答案的压力。它们需要能够产出可审计工作、与形式化工具交互并经受专家审查的系统。仅凭基准测试分数,几乎无法说明模型是否能够拓展知识边界。

大学面对的是另一种压力。研究者需要获得计算资源、评估基础设施,以及能够公开研究的模型。如果领先的发现系统仍然难以复现,外部专家可能难以评估公司的主张。

学生也将需要不同的一套习惯。产出一份看似可信的证明草稿正变得不再稀缺。检查假设、追溯既有工作、形式化论证,以及识别有意义的问题,将变得更加重要。

这些都不会让数学品味过时。评估器会奖励研究者编码进去的内容。选择一个富有成果的问题,以及识别一个具有启发性的模式,仍然需要当前系统无法可靠提供的语境判断。

最有希望的近期模式是协作。AI 进行广泛搜索和机械测试;人类定义有价值的目标,研究结果为何成立,并将其连接到更广阔的数学图景中。

这种安排仍可能重新分配影响力。构建有效评估器的研究者将获得更大杠杆,而缺乏计算资源的团队则有落后的风险。数学工作将与软件工程和基础设施更加紧密地绑定。

因此,这一对 techmeme 的观察同样关乎制度变迁,而不仅是机器智能。第 37 手之所以具有价值,是因为人类棋手对它进行了研究。当研究者能够可靠地将陌生输出转化为共享理解时,数学 AI 才会变得重要。

什么才算数学界的第 37 手

下一个决定性时刻需要独立验证、真正的新颖性,以及能改变数学家工作方式的启示。

第一个值得关注的信号,是针对一个开放问题获得经过完全验证的结果,而且外部专家认可其重要性。可复现代码和形式化证明会增强这一主张;对私有评估器的依赖则会削弱它。

第二个信号是持续的人类采用。一项出人意料的构造可以吸引关注,但真正的工作流改变体现在独立研究者反复使用 AI 生成的想法。引用、后续证明和改进的方法,比演示更能提供有力证据。

第三个信号是跨问题类别的迁移。AlphaGo 先掌握了一种游戏,之后其底层技术影响了后续系统。当同一方法能在无关领域取得成功、且无需大规模针对性重建时,数学发现引擎就会变得更具影响力。

这些测试能够防止这种比较沦为营销口号。第 37 手之所以重要,并不只是因为它看起来奇特;它重要,是因为那一步帮助赢得了胜利,并在之后重塑了专家的直觉。

数学要求更高的标准。机器产出的结果必须能在严苛审查下保持正确。研究者还必须证明,该结果在所选指标之外也是未知且重要的。

最可信的路径在于透明评估。系统应披露问题定义、基线、验证程序,以及每项结果周围的人类贡献。独立团队应能够复现核心主张。

这种方法有时会让进展看起来更慢,但也会创造能够跨越产品周期而存续的知识。数学奖励的是在模型、公司和基准都已改变之后仍然有效的结果。

因此,“AI 发现”这一说法应涵盖多个层级。一个系统可以找到更好的数值候选项、提出有用猜想、生成证明,或帮助人类推导新理论。这些成就不应被视为可以互换。

AlphaGo 十年之后,重要的发展并不是机器仍能令人大吃一惊,而是研究者正在构建通过客观测试筛选惊喜的流程。

这篇对第 37 手的 techmeme 观察,指向了每位开发者、研究者和知识工作者都应面对的一个实际问题:你能否审查一项 AI 结果是如何赢得信任的?沿着证明线索追查,测试代码,并将失败的尝试与胜出的结果一同保留。

下一次第 37 手未必会在全球观众面前出现。它可能悄然出现在一个程序中,随后经历数月检验。当数学家采用其背后的思想时,真正的突破才会显现。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page