top of page

GPT-5.4 解决了其在 FrontierMath 基准中的首个开放数学问题

6月6日
讀畢需時 5 分鐘

已更新:6月17日

GPT-5.4 solves its first open math problem from FrontierMath benchmark

GPT-5.4 Pro 评估的最新日志显示了大型语言模型在处理复杂的、未解决的数学问题方面发生了转变。在涉及 FrontierMath 基准测试(包含数百个原创研究级问题的集合)的一个特定案例中,该模型成功解决了一个与超图构建相关的开放性问题。这一结果代表了从AI 解决学生级竞赛到为发现新的数学边界做出贡献的转变。

FrontierMath 由 Epoch AI 开发,并与 IMO 金牌得主和 Fields Medalists 合作,旨在做到“防泄露”。与 MATH 或 GSM8K 数据集不同(模型在这些数据集中通常依赖训练数据的模式匹配),FrontierMath 的问题未公开发表,需要数小时或数天的计算推理。GPT-5.4 解决的问题涉及特定超图的构建,并寻找表示为 H(n) 的序列的下界。

为什么 FrontierMath Tier 4 挑战难倒了之前的 o1 等模型

Why FrontierMath Tier 4 challenges stopped previous models like o1

早期的基准测试(如 o1 或 o3)在传统竞赛数学中表现出极高的熟练度,但在面对 FrontierMath 集合中的“Tier 4”问题时,其性能显著下降。这些问题被归类为处于活跃数学研究的水平。在 2024 年底,像 OpenAI 的 o1 等模型在该数据集上的准确率保持在约 2%。到 2025 年底,o3 将这一数字提高到了 25%,但解决一个真正的“开放性”问题(即评估者也不知道答案的问题)仍然是一个空白。

难点在于逻辑链的复杂性。当证明需要几十次以上的转换时,标准推理模型往往会在中间步骤产生幻觉。FrontierMath 要求数千个逻辑步骤,通常需要模型桥接组合数学和算法复杂度等不同领域。GPT-5.4 通过摆脱纯文本推理,转而利用代码执行和形式化验证的集成环境来解决这一问题。

GPT-5.4 使用 Python 和 Lean 解决问题的机制

从 GPT-5.4 的日志中可以得出一个关键的技术结论:该模型依赖于“暴力”算法发现与形式化证明语言的结合。模型没有尝试用英语编写符号证明,而是遵循了三步工作流:

  1. 算法构建:模型编写了多个 Python 脚本来生成各种超图配置。这使其能够在几秒钟内测试数千种潜在的构建方案。

  2. 迭代优化:当初始脚本未能达到 H(n) 所需的下限时,模型分析了失败原因并调整了构建参数。

  3. 形式化:一旦通过 Python 找到候选构建方案,模型就会使用形式化验证语言 Lean 来描述证明。这确保了构建的逻辑基础是稳固的,并且可以通过自动化内核进行验证。

这种方法规避了早期 LLM 中常见的“推理疲劳”。通过将计算卸载给 Python 并将验证交给 Lean,GPT-5.4 的表现更像是一个管理一套专业工具的研究组长,而不是一个试图在脑中解决问题的学生。

从模式匹配到暴力算法发现

From pattern matching to brute-force algorithm discovery

该问题涉及超图理论中的一个特定界限。此前,数学家们已经确定 nlog2(n) 是一个下界,但许多人怀疑 nln(n) 才是真正的极限。GPT-5.4 发现了一种方法,可以推广 2022 年一篇研究论文 (NSF-PAR 10338368) 中的现有结构。

通过扩展这一现有逻辑,该模型提供了一个符合预期界限的结构。这并非人类意义上的“创意火花”,而是在可能的数学扩展空间中进行的高效搜索。模型意识到,如果满足某些条件,2022 年论文的方法论可以应用于更高维的情况,并编写了代码来证明这一点。

验证 nlog2(n) 超图下界

该解决方案最显著的部分之一是模型处理证明中“暴力计算”或计算密集型环节的能力。在高等数学中,许多问题都会达到这样一个阶段:人类数学家可以看到一条潜在路径,但缺乏时间去手动验证数千种排列。GPT-5.4 填补了这一空白。

它生成了一个 bash 脚本来运行其 Python 验证套件,有效地自动化了研究中“乏味”的部分。Epoch AI 的 Greg Burnham指出,虽然解决方案看起来是正确的,但最终验证仍取决于原问题的作者。这凸显了一个新的现实:AI 现在生成的数学成果需要一种特定类型的专家审查——即检查模型的代码及其 Lean 形式化证明,而不仅仅是其最终答案。

AI 驱动的数学研究对现实世界的影响

Real-world implications for AI-driven mathematical research

这一事件改变了 AI 领域对“进步”的定义。我们不再衡量模型重复微积分教科书的能力,而是在衡量其探索未知信息前沿的能力。对于技术领域的专业用户来说,使用这些模型的“专家级”方法现在已经很明确:赋予 AI 编写并运行其自身验证代码的能力。

GPT-5.4 在此案例中的成功表明,科学领域的 AI 瓶颈从来不仅仅是“智能”,而是缺乏反馈闭环。当模型能够通过代码验证自己的尝试时,它就可以在无需人工干预的情况下纠正自己的错误。这使模型成为了研究的积极参与者,而非被动的参考工具。

如果这些结果在 FrontierMath 子集剩余的 13 个开放问题中依然成立,那么 AGI 在专业科学领域的实现时间线可能会比之前估计的更短。研究机构的重点可能会转向创建更多像 FrontierMath 这样“可验证”的环境——即答案未知,但正确答案的标准被严格定义。

常见问题

什么是 FrontierMath 基准测试?

FrontierMath 是由 Epoch AI 创建的高难度数学数据集。它包含 350 道原创题目,旨在测试 AI 在现有训练集中无法找到的研究级数学能力。

GPT-5.4 是如何解决这一开放性问题的?

该模型结合使用了 Python 生成构造方案和 Lean 进行形式化验证。它迭代测试了不同的算法路径,直到找到满足问题要求的超图构造。

GPT-5.4 的数学解法经过官方验证了吗?

虽然该解法已通过初步的自动化检查和 Epoch AI 研究人员的内部审查,但最终确认通常需要由编写该题目的特定数学家进行评审,以确保不存在隐藏的逻辑缺陷。

GPT-5.4 在数学性能上与 o1 有何不同?

与 o1 仅 2% 的准确率相比,GPT-5.4 在 Tier 4 问题(研究级)上表现出更高的准确率。它在长程任务中也展现出更强的能力,例如编写并执行多个脚本以寻找解决方案。

为什么 Lean 在 AI 数学中很重要?

Lean 是一种形式化证明语言,允许计算机验证数学证明的每一步在逻辑上都是严谨的。通过使用 Lean,AI 模型可以提供“有保证”的证明,且不会出现自然语言输出中常见的幻觉问题。

该模型具体解决了什么数学问题?

该模型解决了一个关于超图构建和序列 H(n) 下界的问题,成功扩展了 2022 年一篇研究论文中的已知构建方法,从而达到了一个新的、更高的下界。


 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page