Anthropic Claude 未能证明黎曼猜想,却取得重大成果
- Olivia Johnson

- 1天前
- 讀畢需時 14 分鐘
Anthropic Claude 未能解决已有 167 年历史的黎曼猜想,尽管它在一次规模异常庞大的研究运行中协调了约 60 个 AI 智能体。它最终提出的一项结果声称,将一项关键下界从 41.6% 提升至约 67.2%。
这一区别至关重要。Anthropic Claude 并未证明黎曼 ζ 函数的每一个相关零点都位于临界线上。据报道,它是在不假设该猜想成立的前提下,证明了比数学家此前结果强得多的最小比例。
Anthropic 于 2026 年 8 月 10 日披露了这项工作,此前其内部数学家已完成审阅,外部专家也在短时间内审查了论证。该结果仍需接受更广泛的专家检验,但它比基准测试分数或孤立谜题的解答更具分量。
因此,核心冲突并非 AI 与人类数学家之间的较量,而是自主证明搜索与数学界将一个看似可信的论证转化为可靠知识这一较慢过程之间的张力。
Anthropic Claude 找到的是部分结果,而非黎曼猜想证明
这项据称的结果改变了一项已被证明的下界,但黎曼猜想仍未解决。
黎曼猜想涉及黎曼 ζ 函数的非平凡零点;这一函数与素数分布有着深刻联系。该猜想预言,每一个这样的零点的实部都为二分之一。
这一垂直位置被称为临界线。完整证明必须涵盖每一个非平凡零点,包括任何可能位于其他位置、极为罕见的零点。
Anthropic 要求一个尚未发布的 Claude 研究版本认真尝试解决这一完整问题。根据该公司的研究说明,该模型并未解出它。
相反,Claude 找到了一项关于已知位于临界线上的零点比例的论证。Anthropic 将此前无条件下界描述为 41.6%,并将新结果描述为约 67.2%。
“无条件”在这里有着精确含义。它意味着论证并非一开始就假设黎曼猜想本身成立,或假设其他能够导出所需结论的未证明条件。
百分比很容易让人误以为进展是线性的。从 41.6% 提升至 67.2%,并不意味着数学家如今已完成黎曼猜想的 67.2%。
即使证明几乎所有零点都位于临界线上,也不能自动解决该猜想。一个集合的密度可以为零,同时仍然包含无穷多个元素。
素数提供了一个熟悉的类比。它们在所有正整数中的占比趋近于零,但素数仍有无穷多个。同样,位于临界线外的零点即使比例趋于零,仍可能包含反例。
更准确地说,这项新主张是一条毗邻著名猜想的独立定理。它收紧了数学家能够对零点整体建立的结论,却并未确定每一个单独零点的位置。
这使这一进展具有意义,却并不构成对猜想的解决。也因此,那些宣称 Claude“证明了黎曼猜想”的标题夸大了实际情况。
计算验证同样无法弥合这一差距。研究人员已经严格核验,在一个极大但有限的高度范围内,零点位于临界线上。
一项已发表的计算将该猜想验证至三万亿的高度,详见一篇严格验证。任何有限计算都无法确定无限延伸范围内所有零点的行为。
Claude 所声称的结果针对的是一个无限比例,而非有限区间。这使其成为一项理论贡献,但其结论仍弱于猜想本身。
因此,重要变化是狭窄且具体的。据报道,一个 AI 研究系统将既有数学工具连接得足够有效,从而推导出一条更强的无条件定理。
这项主张构成了此次事件真正的张力所在。该系统似乎完成了原创研究,但数学界的接受仍取决于人类能否理解并核查它究竟产出了什么。
从 41.6% 跃升至 67.2% 为何重要
这一数值跃升之所以引人注目,是因为这一特定下界的进展此前一直缓慢且技术要求极高。
一个多世纪以来,数学家已知有无穷多个 ζ 函数零点位于临界线上。但这一命题并未说明这些零点占所有零点的比例。
后来,Atle Selberg 证明了其中有正比例位于临界线上。Norman Levinson 将已知比例推进至超过三分之一,而 Brian Conrey 则建立了超过五分之二的结果。
后续工作将无条件数值提升至约 41.6%。这些进展高度依赖 mollifier,即用于控制 ζ 函数在其零点附近行为的精心设计函数。
每一次改进都需要愈发精细的估计。因此,进展通常以零点几个百分点计,而不是一次跨越超过 25 个百分点。
据报道,Claude 提出的论证采取了另一条路径。它结合了近期关于成对相关的研究,以及与 Enrico Bombieri 相关的一种较早的二次型方法。
成对相关描述相邻零点高度之间的统计关系。相关的人类研究发展出了一些方法,可在不预先假设黎曼猜想的情况下研究这些关系。
近期基础工作包括 Andrés Chirre、Daniel Goldston、Ade Irma Suriajaya、Caroline Turnage-Butterbaugh 及相关合作者的研究。据报道,Claude 检索了这些文献,并发现了一种此前尚未被发展为所述无条件下界的组合。
这一点需要谨慎表述。数学研究几乎总是建立在既有成果之上。创新之处可以在于识别到两个成熟工具在正确结合后能够填补缺口。
据报道的成就并不是发明黎曼 ζ 函数、成对相关或二次型,而是通过新的综合方式,声称消除了一个限制性假设。
这种综合具有很高价值。许多开放研究领域都包含部分引理、条件性论证,以及在不同记号体系下发展出的技术。
人类往往通过长期熟悉某一领域来发现联系。AI 系统则可以高速搜索大量组合、计算实例,并抛弃失败路径。
约 67.2% 这一数字也有其历史背景。此前,在假设黎曼猜想成立的条件下,已有结果达到相近水平。
一篇关于单 ζ 零点的较早论文讨论了在 RH 条件下超过三分之二的结果。无条件地产生类似量级的结果,是一种不同且要求更高的主张。
读者不应将每一个“67.2%”的说法都混同为同一条定理。有些结果涉及位于临界线上的零点,有些涉及单零点,另一些则依赖附加假设。
单零点的重数为一,意味着 ζ 函数穿过零点时并未重复该根。单性与位置是相关的研究问题,但两者不能互换。
Anthropic 的公开摘要采用了便于理解的表述,重点关注满足该猜想的零点。要判断精确定理、定义及计数约定,仍需查阅完整论文和专家说明。
这正是该结果同时考验 AI 实验室与数学出版界的地方。引人注目的百分比传播很快,而决定其含义的限定条件传播较慢。
这一数字因其幅度之大而吸引关注。其持久重要性取决于独立专家是否确认,每一项假设、极限和误差项都如所述般成立。
真正的进展是一套自主研究工作流
Claude 的过程之所以重要,是因为它更像一个研究项目,而非一次单独的聊天机器人回答。
Anthropic 表示,这项工作起初经历了约 650 个失败的候选想法。如此规模的失败并非无关紧要;它表明系统在找到有希望的路径之前,探索了广阔的空间。
随后,该模型在约一天半的时间内工作,并协调了约 60 个 Claude 子智能体。这些智能体分担了研究、计算、批评与验证任务。
据 Anthropic 介绍,这次运行涉及约 2,400 条 shell 命令和数百个 Python 脚本。智能体还针对已知 ζ 函数零点进行了数千次数值检查。
它们下载了 54 篇 arXiv 论文,以调查既有工作及潜在重复。在两次 Claude Code 会话中,据报道该系统生成了约 3,100 万个输出 token。
这些数字来自 Anthropic,尚未经过独立审计。尽管如此,它们仍揭示了这一结果背后的运行模式。
这并不是一条超长提示词之后得到一份润色完毕的证明,而是一个涉及文献检索、猜想形成、计算、否决、修订和对抗性审查的迭代循环。
据报道,人类操作员、Anthropic 员工 Jarred Sumner 并未担任项目中的数论专家。他的主要角色是发起挑战,并鼓励系统继续推进。
这一细节使该案例不同于早先的一些例子:在那些例子中,职业数学家会引导模型接近一项几乎完成的论证。Claude 似乎自行选择了大部分路径。
然而,自主性不应被混同为脱离人类知识的独立性。该系统是在数代研究者共同创建的数学版图中工作。
其文献检索提供了定义、定理、证明技术与开放缺口。当输出进入验证阶段后,人类专家仍不可或缺。
这种混合结构或许是此次事件最重要的部分。AI 可以增加被测试想法的数量,而人类则决定哪些论证值得信任与关注。
这一工作流类似高通量实验。智能体并非运行实体样本,而是生成数学方法,并淘汰那些与已知结果或数值证据相矛盾的方法。
数值检查并不能证明无限定理。但在专家投入时间之前,它们仍可发现符号错误、遗漏情形、错误常数和虚假的中间主张。
子智能体也会互相审查工作,并尝试独立推导。这种设计回应了语言模型的一个常见弱点:同一模型可能在冗长解答中自信地延续一个错误。
当智能体共享架构、训练数据和提示词时,它们并非真正独立。不过,不同的上下文与分配的角色可以减少一部分相关性错误。
因此,这次研究运行展现了推理系统的一条新扩展路径。公司通常追求更好的模型、更长的上下文与更多测试时计算。
Anthropic 的实验增加了组织层面的扩展。一个模型可以担任首席研究员,委派狭窄任务、比较输出,并在某一路径经受住批评后投入更多精力。
这一模式的适用范围超出纯数学。软件验证、算法设计、理论物理和安全研究都包含能够受益于大型、可审查搜索树的问题。
对企业而言,教训并不是通用聊天机器人如今可以取代专业团队,而是当输出具备严格的验证机制时,智能体系统能够更快地探索技术可能性。
数学提供了一个异常有利的试验场,因为相关主张有时可以逐行核验。许多商业决策并不具备如此明确的正确性检验标准。
因此,报道中的成果既比病毒式传播的标题更有限,也更重要。Claude 并未解决一个千禧年难题,但它展示了一种可信的机器辅助研究架构。
形式化验证有帮助,但并不终结审查
经 Lean 检查的证明可以验证逻辑一致性,但对于定义、假设、新颖性和重要性的疑问依然存在。
Anthropic 表示,Claude 已将其结果转化为 Lean;Lean 是一种证明助手,可检查每个形式化步骤是否源自指定公理和先前定理。
证明助手不会依据文风或声誉判断论证。其小型可信内核会验证提交的证明项是否满足形式化陈述。
与其让另一种语言模型判断证明看起来是否令人信服,这提供了更强的保障。流畅的数学表述可能掩盖遗漏的条件或无效的推导。
只要相关概念和假设被正确地表示出来,Lean 就能拒绝这些漏洞。这也是形式化验证已成为多个 AI 数学项目核心环节的原因。
然而,“经 Lean 验证”并非通用的质量认证。Lean 中编码的精确定理必须与面向读者描述的定理相一致。
一项形式化证明可以完全有效,却证明了一个比标题暗示更弱的陈述。它也可能依赖于隐藏在定义、导入公理或未经验证的计算组件中的假设。
审稿人必须审查被形式化的内容,而不只是检查器是否返回成功。他们还必须确认,非形式化分析与形式对象之间的转换保留了预期含义。
Anthropic 表示,其两位数学家研究并验证了 Claude 的论文。随后,他们撰写了一份更简洁地呈现该论证的专家证明说明。
该公司还称,布赖恩·康瑞和丹尼尔·戈尔德斯顿两位长期研究 ζ 零点的专家进行了短期审阅。这是有意义的证据,但并不等同于广泛的同行评审。
短期审阅能够发现明显错误并确立可信度,但不太适合核查一篇长篇解析数论论证中的每一项技术依赖。
数学界需要时间重建这份证明,将其与引用文献进行比较,并检验某个所谓的新步骤是否早已在其他地方出现。
可读性也是一个问题。AI 生成的证明可能包含过多的引理名称、冗余的绕行步骤,以及局部有效但整体目的仍不清晰的推导。
数学家做的不只是认证逻辑蕴含关系。他们会将证明压缩为概念,解释一种方法为何有效,并识别哪些部分能推广到其他问题。
一份冗长的机器证明可以确立一个定理,却未能提供这种理解。这限制了它作为后续研究基础的即时价值。
最理想的结果应包含三种相互兼容的成果。研究人员需要一份可读的人类证明、一份经过机器检查的形式化版本,以及一份将二者与既有工作联系起来的透明记录。
这些层面服务于不同受众。形式化成果保护正确性,论文传达机制,研究历史则确立归属。
归属问题在这里尤为重要。据报道,Claude 将近期的对相关工作与 Bombieri 较早的方法结合起来。
如果在这些要素被组合后,最后一步很简短,那么评论者可能会对模型应获得多少原创性认可存在分歧。这种分歧并不会让该定理失去价值。
人类数学同样重视将既有成果联系起来。恰当的标准是,Claude 是否识别并论证了一项文献此前未曾记录的、并不显而易见的推论。
独立发表将有助于回答这个问题。研究人员应关注稳定的论文版本、公开的 Lean 仓库、明确的依赖声明,以及专家评论。
在这些材料出现之前,负责任的描述应是:这是一项被主张且已受到实质性审查的数学进展。称其为已获接受的定理,将超前于现有程序。
AI 数学如今对基准测试与研究机构形成压力
这一事件将关注点从解决精选问题,转向产出必须由专家评估的研究成果。
近来,AI 数学通过竞赛、定理证明基准和形式化证明任务取得进展。这些环境提供已知答案和可量化的成功率。
开放性研究更难评估。系统必须识别有用的中间问题,判断其结果是否新颖,并向专家清楚传达。
据报道,Claude 与黎曼问题相关的工作尝试完成了这三件事。它未能实现原始目标,但认识到一个副产品可能具有数学价值。
这一行为之所以重要,是因为研究很少沿着开端设定的目标推进。重要发现往往来自失败的路径、意外的例子,或为其他目标构建的工具。
传统基准并不能很好地衡量这种判断力。模型获得一个固定问题,而评估者已经知道是否存在解法。
开放问题没有这种保证。系统必须决定何时坚持、何时放弃一条路径,以及何时应当保留一个部分结果。
因此,Anthropic 的实验促使竞争实验室展示的不只是基准测试提升。OpenAI、Google DeepMind、Harmonic 以及专门从事定理证明的团队,如今面临更高的证据标准。
一项可信的展示需要透明的成果材料、专家审查,以及对人类参与情况的精确说明。缺少这些要素的戏剧性主张将招致怀疑。
研究机构还面临另一种压力:评估能力。如果智能体能够产出数千篇看似可信的技术论文,专家注意力就会成为稀缺资源。
同行评审本就依赖无偿或报酬有限的专家劳动。即使其中只有一小部分包含有价值的结果,AI 生成的投稿也可能压垮这一体系。
瓶颈可能会从产出候选证明转向筛选它们。数学界将需要更好的分诊方法,以排除常见错误,同时不丢弃不同寻常但有效的论证。
形式化验证可以承担这项负担的一部分。它无法独立评估新颖性、论述质量、相关性,或一项形式化陈述是否准确捕捉了预期的研究问题。
专家可能会越来越多地处理分层证据。一份投稿在送达人类审稿人前,可能包含自动化检查、溯源记录、依赖图和对抗性审查。
同样的方法也会影响技术组织。使用 AI 开展研究的团队将需要可追溯的来源和被保留的中间决策。
当推理过程分散在数百万个生成 token 中时,结果就会变得难以审计。可搜索的研究记录将与最终答案同样重要。
知识工作者已经面临这个问题的缩小版。他们必须将源材料、模型输出、会议决策和后续修订联系起来,同时不丢失溯源信息。
结构化的 AI knowledge base 可以支持这一过程,尽管它本身无法验证高等数学。它的作用是保存证据,并让推理轨迹可被检索。
Claude 的这次运行也挑战了“模型只是检索记忆中的解法”这一常见说法。精确的综合过程可能仍高度依赖已知论文,但显然并不存在一个可供检索的既有解答。
重组并不能证明其具有人类意义上的深刻理解。但当所得论证经得起形式化和专家检验时,它仍是一种有用的研究能力。
最有力的解释并不需要宣称 Claude 像数学家一样思考。它只需要指出,该系统产出了一项值得严肃数学审查的候选定理。
这一门槛似乎已经被跨越。余下的争论关乎这一过程能否在不同问题上可靠复现,以及每次成功需要消耗多少专家劳动。
Anthropic Claude 主张之后应关注什么
三个信号将决定这会成为持久成果,还是一次令人印象深刻却孤立的展示。
第一个信号是独立的数学验证。专家必须核查精确定理、重建解析估计,并确认没有未说明的条件进入证明。
来自 Anthropic 外部研究人员的一致认可将增强这项主张。对常数、范围或假设的修正会削弱它,但未必抹去全部贡献。
第二个信号是完整发布形式化材料。公开的 Lean 仓库应展示定理陈述、导入的库、公理和构建说明。
研究人员需要确认,形式化覆盖了承重的解析步骤。若有效证明仅涵盖代数或组合核心,将提供更有限的保证。
第三个信号是在另一个开放研究问题上的复现。一项广受关注的成果无法证明一种可靠的科学能力。
重复出现的模式会更有说服力。系统应识别有用的中间定理,记录现有技术检索,经受专家审查,并产出可复用的形式化成果。
复现还应澄清资源需求。Anthropic 报告称,过程使用了约 60 个子智能体、3,100 万个输出 token,以及一天半的协调工作。
这些数字表明使用了大量测试时计算。研究人员需要了解,更大的智能体群是否能持续提高成功率,还是仅仅生成更多看似可信的错误。
这一结果还提出了一个短期产品问题。Anthropic 使用的是未发布的研究模型,因此普通 Claude 用户不能假定其当前界面具备相同能力。
除基础模型外,编排环境也可能发挥了作用。工具访问、持久上下文、子智能体管理、数值软件和文献检索都促成了这一结果。
未来公告应区分模型能力与系统工程。一个只能在精心设计的研究框架中成功的模型,与独立聊天机器人代表的是不同产品。
读者还应关注 Anthropic 如何处理归属。最终论文应使每一个人类来源和复用定理都易于识别。
清晰的归属将增强 AI 辅助研究的论据。它将表明,大规模文献综合能够尊重其所依赖的知识结构。
最重要的不确定性并不是 Claude 是否“解决了黎曼猜想的 67.2%”。这种表述在数学上是错误的。
不确定性在于,AI 是否能反复将失败的宏大尝试转化为正确、新颖且可理解的部分成果。这一事件提供了异常有力的证据,但并非最终答案。
对于开发者和技术领导者而言,实际教训应保持审慎。当自主智能体的工作能够依据严格的外部标准进行检验时,它们会变得更有价值。
对数学家而言,眼下的任务并不陌生:阅读证明,核对定义,追溯依赖关系,并尝试找出论证中的漏洞。
如果这一结果经受住了这套检验流程,anthropic claude 即使未能证明促使这项工作开展的那个著名猜想,也将贡献出一条真正的定理。相比耸人听闻的说法,这一更为有限的成就或许更能揭示 AI 研究的意义。


