top of page

Claude 对黎曼假设的失败尝试带来了另一项成果

Anthropic 给一款尚未发布的 Claude 模型布置了一项近乎不合理的任务,但这次失败却带来了一项该公司称数学家认为值得核验的结果。这则关于 Anthropic 的科技热议,涉及对黎曼假设的一次严肃尝试——这是一个有关 ζ 函数零点的著名未解问题。Claude 并没有解决它。

不过,Anthropic 表示,该模型找到了一种提高长期下界的方法。该下界涉及已知位于这一假设临界线上的相关零点所占比例。根据 Anthropic 的说法,这一数字从 41.6% 提升至 67.2%。

这种数值跃升听起来比实际情况更接近解决问题。即使一项陈述覆盖了几乎所有零点,也未必能证明每一个零点都位于这条线上。因此,真正的冲突并非 Claude 对抗某个著名猜想,而是自主探索与研究数学严苛验证标准之间的冲突。

Anthropic 的实验也出现在多项广受关注的 AI 辅助数学研究展示之后。OpenAI、Google DeepMind 与学术团队日益频繁地在奥赛题目、形式化证明和开放研究问题上测试模型。这个案例超越了基准测试式的答案,因为据报道 Claude 自行选择研究路径、协调其他代理、检索论文,并对自己的结果提出质疑。

这一结果的重要性恰恰在于原始任务失败了。传统基准测试会将其记为一次失误。但当失败路径揭示出另一项成果时,研究过程仍可能产生价值,前提是独立专家能够确认该结果正确且具有新颖性。

Anthropic 科技热议标题实际描述的是什么

Claude 并未解决黎曼假设的一部分;据报道,它针对一个相关下界得出了更强的结果。

黎曼假设预测,黎曼 ζ 函数的每一个非平凡零点都位于实部为二分之一的一条垂直线上。ζ 函数将复分析与素数分布联系起来。其非平凡零点决定了数学家能够多精确地描述素数之间的不规则性。

这一问题可追溯至 Bernhard Riemann 于 1859 年发表的论文。它也是一个 千禧年难题,即 Clay Mathematics Institute 著名的七项挑战之一。这一地位解释了它为何备受关注,但也可能助长对渐进式进展的误导性简述。

数学家早已知道,无穷多个零点位于临界线上。他们也已证明了位于该线上的零点比例的下界。在 Anthropic 所报告的工作之前,相关的无条件下界约为 41.6%。

Anthropic 表示,Claude 综合了多位数学家先前工作的思路,其中包括 Brian Conrey、Dan Goldston、Kyle Pratt 以及其他数论研究人员。据称,其提出的论证将该下界提高至 67.2%。该公司在其 研究说明 中介绍了这一结果,同时谨慎地说明 Claude 并未解决原始假设。

其中的区别涉及自然密度,它描述了当研究人员考察临界带中更高处的零点时,具有某一性质的零点所占的极限比例。67.2% 的下界意味着,在该定理的条件下,至少有这一比例的零点位于该线上。它并不代表黎曼假设已完成 67.2%。

假设在线外存在一组例外零点,但在完整序列中它们的密度为零。即便不排除每一个例外,密度陈述仍可能趋近于 100%。而这一假设要求的是关于所有非平凡零点的全称陈述,而不是渐近意义上的多数结论。

计算机已经在极大的有限范围内完成检验,未发现任何线外零点。一项已发表的计算验证确认该假设在高度达到三万亿之前均成立。这一证据令人印象深刻,但检验任何有限范围都无法证明一个无限命题。

Claude 所报告的结果属于构建定理的一侧,而不仅仅是数值检验的一侧。据称,该模型提出了一项渐近适用的论证,而不是再检查一批零点。正因如此,这一主张值得关注,尽管它距离解决黎曼问题仍相去甚远。

Anthropic 尚未披露该模型面向公众的产品名称,因为它将这一系统描述为尚未发布的研究版本。因此,读者无法使用普遍可获得的 Claude 版本复现实验。即便由此产生的论文可以被独立评估,这仍限制了外界对模型本身的评估。

因此,公众应从两个层面理解这一主张。其一是数学陈述,专业人士可以审查、复现并可能提出质疑。另一个层面则是 Anthropic 对模型在发现过程中自主完成了多少工作的说明。

这两个层面需要不同的证据。一篇正确的论文能够支持数学结果,但不会自动验证关于提示词、代理协调、失败思路或人工参与的每一项操作性主张。

这次失败尝试成为一项自主研究测试

值得注意的变化并不是一个被解决的猜想,而是一个据称将开放式失败转化为可检验研究贡献的系统。

根据该公司的说法,Anthropic 员工 Jarred Sumner 发起了这一项目。Sumner 是一名软件工程师,也是 Bun JavaScript runtime 的创始人,而非解析数论专家。据报道,他最初要求 Claude 对该问题进行严肃尝试。

根据 Anthropic 的说法,该模型最初生成并测试了大约 650 个想法,没有一个解决了指定挑战。这个失败阶段很重要,因为它将这一实验与围绕单一路径精心安排的演示区分开来。

据称,Claude 随后花费约一天半时间协调了约 60 个子代理。子代理是被分配到有边界的研究或验证任务上的另一个模型实例。据称,该团队执行了约 2,400 条 shell 命令,并生成数百个 Python 脚本。

Anthropic 表示,这些代理针对已知零点进行了数千次数值检查。它们还审阅拟议论证、寻找反例,并尝试独立复现最强结果。该系统在两次 Claude Code 会话中,据称生成了约 3,100 万个输出 token。

这些数字描述的是规模,而非正确性。更多代理和更多 token 会增加系统能够探索的路径数量,但也会创造更多重复犯错、隐藏依赖,以及具有相似弱点的模型之间形成表面共识的机会。

有用的机制是结构化分歧。一个代理提出引理,另一个则寻找反例,或在不依赖原始推导的情况下重建证明。这类似于对抗性审查,尽管当审查者共享训练数据与架构时,它们并不是真正独立的。

据 Anthropic 称,Claude 还下载了 54 篇 arXiv 论文,以核查该结果或其组成部分是否已经存在。文献检索至关重要,因为重新发现一项已知定理与产出新结果并不相同。仅靠引文匹配无法确定新颖性,尤其是在不同论文术语存在差异时。

不过,这一据报道的工作流不只是一次漫长的聊天机器人对话。它结合了符号推理、可执行实验、文档检索、委托审查和形式化。这种组合使语言模型成为一组研究工具的协调者。

这种协调方式与 Anthropic 更广泛的动态工作流研究相似。该公司曾描述 Claude 协调多个代理完成大规模软件迁移,其中包括对 Bun 的一次重大重写。该数学项目将类似的运行模式应用于定义、引理、数值测试与既有文献。

因此,这次 Claude 对黎曼假设的尝试,测试的不仅是原始数学能力,也包括持续性。大多数基准问题在模型给出一次回答后便告结束。而据称,该系统在数百个没有产出的方向上持续推进,随后才将努力重新导向一个更狭窄的主张。

人类研究人员也会做类似的事:一个雄心勃勃的项目未能产出预期定理,却得到了一条有用的引理。不同之处在于速度与广度。一组代理可以在不感到疲倦的情况下考察许多变体、运行计算并交叉核验参考文献。

数量并不能消除判断的必要。仍然需要有人决定一项附带结果是否有意义、假设是否匹配,以及一个证明是否推动了既有文献。因此,这项实验是在更大的人类验证体系中,对 AI 数学研究的一次测试。

为什么 67.2% 并不等于解决了 67.2%

核心的反转在于数学本身:更大的比例可以构成一项真实定理,却不意味着按比例更接近证明这一全称主张。

通俗总结自然会聚焦于从 41.6% 到 67.2% 的变化。这一增长具体、容易记忆,也比涉及平滑函数与零密度估计的技术论证更易于传播。但它也容易引发错误的思维模型。

平滑函数是一种经过精心构造的辅助函数,用于控制 ζ 函数的平均值,并揭示其零点的信息。研究人员会选择其形式和长度,以使困难表达式变得可处理。改进通常依赖于组合不同估计,同时避免误差项淹没主要结果。

证明至少 67.2% 的零点位于该线上,并不等同于核验一份无限清单中的前 67.2%。自然密度描述的是在不断扩展的范围中的行为。一个稀疏的例外集合即使仍包含无穷多个元素,也可能在极限比例中不可见。

这种差异类似于关于整数的陈述。素数在正整数中的自然密度为零,但素数仍然有无穷多个。因此,一项性质可以在密度意义上对 100% 的对象成立,同时依然存在例外。

对于黎曼假设而言,只要有一个非平凡零点位于线外,就足以推翻该猜想。关于极大比例的定理无法排除那一个反例。这正是专业人士反对将该结果描述为“解决了 67.2% 的假设”的原因。

这一结果仍可能很重要。提高无条件下界可能需要更精确的估计、更优地组合既有技术,或发现不同论文之间此前未被注意到的兼容性。它的价值取决于方法本身,以及其他研究人员能够从中推导出什么。

Anthropic 表示,Claude 组合了既有工作,而非创造出一套全新的数学框架。这一描述应当淡化关于机器原创性的主张。当这种组合产生新定理时,重新组合已知想法仍然可以构成原创研究。

数学中有许多通过综合实现进展的例子。一项证明可以是新颖的,因为此前没有人意识到现有工具能够以某种特定方式结合。决定性问题不在于每一种要素是否都是新的,而在于该论证及结果此前是否未知。

这个问题需要进行全面的文献综述。Claude 对 54 篇论文的检索具有参考价值,但无法保证完整性。论文使用不同的记号,未发表的工作可能在私下流传,而较早的成果也可能出现在 arXiv 之外的书籍或会议论文集中。

Anthropic 的 techmeme 表述还压缩了 zeta 研究中其他地方出现的不同百分比。有些已发表结果涉及附加假设下的简单零点。另一些则涉及没有这些假设的临界线上的零点。相近的数字可能对应技术上不同的陈述。

因此,负责任的解读必须保留定理的精确表述。假设条件、被计数零点的定义、极限过程以及不等式是否严格,都至关重要。一个小小的不匹配,就可能让看似的改进变成对既有工作的重述。

Anthropic 表示,其两名数学家审阅了这项结果。公司还点名数论学家 Brian Conrey 和 Dan Goldston,称他们作为外部专家审阅了论文。专家审查提供了有意义的证据,但这并不等同于完成期刊同行评审。

这个故事最强的版本仍以验证为前提。据报道,Claude 生成了一项重要的数学主张,而了解该领域的人类认为它足够可信,值得认真审查。论文的后续反响将决定该结果是否成为被接受的数学知识。

形式化验证有帮助,但不能解决一切

经过机器检查的证明可以验证逻辑步骤,但新颖性、重要性以及是否忠实转译,仍需人类判断。

Anthropic 表示,Claude 使用证明助手 Lean 对该结果进行了形式化;Lean 会检查每一步形式化推导是否遵循已声明的规则和此前的陈述。Lean 检查成功,能大幅降低形式化论证中存在普通逻辑漏洞的风险。

形式化验证比让同一个模型重读自己的文字提供了更强的保障。证明助手不会因为某一步听起来合理就接受它。它会针对可信逻辑内核,验证一个被精确编码的项。

这种保障也有边界。Lean 检查的是实际被编码的定理。如果形式化陈述与论文意图中的定理不同,证明仍可能通过,却无法确立公开宣称的结论。

定义和假设尤其重要。一个形式化定理可能包含散文表述不清的条件,或者只形式化了一个困难引理。读者需要了解机械化验证结果的范围,才能将“已在 Lean 中验证”视为普遍保证。

形式化也不能证明新颖性。Lean 无法判断某个定理是否早在数十年前就以不同记号出现。它也无法判断专家是否认为这项改进在概念上重要,还是仅属技术性常规工作。

尽管如此,该项目仍展示了为何证明助手正成为 AI 数学研究的核心。语言模型可以生成流畅但无效的论证。形式化系统提供了一个严格接口,使看似合理的文字必须转化为明确的数学。

这种组合改变了实际研究循环。模型可以提出策略,用 Python 测试示例,在 Lean 中编码关键陈述,并将失败反馈到搜索过程中。每种工具都能捕捉不同类型的错误。

数值检查可以暴露明显的反例,但无法确立无限命题。文献检索可以检验新颖性,但可能遗漏冷门来源。代理审查能够质疑推理,但也可能复制共同偏见。形式化验证检查编码后的逻辑,但依赖于正确的规格说明。

人类专家仍负责整合这些信号。他们评估形式化陈述是否符合预期数学内容,也评估原创性、相关性、表述质量以及与既有工作的联系。

由于 Anthropic 在将 Claude 呈现为有能力的研究系统方面具有商业利益,验证链就显得更加重要。这并不会使该主张失效,但意味着不应把公司的操作说明视为独立证据。

尚未发布的模型带来了另一层不确定性。外部研究者可以审查论文及其形式化证明,却无法测试生成它们的精确系统。他们目前还无法衡量类似运行失败、重新发现已知结果或生成看似可信的错误线索的频率。

单一成功案例对基础发生率也说明不了太多。Anthropic 称本次运行中出现了数百个失败想法,但更广泛的分母仍然未知。公司尚未公开说明,在选中这个示例前究竟尝试了多少开放问题。

选择效应对任何前沿模型演示都很重要。如果实验室尝试许多问题并发布最强结果,公开案例就可能夸大典型可靠性。研究者需要重复、前瞻性记录的实验来估计其实用性。

这并不会将结果简单归为营销。它指出了从令人印象深刻的案例研究迈向可靠科学方法所需的证据。可复现的工件、详细的提示记录和独立复现,都能显著加强这一主张。

Anthropic 正在推动基准测试和研究工作流变革

这项实验迫使 AI 实验室展示有成效的研究行为,而不仅仅是在固定数学测试中取得更高分数。

数学基准测试提供了一些最清晰的模型进展衡量指标。竞赛题目有已知答案、简洁的评分方式和不同难度。相较于许多对话式评估,它们更直接地检验推理能力。

Google DeepMind 的 AlphaProof 和 AlphaGeometry 展示了通过形式推理与专门系统实现的另一条路径。前沿语言模型开发者也报告了在国际数学奥林匹克竞赛题目上的高表现。这些成就衡量的是模型能否在受控条件下解决经过精心挑选的问题。

开放研究则不同。答案未知,文献并不完整,甚至连正确的中间问题都可能不明确。一个有用的系统必须决定尝试什么、识别失败、恢复推进,并产出可供专家审计的工件。

Claude 的黎曼猜想项目涉及这一更广泛的循环。据报道,它的贡献并非来自回答最初的提示,而是来自识别出一个旁支结果值得进行集中开发。

这种行为挑战了 Anthropic、OpenAI 和 Google 之间以基准为先的竞争。一个模型可以取得很高分数,却仍不擅长持续研究。反过来,一个未能解决头条问题的系统,也可能通过发现有用的引理或反例创造价值。

该案例还将关注点从单一模型回复转向周围的研究基础设施。Claude 可以使用 shell 命令、代码执行、论文、多个代理以及形式化证明环境。结果属于这一完整系统。

这一区分对企业和学术买家很重要。仅根据基准分数选择模型,会忽视检索质量、工具使用、验证、可观测性和工作流控制。这些能力决定了一项长期运行的研究任务能否产出可审计的工作。

知识管理也成为问题的一部分。研究代理必须在数百万 token 的跨度中追踪假设、失败方向、来源、数值证据和审稿人异议。人类团队在评估机器生成的工作时也面临同样挑战。

可搜索的 AI knowledge base 可以帮助研究者保留这条证据链。它无法验证数学,但可以让主张与源论文、实验和审查决定保持关联。

开发者还应注意这一技术成果背后隐藏的经济成本。三千一百万个输出 token 和数十个代理代表着大量计算。Anthropic 尚未提供这一研究模型,文章不应假定该工作流对普通用户而言具备经济性。

因此,竞争问题比哪家公司拥有最聪明的模型更广泛。它关乎哪家实验室能将推理转化为可重复、可验证的研究,同时又不让人类监督变得难以管理。

OpenAI 和 Google 面临压力,需要从真正开放式任务中发布可比证据。Anthropic 则面临压力,需要提供足够的工件,让外部人士能够区分科学能力与经过选择性呈现的演示。

数学家面临的是另一种压力。他们必须决定如何归属机器辅助工作、记录计算搜索,以及审查以机器速度生成的证明。传统同行评审并非为大量看似可信、且有广泛自动化实验支持的手稿而设计。

一个学术团队很快就可能生成多于专家可评估数量的候选论证。这会造成验证瓶颈。稀缺资源将成为可信专家的注意力,而不再只是创意生成本身。

因此,AI 数学研究的更广泛前景与分流密不可分。系统必须对自身发现进行排序、暴露薄弱步骤,并高效打包证据。否则,廉价生成可能会给科学界带来昂贵的审查成本。

Anthropic 的工作流指向了一种可能答案:将提出想法的代理与批判性代理分开,使用可执行检查,检索文献,并形式化核心主张。该方法合理,但独立证据必须证明它筛除错误的可靠程度。

三个信号将决定这一结果能否延续

下一阶段不是又一次戏剧性的提示,而是独立验证、可复现性,以及证明该工作流能够泛化的证据。

第一个信号是数学界对完整论文和形式化工件的回应。专家必须验证定理的假设条件,将其与早期界进行比较,并审查既有技术的组合。

修正并不会让实验失去价值,但会改变其教训。一个微妙漏洞将表明,大型代理集群和形式化工具仍需要更强的规格控制。广泛接受则将支持 Anthropic 的主张:Claude 产出了一项正当的研究结果。

发表或持续的专家认可将加强 Anthropic 的 techmeme 叙事。新颖性争议、定理被削弱或证明被撤回则会削弱它。决定性证据应来自公司外部的研究者。

第二个信号是可复现性。Anthropic 应发布足够的信息来重建推理路径,包括论文、Lean 代码、计算脚本以及对人类干预的清晰说明。

精确的模型权重可能仍无法获得,但研究工件仍可让结果接受审查。独立团队应能够使用标准工具重新运行数值检查并验证形式化证明。

过程记录很重要,因为该实验对自主性作出了主张。研究者需要区分模型生成的选择与人类修正、隐藏的专家提示以及编辑性重构。没有这类记录,只有最终的数学主张能够被独立评估。

第三个信号是在新问题上的泛化能力。一个成功的旁支结果无法证明自主代理能够可靠地推动数学发展。Anthropic 或其他实验室必须报告包含失败与成功的前瞻性研究。

有助于衡量的指标包括:真正产出新结果的项目占比、验证所需的专家时间,以及看似合理但实际错误的主张出现的频率。另一个重要指标是,这些系统是否能引入新技术,还是主要在重组已知方法。

不同领域的结果尤其具有参考价值。解析数论侧重符号操作、文献综合和大规模计算搜索;几何学、拓扑学、概率论和应用数学则带来不同的验证要求。

在这些证据逐步积累的过程中,读者应避免两个轻率的结论。Claude 未能解决黎曼猜想,并不意味着这次运行毫无意义。报道中提到的 67.2% 上界,也并不表明完整证明已近在咫尺。

更有力的解读介于这两个极端之间。Anthropic 似乎测试了一款尚未发布的模型,用于处理一个开放问题,并得到了一个在初步专家审查后仍站得住脚的更窄范围结论。如果支撑这一结论的材料经得起检验,这就是一个有意义的研究信号。

对开发者而言,实际的启示在于工作流设计。长时间运行的智能体需要检索、可执行测试、对抗性审查和可持久保存的记录。仅有流畅的回答,并不构成一个研究系统。

对知识工作者而言,这个案例说明:只要 AI 要综合大量文档和中间结论,可追溯性就至关重要。支持知识融合的工具可以组织证据,但领域专家仍须判断这些证据究竟能够证明什么。

对数学家而言,眼下的问题很具体:这份证明能否经受细读,其方法是否打开了另一条路径?对 AI 用户而言,问题则更广泛:同样的流程能否在不依赖前沿实验室私有基础设施的情况下,产出有用的发现?

Anthropic 的 Techmeme 标题捕捉到了一次引人注目的失败和一个出人意料的结果。更长久的故事将取决于标题之后发生的事:独立专家检验该定理,以及实验室公开完整的研究过程。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page