Anthropic 表示,其 Claude 九圈振幅计算超越了物理学的八圈纪录
Anthropic 表示,Claude 完成的一项九圈振幅计算,将一项高度专业化的理论物理成果推进到此前八圈纪录之外。该公司称,Claude 在收到一条初始提示后,基本在无人监督的情况下工作了数天。
这项计算涉及平面 N=4 超杨-米尔斯理论中的六粒子散射。这一高度对称的模型并非对自然界的直接描述。物理学家将其作为受控环境,用于发展能够揭示量子场论隐藏结构的方法。
这一区别至关重要。Anthropic 并未声称 Claude 预测了新粒子,或解释了某项实验异常。该公司表示,一名 AI 智能体扩展了一项艰难的符号计算,而在这一研究领域中,复杂度会随每增加一圈而急剧上升。
这一结果对 AI 在科学中的一个更狭义但重要的假设提出了挑战。此前,许多令人印象深刻的案例依赖于经过精心限定的基准测试、大量人工指导,或答案易于检验的问题。这项任务由外部物理学家提出,处于已发表研究的前沿之外,并需要一长串技术决策。
不过,目前公开的证据尚不能等同于附有完整可复现性材料包的同行评审科学论文。Anthropic 的说明、挑战者的评估和专家核验提供了有意义的证据,但尚不足以确定另一团队能够多频繁地复现这一结果。
Anthropic 称 Claude 实际计算了什么
核心主张很明确:Claude 在一个简化的量子场论中,将已知的六粒子振幅从八圈扩展到了九圈。
散射振幅是一种用于计算粒子如何相互作用的数学对象。物理学家通常将其近似表示为一个级数,每增加一圈,就代表更高阶的量子修正。
更多的圈数可提供更多信息,但表达式的构造难度会急剧上升。挑战并不只是给现有公式再加一行。每一阶都会扩展可能函数、约束条件和一致性检验的空间。
目标是一个最大螺旋度破缺(MHV)六粒子振幅。MHV 指粒子螺旋度的一种特定排列方式,它比许多替代情形更简单,但仍保有丰富的数学结构。
所用理论是平面 N=4 超杨-米尔斯理论。“平面”意味着该计算保留了在大颜色数极限下占主导地位、且可绘制为线条不交叉的贡献。N=4 则描述了该理论异常高程度的超对称性。
这些性质使该模型比描述夸克和胶子的理论——量子色动力学——受到更多约束。它们也使其成为检验振幅、对称性、几何和数学结构相关思想的重要实验室。
Anthropic 在一篇题为 Claude and nine loops 的客座文章中公布了这一结果。物理学家兼科学作家 Matt von Hippel 介绍了他的公开挑战如何传达至该公司的研究人员。
Von Hippel 曾询问,AI 系统能否利用学术团队可获得的计算资源,计算九圈六粒子振幅。他的挑战刻意瞄准了一个尚未解决、但定义清晰的问题。
此前的前沿并非假设性的。Lance Dixon 和 Yu-Ting Liu 于 2023 年利用反极对偶性发表了一项 eight-loop amplitude,该方法将振幅与另一种称为形状因子的数学对象联系起来。
这项计算通过了涉及多个重要运动学极限的检验。它既创下了一项纪录,也为九圈工作奠定了可延伸的基础。
Anthropic 称,Claude 使用了 Dixon 及其合作者开发的方法,而非发明一个无关的新理论。该公司表示,系统找到了两条相互独立的路径,并得出了相符的答案。
不同方法之间的一致性很有价值,因为它降低了出现简单实现错误的概率。它不能取代外部复现,但比展示一个未经检验的表达式更有说服力。
因此,这一结果的范围很清楚。据称,Claude 在一个高度结构化的模型中推进了一项特定符号计算。它并未普遍解决散射振幅问题、取代实验物理学,或确立一条新的基本定律。
为什么 Claude 的九圈振幅很重要
这个故事最具影响力的部分,不只是多出的一圈,而是一个智能体据称如何跨越了计算边界。
Von Hippel 将这一问题视为检验 AI 能否在其原先专业领域完成有意义工作的测试。他的 original challenge 将真正的研究进展与课堂练习或熟悉的推导区分开来。
他选择振幅,是因为高圈计算将数学判断与大量计算结合在一起。已知方法可以指向解法,但将其应用于下一阶,仍可能需要专家投入数年时间。
这使该结果不同于 AI 对既有物理学给出看似合理的解释。一篇流畅的总结可能掩盖错误,因为读者未必会检查每一个方程。前沿计算面临更严苛的约束。
最终对象必须遵守已知的对称性和物理极限。不同的构造路径应得出一致结果。专家可以将其与低圈阶数继承下来的结构进行比较。
Anthropic 表示,Claude 通过 Claude Science 收到了一条描述问题的提示,随后基本在无人监督的情况下运行数日。Claude Science 是一个研究框架,使模型能够使用工具、管理中间工作,并在多个推理周期中持续推进。
“一条提示”不应被误解为一次模型回复。该框架提供了一个环境,使 Claude 能够编写代码、运行计算、检查失败,并修正其方法。
这一区别对于理解这一成就至关重要。相关系统不只是一个凭记忆作答的语言模型,而是嵌入计算工作流中的智能体。
底层模型能够解读论文并制定技术步骤。外部工具可以执行精确代数、操作大型表达式,或测试候选结果。该框架则能够在持续数日的项目中保留状态。
all-loop integrand 文献已为平面 N=4 超杨-米尔斯振幅提供了深厚的结构性知识。后来的 bootstrap 方法利用对称性、解析性和极限行为来约束可能的答案,而无需计算每一张费曼图。
据称,Claude 组装并应用了这些累积而来的工具体系。这依然很重要。科学工作往往通过有效运用既有技术取得进展,而非依靠完全新理论的孤立灵光一现。
这一结果也检验了长程可靠性。研究智能体必须追踪假设、文件、中间表达式和验证步骤。一个错误的约定就可能污染之后的所有工作。
长期项目会暴露短期基准测试遗漏的弱点。模型可能忘记某项选择的原因、接受有缺陷的中间结果,或针对不完整的测试进行优化。
一次成功运行表明,经过精心设计的科学环境可以弥补其中部分弱点。持久化文件、可执行检验和明确的进度追踪,会将推理转化为可检查的工作。
这种机制的重要性远不止于振幅物理学。材料建模、定理探索、计算化学和算法设计,都包含具有长链条、可验证中间状态的任务。
因此,可迁移的经验在于研究架构。当一个能力强大的模型配合领域文献、精确工具、持久状态,以及能够排除看似有吸引力错误的测试时,它会变得更有用。
真正的竞争是智能体研究与专家主导计算之间的竞争
主要的张力不在于 Claude 与某一位物理学家之间,而在于自主研究工作流与传统专家主导计算流程之间。
高圈振幅项目通常依赖于由专家组成的小型团队。这些研究人员开发函数空间、识别有用的对偶性、编写专用代码,并决定哪些一致性条件具有决定性意义。
这一过程包含多年积累的判断力。最终论文或许展现出一条简洁的路径,但这条路径建立在关于哪些计算值得尝试的大量知识之上。
Anthropic 的说明暗示了一种不同的劳动分配。人类研究人员选择问题并搭建运行环境。随后,Claude 负责了延展搜索、实现和检验过程中的很大一部分工作。
这并不是科学的完全自动化。人类仍提供了目标、工具和文献访问,以及能够维持整个运行过程的框架。专家也在之后评估了结果。
但这种努力分工似乎有实质性不同。据称,该智能体执行了一个通常需要持续、专业化人类关注的项目。
这给研究团队、AI 实验室和科学软件开发者带来了压力。各方现在都必须思考,专家计算中的哪些部分可以被转化为智能体可读的程序。
对学术团队而言,眼前的机会在于提高产出效率。智能体可以探索替代性的 ansatz、重复运行检验,并记录失败分支,而研究人员则专注于解释结果。
Ansatz 是受已知数学性质约束的结构化猜测。在振幅 bootstrap 中,研究人员会缩小庞大的候选空间,直到某个函数满足所有必要条件。
智能体可能很适合这类工作,因为这一过程混合了文献检索、代码生成、符号操作和迭代测试。每一步都可以留下供另一程序或人员检查的产物。
对于 AI 实验室而言,这一结果提出了更棘手的评估问题。一个选定问题上的惊人成功,并不能揭示系统在同类问题中的成功率。
Anthropic 此前曾强调,智能体评估既需要可验证的结果,也需要重复试验。其自身的 agent evaluation guidance 区分了多次尝试中取得一次成功,与持续稳定地取得成功。
这一区别同样适用于此处。公开叙述描述了一条成功轨迹,但尚未说明有多少种方法失败,也没有确定结果对各种条件的敏感程度。
科学软件团队则面临另一类压力。如果通用研究智能体能够有效操作专业代数系统,围绕这些工具的接口就会变得具有战略重要性。
文档、机器可读的错误信息、检查点机制和可复现环境的重要性,可能与原始执行速度不相上下。仅为专家交互式使用而设计的工具,可能更难让智能体安全控制。
历史性的对比并非 AI 取代符号软件。数十年来,程序一直在协助振幅计算。变化在于,语言模型智能体有可能决定使用何种工具、解读其输出,并重新调整项目方向。
这种编排层才是新的主张。它将自然语言形式的科学目标,与过去需要专家持续监督的程序库和验证流程连接起来。
最有力的解读并不是 Claude 比该领域更懂物理。相反,据称 Claude 是以足够有效的方式协调了现有物理知识与计算,从而将该领域已发表的结果向前推进。
独立验证能够和不能证明什么
专家核查提升了这一主张的可信度,但可复现性所需的不止是一位受尊敬的物理学家审阅答案。
Anthropic 表示,Lance Dixon 独立验证了九圈结果。Dixon 是尤其合适的评估者,因为他曾共同完成已发表的八圈计算,而该计算界定了此前的前沿。
他的参与使这项核查具有相当分量。他了解振幅的数学结构、此前的构造方式,以及有效扩展应当满足的边界。
“独立验证”这一说法仍需谨慎解读。它可能意味着根据约束条件检查最终表达式、复现部分数值,或通过另一套流程推导结果。
这些并不是同等程度的验证。Anthropic 的公开摘要本身并未说明验证流程的全部细节。
两种相互一致的内部推导也会增强可信度。如果它们的假设与代码路径存在足够差异,这种一致性就能成为防范偶然错误的有力保障。
然而,所谓独立的方法也可能共享隐藏依赖。它们可能采用相同的基底、导入数据、约定或存在缺陷的中间产物。
常规的科学发布会让外部团队检查这些依赖关系。研究人员可以审阅确切的提示词、代码、工具版本、中间文件和测试。
在发表时,面向公众的叙述应被视为一项可信的已报告结果,而非已经形成的社区共识。经过同行评审的论文和可复用的工件包,将缩小剩余差距。
验证问题还延伸至署名。Claude 可能生成了代码并选择了策略,但人类定义了环境,并决定输出是否构成一项结果。
读者需要一份清晰的贡献记录。它应区分初始提示词、后续人工干预、模型生成的方法、继承而来的算法,以及专家验证。
这并非文书细节。归属有助于其他研究人员理解,究竟是哪种能力产出了这一结果。
如果关键步骤来自编码了专家解题策略的提示词,那么这个故事关乎规模化执行。如果 Claude 在阅读文献后自行选择策略,结果则表明其具备更广泛的研究自主性。
如果系统每次停滞时都由人类重新引导,这项工作更接近紧密协作。如果人工干预仅限于运行监控,自主性的主张就更有说服力。
“无监督”一词可能掩盖这些差异。一个系统可以在没有实时指导的情况下运行,同时仍依赖大量脚手架、精心筛选的资源以及预先编写的验证规则。
因此,科学界应要求提供运行级别的记录,而不只是最终公式。一份有用的记录应展示 Claude 何时改变方向、哪些测试失败,以及人类提供了哪些信息。
此类文档还能揭示流程是否具有泛化能力。研究人员可以将工作流改用于另一种振幅,或用一个答案被隐藏的问题来测试它。
验证缺口不应抹去这项已报告的成就。它应决定人们对更广泛结论赋予多高的置信度。
目前最稳妥的判断应当是审慎而有限的。Anthropic 展示了一项在技术上可信的结果,将其关联到一项公认的开放挑战,并报告称此前纪录的保持者进行了审查。
至于研究智能体能否可靠地跨越计算前沿这一更宏大的主张,则需要在透明条件下反复得到验证。
为什么这还不是一项通用物理学突破
平面 N=4 超杨-米尔斯理论中的结果,并不会自动迁移到实验上更现实的粒子物理学。
这一理论的价值,部分在于其对称性使原本难以承受的计算变得可处理。它充当理论试验台,让某些结构先显现出来,研究人员再到其他领域寻找相关思路。
真实的对撞机预测往往涉及量子色动力学。QCD 的简化对称性更少,尺度更多,且存在与可观测过程相关的复杂相互作用。
从简化模型中的九圈结果,转向可比的 QCD 计算,并非例行替换。相关函数空间与约束条件可能发生显著变化。
更高的圈阶也不总会立即带来实际价值。研究人员可能利用该结果检验猜想、研究全阶模式,或加深对振幅几何的理解。
这些贡献即使不会在明年影响某项实验,依然可能十分重要。这项工作首先属于数学与理论物理,之后才属于现象学。
这一局限也进一步凸显了结果真正的意义。Anthropic 并未选择一个简单的理论,但它选择了一个具有强大形式结构和精确检验手段的领域。
这种组合有利于 AI 智能体。相关文献丰富,研究对象是数字化的,候选答案也面临精确约束。
其他科学领域往往不具备这些条件。生物学智能体必须应对带噪测量、不完整模型和耗时实验。材料智能体可能依赖昂贵的实体验证。
因此,Claude 的九圈振幅为某一类研究问题提供了证据。它对开放式的实证发现所能说明的则较少。
此外还存在选择偏差的风险。AI 实验室可以尝试许多问题,然后公布最令人印象深刻的成功案例。若不报告尝试的整体分布,读者无法估计基准可靠性。
一次成功计算可能反映出一个总体能力很强的系统,也可能只是反映了一个异常契合的问题、有效的脚手架和幸运的搜索轨迹。
这些可能性并不相互排斥。一个问题可以非常适合智能体,而由此体现的能力依然重要。
恰当的比较对象,是其他同时具备密集文献、可编程工具和客观验证条件的前沿任务。形式数学和密码分析提供了相关案例。
Anthropic 曾报告 Claude 协助发现了密码学弱点。该项目同样依赖长时间工具使用、计算测试和大量人工验证。
综合来看,这些项目表明了一种深思熟虑的策略。Anthropic 正在用这样的研究问题测试 Claude:智能体既能生成工件,也能由专家排除错误答案。
这比依赖具有说服力的文字更具信息价值。同时,它也为未来的公告设定了严格标准。
下一批结果应证明,这种方法是否能在精心结构化的数学领域之外奏效。它们还应揭示,科学智能体能否提出有用的问题,而不只是执行已定义的挑战。
目前,开发者和研究机构应避免两个极端。该结果既不是自动化通用科学的证明,也不只是又一次聊天机器人演示。
它是在一个条件有利但要求严苛的领域中,对长期技术自主能力的一次严肃测试。其更广泛的重要性取决于复现与迁移。
决定该结果能否泛化的三个信号
接下来的证据应聚焦于可复现性、重复表现,以及超越这一次计算的有用延展。
第一个信号是完整的科学发布。外部研究人员需要足够的材料来重建结果,并理解智能体的贡献。
该材料包应包括确切的任务提示词、代码、计算环境、中间表示和验证测试,也应说明每一次实质性人工干预。
如果另一团队能够根据这些材料复现该振幅,Anthropic 的叙述将更有说服力。如果复现依赖未被记录的专业知识,自主性的主张就会减弱。
第二个信号是在相邻问题上的表现。Claude 应面对相关的振幅任务,其解答对系统运营者而言未知,或在评估期间被保留。
一项有价值的研究应报告整个问题集中的成功、失败、重试和资源使用情况,而不是只突出最佳轨迹。
这类证据能将一次成功运行与可靠的研究能力区分开来。它也能显示工作流的哪些部分依赖于该理论的特殊结构。
第三个信号是科学用途。研究人员应证明该结果能够支持新的猜想、促成另一项计算,或揭示在八圈时尚不可见的模式。
一个九圈表达式可以是正确的,却主要仍只是一个纪录。如果其他物理学家将其作为进一步研究的输入,其科学价值就会提高。
这些信号比又一次精致的演示更重要。可复现性检验主张,重复试验检验可靠性,下游使用检验相关性。
这一事件也为尝试研究智能体的团队提供了实际指导。他们应在整个运行过程中保留来源、决策和测试输出。
漫长的技术项目很快就会超出任何人在聊天窗口中能够追踪的范围。一个可检索的工程知识库可以连接论文、假设、代码和审查记录,而不会将模型输出视为权威。
这种纪律同时支持生产力与怀疑精神。研究人员可以追溯某项主张的来源、比较不同推导,并识别哪些结论仍属暂定。
Claude 的九圈振幅已经跨过了一个重要门槛。据报道,一名前沿 AI 智能体处理了一项外部提出的问题,并给出了被顶尖专家认可的答案。
下一个门槛是集体性的,而非计算性的。独立团队必须能够检查过程、复现结果,并将方法应用到其他领域。
Anthropic 会不会公开足够的运行材料,让另一团队能够重建它?这是最重要的下一个问题,因为 AI 辅助科学的未来取决于可重复的工作,而不是孤立的胜利。



