top of page

Claude 提升生物分子建模能力,但速度并不等于科学验证

9月18日
讀畢需時 13 分鐘

Claude 在生物分子建模领域带来了一个不同寻常的结果:Anthropic 表示,一个通用模型在四周内优化了 30 多个专用生物学模型。据称,这些改动带来了平均约四倍的速度提升,同时降低了若干高要求研究工作流所需的硬件门槛。

发表于 2026 年 9 月 17 日的这份生物分子建模报告将关注点从 AI 生成的科学答案,转向支撑其运行的底层基础设施。Claude 并未取代 AlphaFold 级别的系统或其他专用模型,而是重写了部分软件,使研究人员能更快运行这些模型,并在一些情况下对大得多的分子系统进行建模。

这一差别构成了核心张力。更快的推理可以扩大蛋白质设计、结构预测、基因组学和蛋白质语言模型的可及性。然而,更快的计算并不能证明某个预测分子能在细胞、动物或患者体内发挥作用。

Anthropic 最有力的证据涉及软件性能与计算预测。生物学验证仍是一个独立过程,涉及实际合成、实验室测量和可重复实验。该公司新宣布的蛋白质设计竞赛旨在连接这两个阶段。

这一结果对一种熟悉的研究模式提出了挑战。科学团队往往依赖专门的性能工程师,分别优化每个代码库。Claude 的工作表明,通用 AI 系统可以跨多种架构自动完成更多这类工程层面的工作。

更大的问题已不再是 AI 模型能否描述生物学,而是通用智能体能否在不削弱输出质量、也不掩盖其局限性的前提下,降低专用科学工具的运行成本。

Claude 在 36 个开源模型中提升生物分子建模能力

眼下的变化是一项广泛的软件发布,而非新的生物学基础模型。

Anthropic 发布了 36 套优化工具包,覆盖用于结构预测、共折叠、结合体设计、序列设计、基因组学和蛋白质语言建模的开源工具。每套工具包都封装了既有上游项目的固定版本,并启用明确界定的性能模式。

配套的优化仓库介绍了四种主要模式。“Off”保留原始配置,“exact”旨在以更快速度生成完全相同的输出。“Fast”允许出现已记录的数值差异,“big”则为原本无法容纳的输入尽可能降低 GPU 峰值内存占用。

这一结构很重要,因为该公告涉及为不同科学任务构建的模型。这并非单一基准上的一次精细调优演示。Anthropic 表示,Claude 在两名技术人员的监督下,处理了 30 多个模型。

这些监督人员拥有生物分子建模经验,但此前并未专攻推理优化或 GPU 内核工程。据 Anthropic 称,相关工作耗时不到四周。

报告中的性能取决于研究人员选择的模式。Anthropic 表示,在允许小幅精度变化时,优化后的模型平均运行速度约为原来的四倍。对于要求输出完全相同的运行,提升幅度较小;在所展示的结构模型中,报告值约为 1.6 倍。

这一差别不应被淡化。输出完全一致的速度提升,呈现出比允许数值差异的提升更清晰的工程成果。快速模式需要下游测试,因为即使汇总基准结果仍然相近,微小的数值变化也可能影响个别预测。

Anthropic 表示,在一组汇总的生物分子界面数据中,结构预测的快速模式与默认设置在统计上难以区分。它将 DockQ 分数高于 0.23 的结果定义为可接受的预测界面。DockQ 是用于评估预测分子界面与参考结构匹配程度的指标。

该发布还包括超出共享 GPU 内核之外的任务特定改动。据称,Claude 缓存了模型反复计算的工作,并以常量输出替换了无效的计算分支。这些都是常见的优化方法,但在许多陌生仓库中寻找安全的优化机会既困难又耗时。

因此,这次发布的广度比任何单一加速数字更值得关注。Claude 蛋白质设计工作依赖一条由专用工具构成的链条,而改善这条链条可以放大既有模型的价值。

不过,该仓库附带一项重要的运营警告。Anthropic 将其称为参考版本,表示不计划持续维护,也不接受 pull requests。研究人员必须自行评估兼容性、安全性、硬件支持和上游变更。

这些工具包还依赖固定的软件环境和明确的 NVIDIA GPU 配置。这提高了已测试设置的可重复性,却限制了关于可移植性的主张。在其他加速器、驱动程序、模型版本和集群配置上的性能,仍是一个开放的工程问题。

对实验室团队而言,采用并不只是下载代码。他们需要与既有流程进行受控比较,记录配置变更,并在自身目标类别上完成验证。可搜索的工程知识库可帮助团队在实验和软件版本迭代中保留这些决策。

这正是为何该公告代表的是基础设施工作,而非一种通用替代方案。Claude 加速了既有生物学系统,同时仍依赖其学习到的表征、权重、基准测试和科学假设。

真正的机制是更高效的 GPU 执行

Claude 最具影响力的贡献,是改变既有模型使用 GPU 方式的软件。

现代生物分子结构模型通常会表示氨基酸、核苷酸、原子及其他分子组件之间的关系。其架构会反复更新成对关系,使系统能够推理三维几何结构。

两项昂贵的运算是三角注意力和三角乘法。它们处理被表示组件的三元组,帮助模型推理预测关系是否构成几何上一致的结构。

随着分子系统变大,这些运算的扩展性很差。Anthropic 解释说,对于三次方运算,系统规模翻倍可能需要八倍的运行时间和内存;规模变为三倍,则可能使这些需求增至 27 倍。

这一扩展性问题解释了为何看似不大的分子规模增加,也可能超出可用 GPU 内存。它也说明了为何即使底层模型权重保持不变,优化仍然重要。

Anthropic 表示,Claude 协助创建了 FlashPairformer,这是一组针对这些成对运算的自定义 GPU 内核。内核是一种底层程序,旨在让特定计算在加速器硬件上高效执行。

据该公司称,在三角注意力方面,FlashPairformer 相比所对比的行业标准平均快了 2.7 至 2.9 倍。三角乘法的报告提升则视配置而定,范围为 1.7 至 3.2 倍。

这些结果使 Claude 进入了一个已有专门工程工作布局的领域。NVIDIA 的 cuEquivariance 和 BioNeMo Inference Runtime 同样针对科学机器学习中的高成本计算。

因此,对手并非另一个对话模型,而是传统上认为每个科学代码库都需要稀缺性能专家进行长期、模型特定优化的假设。

Claude 生物学模型并未消除这类专业知识的必要性。Anthropic 的流程仍包含人工监督、受控基准测试、固定环境和下游检查。变化在于,AI 智能体跨越许多代码仓库完成了大部分搜索和实施工作。

这种模式类似于软件工程智能体在陌生代码库中推进工作。它分析性能瓶颈、研究张量形状、编写内核、测试数值行为,并将输出与基线进行比较。

生物学使风险更高。网页应用可以立即暴露视觉回归问题,而科学模型可能在持续运行的同时,产生影响排序、置信度或结构质量的细微数值变化。

Anthropic 通过区分 exact 与 fast 模式,部分应对了这一风险。exact 模式以输出完全一致为目标,fast 模式则为更高速度接受有边界的数值差异。这使性能权衡变得可见,而不是悄然改变行为。

不过,“完全一致”仅适用于确定的软件和硬件条件。GPU 运算可能因架构、库、精度格式和编译器版本不同而表现不同。因此,可重复性主张必须始终与经过测试的环境绑定。

开源工具包帮助独立团队检查这些选择。研究人员可以审查改动,对比原始与优化模式,并使用自己的数据集开展任务级评估。

开源代码并不等于独立验证,但它为社区提供了一个切实可行的起点。这比无法检查或复现优化方法的封闭演示更有价值。

Claude 在其工作范围狭窄且可测量之处,最可信地提升了生物分子建模能力。内核运行时间、峰值内存、输出一致性和下游基准分数都可以被测试。

至于通用 AI 能否常规化地优化科学软件这一更广泛主张,仍需要来自不同实验室和硬件环境的更多证据。这次发布创造了让这些证据出现的条件。

更低内存需求开启更大的分子系统

速度能够节省资源,但内存效率改变了研究人员可以尝试建模的生物系统范围。

Anthropic 的“big”模式面向超出普通推理配置内存容量的分子组装体。该公司表示,它在一个 NVIDIA GPU 节点上准确建模了包含超过 10,000 个 token 的系统。

在这里,token 指的是氨基酸、核苷酸、小分子原子和离子,而不是词语。更大的 token 数通常代表更大或更复杂的生物分子组装体。

Anthropic 报告称,已成功预测人类线粒体复合体 I、TRiC 伴侣蛋白复合体、蛋白酶体和细菌核糖体。这些分子机器包含大量相互作用的组件,其排列会影响生物学功能。

该公司表示,预测结构与实验确定的参考结构高度吻合。它称复合体 I 和 70S 核糖体均包含超过 10,000 个 token。

作为对照,已发表的 AlphaFold 3 研究包括一个准确预测的、包含 7,663 个 token 的 40S 核糖体。Anthropic 将这一较早结果作为有用的规模参照,而非直接的竞争性基准。

这种比较仍需谨慎解读。仅凭 token 数量并不能涵盖建模难度的所有来源。分子组成、柔性、相互作用类型、可用模板以及训练覆盖范围,都会影响预测质量。

Anthropic 还将系统推进得更远。在一台配备八块 GPU 的 B300 节点上,优化后的技术栈完成了对超过 31,000 tokens、最高逾 70,000 tokens 系统的推理。

完成推理并不等于生成正确的结构。Anthropic 明确报告称,这些极端规模的预测发生坍塌,且未能匹配预期的生物学结构。

这一负面结果是该公告中最有价值的细节之一。软件能够处理接近模型训练上下文两个数量级之外的输入,但训练得到的模型并未可靠地泛化。

因此,内存容量与生物学能力是两道不同的上限。Claude 降低了第一道上限,却没有消除第二道。

这一区别能避免报道中的常见错误:能够接受更大输入的模型,并不必然已经学会正确预测该输入所需的关系。工程能力的扩展速度可能快于科学有效性的提升。

已成功覆盖的范围仍具有实际意义。许多研究团队缺乏多个互联 GPU 节点,或缺少能够重写模型内部实现的团队。在单个节点上运行大型复合体,可以简化调度、减少通信开销,并拓展实验空间。

研究人员可利用这一能力考察呼吸链复合体、核糖体、蛋白酶体,或其他功能源于多组分相互作用的组装体。他们也可以比较不同构象或分子组成下的假设。

但预测结构仍应被视为生成假设的工具。置信度指标、已知结构、实验约束和实验室证据,必须共同决定某一结果是否值得进一步投入。

Claude 蛋白质设计也面临同样的边界。优化后的模型可以为更多候选项排序,或探索更大的搜索空间,但无法仅凭计算确定结合能力、稳定性、毒性、可制造性或治疗价值。

这正是这则故事的核心反转。Anthropic 的成果并非 Claude 解决了更大规模的生物学问题,而是让更大规模的计算尝试变得可行,并记录了这些尝试在哪些地方失效。

这条边界反而让结果更可信。Anthropic 并未将 70,000-token 的输出描述为准确结构,而是报告了失败情况,并将其与超出训练上下文后的泛化问题联系起来。

下一步需要在接近成功阈值的多样化复合体上进行独立测试。研究人员需要了解,这项改进是否能在不同分子类别、硬件环境和评估协议下保持有效。

更低成本的 Claude 蛋白质设计仍需湿实验验证

最具商业相关性的主张关乎效率,而最重要的不确定性则关乎实验成功。

Anthropic 此前为每个蛋白质靶点提供了长提示词、子代理访问权限以及大量 GPU 资源。该系统编排专用工具来设计从头结合蛋白,即旨在附着于指定靶点的工程化蛋白质。

新实验采用了更简单的设置:一个 Claude 模型获得一块 NVIDIA H200、24 小时实际运行时间、更短的提示词,以及一份已安装工具的参考说明。Anthropic 表示,在这些运行过程中没有人工引导设计。

该公司针对 16 个靶点测试了 Mythos 5.1、Mythos 5 和 Opus 5。其使用 ipSAE 评估设计方案;ipSAE 是一种旨在估计预测结合蛋白—靶点界面质量的计算评分。

Anthropic 称,其中位数得分和最高得分设计取得了与早期项目大致相同的 ipSAE 值。新工作流据称使用的 GPU 小时数约少两个数量级。

这是基于计算评分得出的效率结果,并不能证明新生成的结合蛋白能够在物理层面附着于预定靶点。

关于 ipSAE metric 的研究表明,该评分有助于评估预测的相互作用。但无论何种计算评分,都无法替代在不同靶点类别上进行的物理实验。

因此,“性能相当”这一表述必须保留完整限定:计算模拟性能相当。去掉这一限定,会夸大 Anthropic 实际测量的内容。

这很重要,因为蛋白质设计流程包含多层筛选。候选物首先必须在计算上看起来合理,之后可能还需要经历合成、表达、纯化、结合测量、稳定性测试和功能评估。

每个阶段都可能淘汰早期看似有前景的设计。有些蛋白质无法正确折叠、发生聚集、表达效果不佳或结合较弱。另一些则能够结合,却无法产生预期的生物学效应。

Anthropic 早期的蛋白质研究包含外部实验验证,这让该公司在讨论其更广泛的设计方法时拥有更扎实的依据。新的效率实验则是在即将举行的竞赛产生更多实验室数据之前,报告计算层面的比较。

因此,该公司选择资助物理验证至关重要。Anthropic 和 Adaptyv Bio 计划在五项挑战中测试超过 5,000 个由社区提交的设计。

这项 protein design competition 涵盖物种交叉反应性、pH 敏感性、肽-MHC 特异性,以及 G 蛋白偶联受体等困难靶点。这些任务测试的性质,无法仅凭简单的结构合理性完全捕捉。

大规模验证集能够揭示,更快的建模是否提高了实验命中率,还是仅仅生成了更多候选项。它也能显示哪些靶点类别最能从优化工作流中受益。

竞赛提供 Claude 额度、算力支持、DNA 资助和湿实验测试。这些资源降低了参与门槛,但也形成了一个以 Anthropic 模型及其合作伙伴为中心的生态系统。

独立分析应审视设计如何被选出、负面结果如何报告,以及完整的结果数据是否会公开。公开的失败案例与成功的结合蛋白一样具有参考价值。

研究人员还应评估,优化是否改变了生成候选项的多样性。如果评分或生成阶段偏好相似结构,更快的流程可能会反复探索设计空间中的狭窄区域。

安全与访问仍是整体图景的一部分。蛋白质设计具有双重用途,这意味着同一套技术既可支持医学,也可能被用于有害的生物学工作。Anthropic 已将高级生物学访问与验证控制关联,而非无限制开放。

该政策带来了第二层权衡。更广泛的科研访问可提升研究参与度,而较弱的控制则会增加滥用风险。开放优化工具包会加速专用工具的发展,而这些工具可能存在于 Claude 自身访问控制之外。

Claude 在软件层面提升了生物分子建模能力,但治理不能仅局限于对话模型。实验室必须评估工具访问、实验审查、数据处理,以及组合工作流所暴露的能力。

三项信号将显示这些提升能否持续

下一批证据应来自独立复现、竞赛结果和持续采用,而不是又一项内部基准测试。

第一个信号是,外部研究团队是否能复现报告中的速度与内存提升。该代码库覆盖多种工具,但 Anthropic 的测量来自受控技术栈和选定的 GPU 配置。

独立团队应报告硬件、驱动版本、模型提交版本、输入规模、精度设置以及下游准确性。H100、H200、B 系列和旧款加速器上的结果,将澄清这些优化的可迁移范围。

复现将强化这样一种主张:通用 AI 可以在陌生系统中加速科研软件。若结果差异很大或安装困难,则该成果的适用范围将缩小至 Anthropic 测试过的环境。

第二个信号是竞赛的湿实验结果。计划中的超过 5,000 次验证,可能形成一个将计算排序与物理测量联系起来的大型数据集。

关键指标并不是提交设计的数量,而是有多少设计能够成功表达、结合预定靶点、满足所要求的性质,并优于有意义的基线。

结果还应按挑战类型和设计方法进行拆分。某一靶点类别上的强劲表现,并不能证明其在 GPCR、肽-MHC 相互作用、pH 敏感结合蛋白和交叉反应性设计上取得了广泛成功。

负面结果也需要公开。否则,读者无法估计命中率,也无法判断计算评分是否比既有工作流更善于筛选有价值的候选项。

明确的湿实验收益将强化 Anthropic 的论点:更低成本的推理能够扩大高产出的蛋白质设计。若对应关系较弱,则表明计算虽然变快,却未解决生物学筛选问题。

第三个信号是,开放优化工具包在首次发布后是否获得持续使用。Anthropic 表示,该代码库不再维护,也不会接受 pull requests。

这立即带来一个持久性问题。科学软件包会变化,依赖项会迁移,GPU 架构会演进,上游模型也会发布新版本。即使其中的思路仍有价值,固定版本的参考工具包也可能变得难以使用。

因此,采用情况可能取决于上游项目是否整合这些改进。社区分支也可能维护单独的内核或兼容层。

若改进被整合进 OpenFold 类项目、设计系统或共享推理运行时,将表明其具有持久的工程价值。若代码库在依赖项变化后停止工作,那么无论其发布时的基准测试如何,其实际影响都将较小。

这些信号的意义超出生物学领域。通用 AI 代理正越来越多地被描述为能够操作科学仪器、分析数据和改进研究软件的协作者。

性能优化提供了一个异常易于检验的案例。运行时间、内存、数值等价性、下游准确性、安装成功率和维护负担都可以测量。

目前的证据支持一个聚焦的结论:Anthropic 发布了可检查的代码和详细的公司内部基准测试,显示其在开放生物分子模型上获得了广泛的效率提升。

但证据尚不足以支持 Claude 独立解决蛋白质设计或验证新疗法的说法。最大的成功结构依赖于与已知参考结构的比较,而极端规模的预测则告失败。

对开发者而言,此次发布是 AI 辅助性能工程的案例研究。对研究负责人而言,这提供了重新评估哪些计算瓶颈仍需要稀缺专家的理由。

对生命科学研究人员而言,机会在于更容易地使用现有模型,而不是免除实验纪律。更快的预测能够帮助团队提出更多问题,但每一个答案仍需接受科学审视。

Claude 通过让既有工具运行更快、适配更大问题,提升了生物分子建模。这样的提升能否转化为持久的科学进展,如今取决于复现、实验室结果和长期维护。

研究团队应从针对现有流程的受控基准测试开始。他们应保留精确配置、比较输出质量,并在扩大任何设计项目之前定义停止规则。

最有价值的问题并不是 Claude 能否“做生物学”。而是:一套有文档记录、由 Claude 辅助的工作流程,能否产出可复现、并经得起实体测试验证的结果。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page