top of page

Anthropic Claude 生物学发现面临可重复性检验

9月25日
讀畢需時 14 分鐘

Anthropic 表示,Claude 发现了一个此前未被表征的酶系统,尽管科学家尚不清楚该系统的功能。此次 Anthropic Claude 生物学发现涉及约 950 个 AI 智能体,它们用了 21 小时搜索基因组数据。其中一个智能体在一种异常酶附近注意到重复出现的 DNA 模式。

这一系统被命名为阵列相关逆转录酶(array-associated reverse transcriptases,ART),其组织结构令人联想到 CRISPR。然而,目前尚无实验表明 ART 能编辑基因、靶向 DNA,或执行任何其他类似 CRISPR 的操作。

这一空白定义了这则故事。Claude 似乎发现了研究人员此前忽略的一种具有生物学意义的模式。但 Anthropic 对一个早期假设的表述,在一些科学家看来比现有证据更为强烈。

这项工作还暴露出第二个问题。根据 Anthropic 的技术报告,十次重复实验均未能重新发现定义性重复阵列。因此,这一结果对 AI 辅助探索的支持,比对可靠自主发现的支持更明确。

Anthropic 和 Claude 实际发现了什么

Claude 发现的是已知基因组组分之间的新关系,而不是一个可用的基因编辑工具。

Anthropic 于 2026 年 9 月 23 日公布这一结果,同时宣布成立新的生命科学研究团队和湾区实验室。该团队于 2026 年春季组建,旨在测试通用 AI 模型能否加速基础生物学研究。

研究人员要求 Claude 搜索异常的逆转录酶。逆转录酶(RT)是一种将 RNA 复制为 DNA 的酶。

这类酶存在于病毒、可移动遗传元件、细菌防御系统以及多种生物技术工具中。其多样性使其成为基因组挖掘的有用目标;基因组挖掘会在大型序列数据库中搜寻被忽视的生物机制。

此次搜索分析了源自约 19 亿个蛋白质簇的数据。Claude 智能体收集了超过 20 万个逆转录酶,并识别出约 3,500 个候选系统。

随后,智能体将该集合缩小至约 20 个候选对象,用于生成详细报告并接受人工审查。Anthropic 的发现公告称,在这场持续 21 小时的搜索中,约 950 个智能体处理了 2.1 亿个 token。

其中一个智能体检查了逆转录酶基因周围的原始 DNA。它注意到一组很长、间隔均匀的重复序列,此前研究人员未曾描述过这一结构。

该智能体还识别出附近的一个伴侣基因。Anthropic 团队将这一组合命名为 ART,即阵列相关逆转录酶。

ART 系统主要存在于噬菌体中,后者是感染细菌的病毒。每个系统都包含一个 RT、一个相邻的伴侣基因,以及一组很长的非编码 DNA 重复阵列。

这一组合就是此次发现。相关 RT 早已出现在此前的研究中,其中包括涉及一种名为 MarsHill 的巨型噬菌体的工作。Claude 的贡献在于认识到,RT、伴侣基因和重复阵列可能共同构成一个生物系统。

Anthropic 的实验室随后测试了该假设的一部分。研究人员发现,重复阵列会表达为不同的短 RNA,而非保持为不活跃的基因组材料。

这一结果表明,该阵列参与某种生物过程。但它并未证明这一过程是什么、RT 是否使用这些 RNA,或该系统是否操纵 DNA。

所有实体实验室工作均由人类科学家完成。Claude 搜索数据、生成假设、准备候选报告,并协助解释结果。

Anthropic 表示,在核心计算活动期间,这些智能体无需人工干预即可运行。人类仍负责撰写研究简报、选择更广泛的问题、审核输出,并开展实验室实验。

该公司发布了一篇描述工作流程和早期证据的技术预印本。该论文尚未完成同行评审。

这一区别很重要,因为同行评审能够发现分析错误、缺失的对照、被夸大的新颖性或其他解释。它也让 Anthropic 以外的专业人士能够质疑团队的解读。

目前,ART 最恰当的描述是:一种此前未被表征、功能未知的基因组排列。将其称为酶系统是合理的,但将其描述为基因编辑机制仍缺乏支持。

为什么 Claude 的酶发现仍然重要

最有力的结果不是发现了一个新的 CRISPR,而是语言模型智能体能够从原始序列数据中生成可检验的生物学线索。

基因组数据库中存在大量科学家从未表征过的蛋白质。许多蛋白质仅以序列形式出现,几乎没有证据说明其功能或相互关系。

传统计算流程可以对相关蛋白质分组,并定位相邻基因。然而,研究人员仍须判断哪些模式值得关注,哪些候选对象值得投入昂贵的实验室工作。

Anthropic 试图将更多这类判断自动化。Claude 不只是检索论文,或运行一种预先设定的序列分析工具。

这些智能体审阅文献、复现已知发现、对酶家族进行分组、检查基因组邻域,并就异常候选对象撰写报告。它们还否决了搜索过程中生成的大多数假设。

这一工作流程类似于早期研究漏斗:计算系统探索庞大的搜索空间,AI 系统提出解释,而人类科学家决定哪些输出值得实验检验。

ART 候选系统之所以出现,是因为一个智能体检查了某种酶周围的原始序列。当正确的 DNA 片段进入其上下文后,它识别出了一种在视觉上显而易见的重复模式。

这一行动听起来很简单,但研究往往依赖于发现异常——而现有流程原本并未被设计来标记这些异常。生物数据库中可能多年都存在重要模式,直到有人将它们联系起来。

因此,Claude 的贡献比泛泛总结更有价值。它将人类注意力引向一个具体位点,并提出了可测试的生物学关系。

MIT 教授、CRISPR 先驱 Feng Zhang 在 Anthropic 公布前审阅了这篇预印本。他称与逆转录酶相关的 RNA 重复阵列颇具吸引力,并表示值得进一步研究。

他的回应支持 ART 在生物学上的研究价值,但并未验证 Anthropic 关于自主发现的更广泛主张,或 ART 潜在应用的说法。

有趣的线索与可用工具之间的区别,是科学研究的核心。研究人员常常需要数年的生化、结构和遗传学工作,才能理解新的天然系统。

CRISPR 本身就说明了这一时间线。在研究人员证实其在适应性免疫中的作用之前,细菌中的重复序列已被报道数十年。

此后,科学家确定了 CRISPR 相关蛋白如何利用 RNA 向导识别遗传靶标。2012 年发表的一项里程碑式可编程 DNA 研究展示了这种机制如何被重新定向用于生物技术。

ART 尚未达到其中任何一个阶段。研究人员不了解它的天然功能,更不用说它能否成为一种可编程工具。

尽管如此,Claude 的酶发现提供了一个 AI 辅助生成假设的具体案例。它从一个宽泛提示出发,找到一个经人工审查后仍成立的候选对象,并产生了可测量的实验室观察结果。

这比在静态科学基准上取得成功更有意义。基准测试考察的是模型能否复现评估者已经知道的答案。

基因组挖掘要求系统在事先不知道答案的情况下,找到值得研究的对象。其输出随后必须经受实体实验的检验。

这种方法最终可能改变研究团队分配时间的方式。AI 智能体可以检查的候选系统,远多于一小群科学家能够手工审查的数量。

不过,数量丰富也会带来自身的问题。如果一个智能体生成数千个看似合理的故事,研究人员仍需要可靠的方法为它们排序。

错误线索会消耗实验室资源。当模型用自信的语言呈现薄弱证据时,有说服力的解释还可能导致确认偏误。

此次 Anthropic Claude 生物学发现展现了这一问题的两面性。系统确实发现了一种真实模式,但通向该结果的路径并不一致。

Anthropic Claude 生物学发现依赖一次罕见命中

十次未成功的重复运行,使最初发现成为可能性的证据,而不是可靠发现流程的证据。

Anthropic 的原始活动涉及数百个并发智能体会话。这些智能体将搜索拆分为不同任务,检查候选对象、评估报告,并记录发现以供后续审查。

其中一次会话遇到了相关序列,并注意到了其重复结构。这一观察成为 ART 假设的基础。

研究团队之后使用相同的总体简报和智能体框架,额外进行了十次活动。没有一次重新发现定义 ART 的阵列。

这些重复运行没有检查包含关键模式的上游 DNA 片段。缺少这一上下文序列,智能体就没有机会识别该模式。

这一失败并未抹去最初的发现。无论 Claude 发现它一次、反复发现它,还是从未再发现,ART 的基因组组织结构都客观存在。

但它削弱了对该活动的一种更广泛解读。可靠的科学工作流程应当在可比条件下重复时,产生相似的搜索行为。

这些失败的重复运行暴露出覆盖范围问题。智能体可能善于推理所见证据,却仍会以不一致的方式搜索相关证据。

这一区别对于评估 AI 研究系统的组织至关重要。当模型控制自身的信息收集路径时,仅凭推理质量无法证明其表现可靠。

一个搜索系统还必须展示它检查了什么、跳过了什么,以及为何停止。否则,成功结果可能依赖于穿越庞大搜索空间的一条未被记录的路径。

原始活动也缺乏衡量发现表现的常规分母。Anthropic 披露了许多有用的数量,包括智能体数量、酶候选对象数量和最终报告数量。

但这些数字并未说明,该工作流程多大频率能产生具有实验价值的假设。它们也没有展示有多少表面上的发现会在更深入测试后失败。

数千个候选对象中有一个成功候选,仍可能具有价值。但采购方、实验室和资助机构需要的不只是一个令人印象深刻的轶事。

他们需要针对多个研究问题开展前瞻性评估。这类测试应记录成功率、假阳性率、计算资源使用量、科学家投入时间以及可重复性。

此次活动的规模也让其与人类工作的比较变得复杂。Anthropic 表示,专业科学家进行类似分析可能需要数周或数月。

如果不衡量围绕 AI 运行所投入的人力,这种比较仍然是不完整的。科学家设计了任务说明、搭建了执行框架、准备了数据库、审阅了报告,并开展了后续实验。

21 小时这一数字描述的是计算搜索所经历的时间。它并不代表整个研究项目的完整周期。

同样,2.1 亿 token 表明进行了大规模并行处理。它并未揭示独立实验室复现这项研究所需的财务成本或基础设施。

这些遗漏并不意味着该项目无效。它们限制了人们对速度、可负担性和实际科研生产力所能得出的结论。

更站得住脚的说法范围更窄:在一次大规模智能体活动中,Claude 帮助 Anthropic 的科学家识别出一种此前被忽视的基因组模式。

cautious scientific response 反映出,这一表述与“AI 能够可靠地发现新的生物学现象”的说法之间仍有距离。

科学发现包括注意到一种模式、证明该模式具有意义、解释其机制,以及复现相关证据。Anthropic 已完成第一步,并开始了第二步。

其对失败重跑的坦诚披露具有价值。这些负面结果让外部研究人员有了更明确的目标,以改进智能体搜索。

未来的系统可以要求智能体检查每个候选项周围固定的基因组窗口。它们还可以跟踪覆盖范围,并指定独立审查者质疑新颖性主张。

这些控制措施将使成功更少依赖于某一个智能体走上一条异常高产的路径。在此之前,ART 仍是一条通过脆弱流程发现的、有前景的线索。

与 CRISPR 的比较止于重复模式

ART 与 CRISPR 在一种架构特征上相似,但没有证据表明两套系统执行可比的生物学操作。

CRISPR 阵列包含重复的 DNA 序列,其间由可变间隔序列分隔。细菌和古菌将这些间隔序列作为过去入侵者遗传物质的分子记录。

细胞将该阵列转录为引导 RNA。CRISPR 相关蛋白利用这些引导 RNA 识别相匹配的遗传靶标。

这种可编程性将微生物免疫系统转化为基因编辑平台。研究人员可以设计引导 RNA,使其引导一种酶作用于选定的 DNA 序列。

ART 同样包含一个长重复阵列,Anthropic 发现该阵列会产生不同的短 RNA。这些观察结果有理由让人提出疑问:ART 是否执行某种可编程操作。

但它们并未回答这个问题。Anthropic 尚未证实 ART 逆转录酶会与这些短 RNA 相互作用。

研究人员也尚未证明 ART 能识别匹配靶标、切割 DNA、将信息复制到指定位置,或保护噬菌体免受另一种生物威胁。

甚至其天然活性的方向仍不确定。ART 主要存在于噬菌体中,而许多常见的 CRISPR 系统则作用于细菌和古菌。

ART 的重复序列也不同于赋予 CRISPR 系统适应性靶向记忆的经典“重复序列—间隔序列”排列。仅凭结构相似性并不能证明功能等价。

自然界中存在许多重复序列。有些调控基因表达,有些产生 RNA 分子,还有一些只是反映了复制扩增,并不承担可编程任务。

ART 的伙伴蛋白可能被证明至关重要。它也可能执行与基因编辑几乎无关的功能。

Anthropic 的公告承认了这种不确定性。该公司表示尚不清楚 ART 的功能,并将这一模式描述为“让人联想到” CRISPR。

然而,将这一发现与 CRISPR 的历史并置,会引发更强烈的公众解读。读者很容易从“类似的重复架构”推导到“新的基因编辑系统”。

这种跳跃为时过早。尚无已发表结果显示任何 Anthropic 的类 CRISPR 酶编辑了任何基因组。

这种比较还将一项非常早期的发现,与现代生物学中最具影响力的技术之一并列。这种表述在基本机制尚未确定之前就抬高了预期。

更准确的类比涉及发现的顺序。CRISPR 最初是一种意义并未立即得到理解的奇特重复序列。

如今,ART 是另一种与分子机器相关的奇特重复序列。正因为研究人员不知道它的作用,它才值得研究。

历史先例既带来鼓励,也提醒人们保持克制。一些未解系统会成为有价值的工具,而许多系统仍只是专门的生物学奇观。

逆转录酶系统已经支持多个研究方向。Retrons 会产生不同寻常的 DNA-RNA 分子,并已被改造用于基因组工程和分子记录。

Prime editing 将逆转录酶与 CRISPR 靶向机制结合,以写入选定的遗传变化。ART 最终可能揭示另一种处理或复制核酸的有用策略。

这些可能性仍然只是假设,不应被表述为能力。

下一项决定性证据必须来自实验,而非类比。研究人员需要证明该酶是否具有活性,并识别它所作用的分子。

他们必须确定短 RNA 是引导该酶、充当模板、调控表达,还是发挥无关的作用。

基因扰动研究可以揭示哪些 ART 组分是必需的。结构研究可以显示这些蛋白是否与 RNA 或 DNA 形成复合物。

只有在这些问题得到答案后,科学家才能判断与 CRISPR 的比较是阐明了 ART,还是仅仅在营销它。

人类科学家仍承担举证责任

Claude 扩展了搜索范围,但人类判断和实验室验证仍决定其输出是否能被视为科学。

Anthropic 将 Claude 描述为在科学家的高层指导下自主发现 ART。这一描述适用于持续 21 小时的计算活动,但并不适用于整个研究过程。

人类选择了逆转录酶作为目标。他们整理了智能体能够访问的数据和工具。

研究人员还创建了协调框架,并决定模型应如何报告候选项。他们审阅了保留下来的提案,并选择开展哪些实验。

随后,实验室科学家表达生物组分、分析 RNA 数据,并解释结果。Claude 协助了这些步骤,但并未亲自开展实验操作。

这种分工并非弱点。它可能代表了近期内最实际的 AI 辅助科学模式。

模型可以搜索庞大的信息空间,并生成候选解释。科学家则可以运用领域判断、设计对照,并根据物理世界检验主张。

当“自主”将这种协作压缩为模型单独行动的故事时,问题便会出现。这类措辞可能掩盖成功输出背后的科学基础设施。

模型的搜索也受到其训练中嵌入的先验知识和所提供工具的影响。Claude 能够识别出酶附近的串联重复序列可能类似于已知生物系统,是因为科学家此前已记录了这些模式。

它的贡献涉及在大型数据集上进行重组、注意和优先级排序。这一过程是否应被视为发现,与其说取决于哲学标签,不如说取决于可衡量的研究价值。

有用的 AI 科学家应当产出经得起独立审查的发现。它还应充分解释其搜索路径,使另一支团队能够审计结果。

Anthropic 的预印本提供了比标准产品公告更详细的方法学信息。它包括活动设计、筛选漏斗、智能体行为,以及负面重复运行结果。

这种透明度为外部科学家检验这项工作提供了基础。然而,独立复现尚未发生。

Anthropic 同时拥有该模型、运营实验室,并撰写了报告。其研究人员既有科学理由,也有商业理由将 Claude 呈现为有效的发现系统。

这种利益冲突并不会使证据失效。它增加了由对 Claude 被采用没有利益关系的团队进行验证的必要性。

独立团队应首先确认噬菌体基因组中所报告的 ART 组织结构。然后,他们应复现 RNA 表达结果,并检验组分之间所提出的相互作用。

另一支团队还可以使用相同的数据和提示词重新运行计算搜索。另一项有用的测试,是将 Claude 与传统生物信息学流程及其他 AI 系统进行比较。

这种比较不应只衡量每种方法是否找到了 ART。研究人员还应考察每个系统产生了多少新候选项,以及其中多少能经受实验检验。

这将澄清通用语言模型是否在自动化之外增加了科学判断。它也可能揭示专门的序列模型在哪些方面仍更可靠。

因此,这一结果给两类机构带来了压力。AI 公司必须以可复现的表现支撑有关科学自主性的主张。

研究机构必须决定如何评估那些结合随机模型、专有基础设施和人类实验的工作流程。

传统方法章节假定另一间实验室能够重复一项程序。智能体系统使这一标准变得复杂,因为模型行为会因运行和模型版本而改变。

可复现性可能要求保留提示词、工具配置、模型标识符、智能体日志、数据库和采样设置。仅有书面程序可能已不再足够。

这正是 Anthropic 公告的持久意义所在。ART 是一个有趣的生物学候选项,但这场活动也可作为报告 AI 辅助科学的测试案例。

三个信号将决定这一主张能否成立

ART 的生物学功能、独立复现和可重复的智能体表现,将决定这是否会成为一个里程碑,还是一次有益的警示。

第一个信号是机制性结果。Anthropic 或另一家实验室必须确定 ART 逆转录酶、伙伴蛋白和 RNA 阵列实际发挥什么作用。

RT 与阵列来源 RNA 之间的直接相互作用,将强化这些组分构成一个功能系统的观点。可编程靶向的证据会让与 CRISPR 的类比更有意义。

不同的功能并不会使 ART 变得不重要。它只会将故事从潜在的基因编辑平台,收窄为噬菌体生物学的新组成部分。

第二个信号是独立实验确认。另一研究团队应使用自己的方法复现 RNA 结果,并验证基因组组织结构。

同行评审会有所帮助,但仅靠发表并不能解决问题。最有力的支持将来自未参与 Anthropic 项目的实验室。

即使 Claude 的发现工作流程仍不稳定,独立验证也会加强这一生物学主张。若无法复现所报告的观察结果,则会削弱整项公告。

第三个信号是智能体活动能否重复搜索。Anthropic 应展示,改进后的工作流程能够可靠地检查相关基因组区域,并在多个目标中找回发现。

再次发现 ART 会有用,但更广泛的前瞻性测试更具分量。研究人员需要看到,在人类尚不知道预期答案之前,系统就能识别出新的候选项。

这些测试应披露总计算资源、人类审查时间、未成功的假设,以及实验室命中率;还应将结果与专家团队和传统软件进行比较。

一个可靠的平台不需要每次运行都产出同一个候选结果。它需要的是稳定地产生有价值、可审计线索的概率。

缺少这些证据,Claude 的酶发现仍只是一个引人注目的案例研究,尚不足以证明存在一台能够推动科学进步的自动化引擎。

不过,审慎的解读依然意义重大。Claude 在庞大的基因组空间中搜索,发现了一种此前被忽视的排列方式,并帮助将这一观察转化为可检验的研究计划。

与此同时,人类提出了问题、验证了证据,如今还要面对最艰难的工作:确定 ART 是否执行任何重要功能。

因此,对 Anthropic Claude 生物学发现的评判,应取决于公告之后发生的事情。该系统能否揭示一种可复现的机制,还是与 CRISPR 的比较会在测试中逐渐失去支撑?

关注 AI 辅助科学的读者,应关注这三个信号,而不是代理群体的规模。在将 ART 视为新的基因编辑平台之前,应要求提供功能性证据、独立复现,以及可重复的发现率。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page