top of page

Anthropic Claude 发现的酶系统看似 CRISPR,但功能仍未知

1天前
讀畢需時 14 分鐘

Anthropic 表示,Claude 在约 950 个智能体会话中自主搜索生物数据 21 小时后,发现了一个此前未被表征的酶系统。Anthropic Claude 发现的这一酶系统在一项重要结构特征上类似 CRISPR,但尚无实验表明它能够编辑基因。

这一区别将一个引人关注的科学线索,与部分早期标题所暗示的工具区分开来。Anthropic 将该系统称为阵列相关逆转录酶(array-associated reverse transcriptases,ART)。研究人员在噬菌体——即感染细菌的病毒——中发现,逆转录酶基因紧邻重复 DNA 阵列。

这是 Anthropic 于 2026 年春季成立生命科学研究团队以来,首次公开披露的发现。它也检验了一个更宏大的命题:通用 AI 智能体能否发现生物学异常、持续追踪,并将值得测试的候选结果交给科学家。Claude 曾一次通过这项检验,但在随后十次活动重跑中都未能再次发现这一关键阵列。

Anthropic 的 Claude 酶系统发现究竟找到了什么

Claude 发现的是一种新的生物学排列方式,而不是可用的 CRISPR 替代方案。

Anthropic 于 2026 年 9 月 23 日公布这一结果,同时宣布其位于湾区的新分子生物学实验室。据该公司的酶系统公告称,该实验室开展风险较低的 BSL-1 和 BSL-2 工作。所有实体实验均由人类科学家执行。

这项计算研究始于一份高层研究简报。Claude 被要求寻找异常的逆转录酶系统。逆转录酶(RT)是一种将 RNA 复制为 DNA 的酶。

这些智能体汇集了超过 198,000 个 RT 簇,并检查了数千个相邻蛋白家族。根据 Anthropic 的 ART 技术报告,完整活动在 949 个智能体会话中消耗了 2.156 亿个 token。其实际运行时间为 21.5 小时,累计智能体工作时长为 77 小时。

Anthropic 的公开摘要将这些数字约略表述为 200,000 个 RT、950 个智能体和 2.1 亿个 token。这些数字描述的是搜索规模,并不意味着有 950 名独立 AI 科学家同时研究这一问题。

这里的“智能体”是通过研究框架协调的模型会话。一个会话可以规划任务,另一个会话可以审查任务,二者都可以开启后续任务。这一结构使 Claude 能够探索多条路径,而无需科学家指挥每一个中间决策。

最初的简报聚焦于位于逆转录酶旁的新型伴侣基因。Claude 将 3,564 个蛋白家族评估为潜在伴侣,随后展开更深入的调查。其中三种关联经审查后被认定为此前未报告的 RT 关系。

ART 的出现路径更为不同寻常。一名智能体调查了与巨型噬菌体相关的逆转录酶谱系;巨型噬菌体是基因组异常庞大的噬菌体。预期的蛋白关联看起来并不可信,但该智能体继续探索周边基因组区域。

它将原始上游 DNA 载入工作上下文,并注意到一个串联重复阵列。其中一个位点包含 14 个 16 核苷酸重复序列的拷贝,各重复序列之间由约 100 至 200 个核苷酸长的独特片段分隔。

这一排列让人联想到 CRISPR,因为 CRISPR 系统同样使用由可变序列分隔的重复 DNA。细胞会将这些阵列转录为较短的 RNA,而这些 RNA 能引导 CRISPR 相关蛋白找到匹配的遗传物质。

Anthropic 的实验室工作发现,ART 阵列同样会被转录为不同的短 RNA。在一份葡萄球菌噬菌体数据集中,感染 15 分钟后,源自阵列的 RNA 占该噬菌体 RNA 的比例最高可达 8%。

研究人员在培养噬菌体和预测病毒序列中识别出 95 个不同的 ART 相关 RT 簇。其中 28 个具有位于上游、可检测到的重复阵列。该系统通常由三种元素组成:一个逆转录酶、一个相邻的伴侣基因,以及一个由等间距 DNA 重复序列构成的阵列。

这些观察结果支持 ART 是一个此前未被表征的生物系统这一主张,但并未揭示该系统的功能。Anthropic 的研究人员尚未证明逆转录酶具有活性、它是否以这些短 RNA 为底物,或 ART 是否靶向其他遗传序列。

因此,最有趣的可能性仍处于开放状态,而非已经确立。ART 或许代表另一种可编程分子系统,也可能其类似 CRISPR 的架构在噬菌体内承担完全不同的角色。

为什么与 CRISPR 的比较很重要

这一比较之所以重要,是因为 CRISPR 起初同样只是一个功能未明的重复模式,而不是因为 ART 已能进行基因编辑。

科学家最早在 1987 年研究一个大肠杆菌基因时,发现了后来被称为 CRISPR 的结构。他们注意到一串陌生的重复 DNA 序列,却不理解其功能。最初的 CRISPR 序列90183-4)出现多年后,研究人员才将这些重复序列与微生物免疫联系起来。

CRISPR 一词于 2002 年出现。后续研究证实,细菌和古菌会在重复序列之间储存病毒遗传物质片段。从这些区域复制出的 RNA 可帮助相关蛋白识别并攻击匹配的入侵者。

研究人员最终将这一机制改造为可编程的基因组编辑工具。历史的启示并不是每个重复阵列都会成为生物技术平台,而是一个奇特的基因组模式可能标记着某种机制,其重要性只有在多年实验工作后才会显现。

ART 共享了其中一部分视觉语法。它的重复单元由可变序列分隔,且该阵列会产生短 RNA。这些特征足以支持进一步研究:这些 RNA 是否会引导或编程另一种分子活动。

几项差异也削弱了将二者直接等同的说法。技术报告没有发现附近存在 cas 基因,而这些基因编码的是已知 CRISPR 系统中的核心蛋白。ART 的间隔序列在近缘噬菌体间似乎也具有保守性;而 CRISPR 间隔序列通常会随着微生物遭遇不同病毒而变化。

ART 围绕逆转录酶构建,而非围绕已知的 CRISPR 相关核酸酶。核酸酶会切割核酸,逆转录酶则将 RNA 复制为 DNA。这一差异意味着,ART 或许参与基因组修饰,但其运作方式未必类似熟悉的 CRISPR 工具。

曾参与开发 CRISPR 基因组编辑技术的 Broad Institute 和 MIT 研究人员 Feng Zhang,在 Anthropic 公告前审阅了这篇预印本。他称,与逆转录酶相关的 RNA 重复阵列确实耐人寻味,值得进一步研究。

这一反应支持该发现的科学价值,但并不构成独立实验确认。目前尚无外部实验室发表证据,证明 ART 的功能或可编程性。

因此,这一比较最适合作为研究路线图。CRISPR 为科学家提供了理由,去询问 ART 源自重复序列的 RNA 是否编码靶标、引导某种酶,或记录信息;但它并未给出答案。

另一个研究团队报告称,在另一类逆转录酶旁也发现了非编码 RNA 阵列。其基因组挖掘预印本利用专门构建的基因组语言模型,识别出相关的结构模式。

这一平行发现之所以重要,是因为它表明,与重复序列相连的逆转录酶可能并非单一偶发现象。类似架构可能已不止一次地演化出来,或许是因为它们解决了反复出现的生物学问题。

同样的证据也使 Anthropic 的主张不再那么独特。AI 辅助基因组挖掘早已被用于研究晦涩的非编码元件及其相关蛋白。Claude 的贡献部分在于,它使用的是通用模型和智能体框架,而不是专为单一基因组任务设计的系统。

Anthropic Claude 的酶系统发现之所以引人注目,是因为该模型似乎在没有被提示寻找重复序列的情况下,注意到了决定性的阵列。研究简报的目标是 RT 伴侣基因,而智能体是在追踪一条最初被否决的线索后发现该阵列的。

这很像科学研究中的偶然发现。研究者原本寻找一种关系,却发现异常并改变方向。如今更重要的问题是,AI 能否可靠地产生这种模式,而不只是某一份成功记录听起来像人类所为。

真正的竞争是可靠发现,而非幸运地注意到异常

Anthropic 最强的结果是 Claude 识别出了异常;其最大弱点是,该系统很少能准确找到应当查看的位置。

这项发现活动在有限但有意义的层面上实现了自主运行。研究人员提供初始简报后,该框架在无人干预下运行了超过 21 小时。Claude 组织任务、构建计算搜索、淘汰较弱候选对象,并发起后续调查。

没有科学家指示成功的智能体去检查重复阵列。模型独立载入上游序列、描述该模式、编写分析代码、将结构与已知系统比较,并准备供人类审查的报告。

这不只是总结论文或提出一项熟悉的实验。该系统从一个宽泛目标出发,得出了原始任务未明确指定的观察结果。

然而,Anthropic 在首次发现后将相同活动重跑了十次。没有一次重跑重新发现该阵列。

几次重跑抽样了与 ART 相关的序列,其中两次调查了相关谱系。但这些智能体仍未能载入包含重复序列的上游 DNA 区域。Claude 可以识别这一特征,但该工作流无法稳定地将这一特征呈现给模型。

这一区别改变了对“自主发现”的理解。成功的运行表明,该模型具备有用的模式识别和后续追踪能力。十次遗漏则表明,周边智能体系统尚无法实现可靠覆盖。

Anthropic 进行了更受控的测试,以区分识别能力与搜索行为。研究人员向七个 Claude 模型提供了五种细节层级的 ART 相关输入,既有直接置于提示词中的内容,也有通过文件和工具提供的内容。

当相关序列被直接置入上下文时,最强的模型在至少 90% 的试验中识别出该阵列。当模型必须通过工具定位和读取这些序列时,表现下降。在某些条件下,识别率最低降至 32%。

在 39% 基于文件的尝试中,模型从未读取过至少连续 200 个核苷酸的片段。因此,它看到的原始序列太少,无法识别超过一个重复单元。

瓶颈并不只是生物学推理,而是开放式工作流中的注意力管理。

智能体拥有有限的时间、上下文和计算资源。它必须决定打开哪些文件、检查哪些区域,以及哪些异常值得再启动一项任务。即使模型能力很强,如果工具在摘要过程中忽略了决定性证据,它仍可能错过一项发现。

这为 AI 科学建立了一个更具实践意义的基准。一个有用的发现系统,不能只是在研究人员把某种模式摆在眼前时识别出来;它还必须能够反复穿行于庞大的搜索空间,并决定该检查哪些关键证据。

传统科学软件通常通过确定性流程处理这一问题。研究人员会为重复序列、蛋白质结构域、保守邻域或进化关系定义明确的搜索条件。这些方法较为狭窄,但行为一致。

通用 AI 智能体则提供了不同的优势。它可以结合文献综述、代码生成、序列分析、假设形成和书面解读。当结果与其最初预期相矛盾时,它也可以改变方向。

代价是结果的可变性。即使收到相同的任务简述,两次运行也可能沿着不同分支推进。一次会话可能检查原始 DNA,另一次则可能接受摘要后继续向前。

因此,Anthropic 的结果同时对 AI 实验室和科学软件开发者提出了压力。通用智能体必须变得更具可复现性;专业工具则必须更易于让智能体选择和编排,同时不丢失原始证据。

更强的系统应结合两种方法。确定性检查可以要求智能体查看最小序列窗口、运行重复检测软件,并保留中间证据。语言模型随后便可专注于选择假设,以及关联意外结果。

这与生物学之外的高质量知识工作相似。当 AI 系统能够保留源材料、检查底层记录,并跨任务关联发现时,就能产出更好的分析结果。结构化的 AI 知识库无法取代专家判断,但能够降低决定性证据在摘要中消失的风险。

对 Anthropic 而言,如今可靠性比再增加一大批智能体更重要。若能将十一轮活动中的一次成功转化为可重复的结果,将比扩大智能体集群更有力地证明自主科研的价值。

湿实验缩小了主张范围,但尚未定论

实体实验确认这些阵列会产生 RNA,但尚未证明该酶的活性或生物学用途。

AI 生物学公告常常混淆三项不同的成就:提出假设、验证可观测特征,以及证明有用功能。Anthropic 已经为 ART 完成了前两个阶段中的部分工作。

计算研究活动识别出这种基因组排列,并提出它代表一个系统。随后,人类科学家测试了这些重复阵列是否会表达。他们检测到了不同的短 RNA 产物,这支持了该阵列参与活跃生物过程的观点。

这一验证很重要。基因组数据库中存在测序错误、不完整的组装结果,以及没有功能意义的模式。观察到 RNA 表达,使 ART 更难被视为计算伪影。

然而,仅有转录并不能解释这一系统。DNA 区域可以产生 RNA,却未必控制某种可编程酶。研究人员仍需确定 ART 逆转录酶是否会复制这些 RNA、伴侣蛋白是否参与其中,以及最终会产生什么生物学结果。

当前工作也缺乏独立重复。Anthropic 发布的是技术报告,而非同行评审期刊论文。外部研究人员可以检查其方法,但尚无其他实验室公开复现相关生化观察结果。

该公司因记录不利结果而值得肯定。十次失败的重复运行和较弱的基于文件的基准测试得分,使其营销措辞更为复杂,但这些内容确实出现在报告中。

这些披露让读者能够区分三项主张。

第一,Claude 在一次无监督研究活动中发现了一个此前被忽视的基因组模式。现有日志和方法支持这一说法。

第二,ART 是一个此前未经表征的系统,其重复阵列会产生短 RNA。Anthropic 的实验支持这一结论,但仍有待外部重复验证。

第三,ART 可与 CRISPR 相比,作为一种可编程基因编辑平台。现有证据并不支持这一结论。

Anthropic 自身使用的语言比一些摘要更为谨慎。它描述了“让人联想到 CRISPR”的特性,并称该系统可能涉及某种类似机制。它也表示,ART 的主要功能仍然未知。

第二项和第三项主张之间的差距,可能需要大量工作才能弥合。研究人员必须纯化或表达相关蛋白质,识别分子底物,测量活性,并测试改变间隔序列是否会改变靶标。

他们还需要确定 ART 的自然作用。由于该系统主要出现在噬菌体中,它可能帮助病毒复制遗传信息、规避细菌防御、操纵宿主细胞,或与其他噬菌体竞争。每一种可能性都意味着不同的实验计划。

如果该系统变得可编程,安全和治理将变得重要。Anthropic 表示,其实验室不研究能够感染人类的病原体。目前的实验距离临床或高风险基因编辑应用仍很遥远。

该公司也在探索让 AI 智能体操作科学仪器的方法。其 hardware standard preview 描述了一种适用于显微镜、液体处理器、机械臂及其他可编程设备的通用接口。

ART 并非诞生于一个完全由机器人运行的实验室。Claude 进行了数据库搜索并协助分析,而人类科学家完成了湿实验。这一区分很重要,因为它限制了对自主性的主张,也限制了即时的实体风险。

将智能体分析与自动化实验结合,能够形成更完整的发现闭环。AI 系统可以提出候选对象、安排测试、检查结果,并修正自身假设。但这也会带来与仪器控制、污染、实验设计和不安全目标有关的额外失效模式。

Anthropic 已经观察到,Claude 可能难以处理物理约束。在一次实验室自动化测试中,气泡造成错误后,模型重复尝试液体处理操作,结果使问题进一步恶化。人类指导帮助它识别物理原因并调整行为。

这个例子揭示了当前 AI 科学的核心局限。模型可以跨越海量符号信息进行推理,但并不具备科学家长期积累的物理直觉。湿实验室会暴露那些在文本或代码中看似合理的错误。

因此,ART 正因为结果尚不完整,才是一个有价值的早期测试。AI 生成了一个有前景的线索;人类实验确认了其中一部分是真实的;但双方尚未解释其中的生物学机制。

科学家和 AI 开发者接下来应关注什么

三个信号将决定 ART 会成为重要发现,还是停留在一个具有启发性的 AI 生成线索。

第一个信号是功能验证。研究人员需要证据证明,逆转录酶或其伴侣蛋白会执行涉及阵列来源 RNA 的可测量反应。

一项有说服力的实验,应识别该酶的底物和产物。更有力的证据则应表明,改变重复序列或间隔序列会以可预测的方式改变分子结果。

如果 ART 被证明具有可编程性,与 CRISPR 的比较就更有依据。如果其 RNA 与酶活性无关,即使该系统在生物学上仍然有趣,这一比较也会减弱。

第二个信号是独立重复。另一家实验室应确认这些 RNA 产物、重建该系统,并在不依赖 Anthropic 内部流程的情况下测试其组成部分。

独立结果将把生物学本身与该公司的模型演示区分开来。如果无法复现这些观察结果,就必须更仔细地审视实验条件、序列选择和分析过程。

同行评审会有所帮助,但仅仅发表并非决定性的门槛。来自具有不同激励机制和设备条件的研究人员的功能实验,将更具分量。

第三个信号是研究活动的可复现性。Anthropic 或其他团队应在设置保障措施的情况下重新运行该发现流程,强制智能体检查有前景位点周围的原始序列。

受控基准测试已经表明了直接干预的方向。当 Claude 阅读相关 DNA 时,它通常能够识别这些重复序列。更好的测试框架应让这种检查系统化,而不把整个流程变成专门为寻找 ART 设计的脚本。

研究人员应报告多次运行中的成功情况,而不仅是最佳记录。他们还应披露有多少候选对象需要人工审查、每次研究活动使用了多少算力,以及哪些自动化决策改变了最终结果。

如果改进后的系统能在大多数可比运行中发现 ART,那么最初十一分之一的结果将更像早期工程限制。如果成功仍然罕见,自主发现仍会更像机会驱动的探索,而不是可靠的科学基础设施。

这并不意味着最初的观察毫无价值。人类科学同样依赖机缘、不同寻常的关注,以及愿意追踪微弱信号的研究者。AI 的价值或许部分来自于创造更多这样的机会。

经济问题在于,这些机会是否足以证明筛选其输出成本的合理性。Anthropic 的研究活动产生了数千个可能关联,以及一小部分值得阅读的报告。人类专家仍必须判断候选对象并开展实验。

对一线科学家而言,眼下的教训比“AI 可以取代研究人员”更为有限。通用智能体能够以个人无法长期维持的规模,在文献、基因组数据和计算工具之间进行搜索。但除非工作流程保留原始数据并要求充分检查,否则它们也可能遗漏显而易见的证据。

对 AI 开发者而言,ART 提供了一个比精心润色的科学文本更好的基准。一个智能体能否探索开放搜索空间、保存证据、识别异常、质疑自身的第一个解释,并在之后复现这一过程?

对企业和知识工作团队而言,同样的设计原则也适用。智能体质量取决于其对原始记录的访问、可追溯的决策和可重复的检索。一个有用的 可搜索知识库 应帮助人们核实答案是如何得出的,而不只是给出一个自信的结论。

Anthropic 的 Claude 酶发现已经跨过了一项有意义的门槛。Claude 注意到一种研究人员尚未表征的基因组结构,并将人类的注意力引向了它。

它尚未跨过可重复发现、独立验证或已证明的基因编辑功能这些更困难的门槛。这些才是现在真正重要的衡量标准。

关注实验,而不是类比。如果 ART 被证明具有可编程性,且其他实验室能够复现它,Anthropic 将拥有一个 AI 发起重大生物学发现的有力案例。如果其功能仍然难以捉摸,该项目依然会揭示一件有价值的事:AI 可以生成科学线索,但可靠的科学始于这些线索经受住与证据的反复接触。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page