Anthropic AI 科学发现面临人类现实检验
Anthropic 表示,Claude 在约 950 个 AI 智能体对基因组数据进行了 21 小时搜索后取得了一项科学发现,识别出一个不同寻常的酶系统。Anthropic 的这项 AI 科学发现确实值得关注,但“自主”一词所承载的分量,超过了现有证据所能支持的程度。
Claude 在噬菌体中发现了一种此前未经表征的基因与重复 DNA 序列排列方式。噬菌体是一类感染细菌的病毒。Anthropic 将该系统命名为阵列相关逆转录酶,即 ARTs。随后,人类科学家筛选出这一线索,设计或开展实验室工作,解读结果,并发表了一篇尚未经过同行评审的预印本论文。
这种分工至关重要。Claude 做的不只是概述论文或回答科学家提出的狭窄问题。它搜索了原始生物数据,排除了数千个候选项,并发现了一个出人意料的模式。不过,Anthropic 的研究人员仍然提供了研究方向、实验室基础设施、判断力和实体验证。
因此,这一结果挑战了两种简单叙事。它有力反驳了“大语言模型只会重组文本”的说法,但又不足以支持“独立机器科学家”的设想。最准确的描述是:在由人类设计的科学流程中,由 AI 主导开展的计算搜索。
Anthropic 和 Claude 实际发现了什么
Claude 识别出了一条可信的生物学研究线索,而非一项已完成的基因编辑技术,也不是一种得到完整解释的分子机制。
Anthropic 于 2026 年 9 月 23 日宣布了这一发现,同时推出新的生命科学研究团队和分子生物学实验室。该公司表示,位于湾区的实验室开展风险较低的 BSL-1 和 BSL-2 工作。所有实体实验均由人类科学家完成。
该项目始于一项宽泛的人类指令。Anthropic 的研究人员要求 Claude 在大型 DNA 数据库中寻找有趣的逆转录酶实例。逆转录酶是一种将 RNA 复制为 DNA 的酶。
Anthropic 在一次持续 21 小时的计算运行中协调了约 950 个 Claude 智能体,共使用约 2.1 亿个 token。这些智能体收集了超过 20 万种逆转录酶,并识别出 3,500 个候选系统。
随后,它们将这一集合缩小至 20 个候选项,以进行更深入的分析并生成供人类阅读的报告。Anthropic 表示,等量的基因组挖掘工作可能会让一名专家科学家忙上数周甚至数月。
其中一个智能体聚焦于在一种巨型噬菌体中发现的异常逆转录酶。此前研究中已出现过这种基础酶,因此 Claude 并未发现该蛋白质本身。它的贡献在于识别出一种更大的排列结构,而此前研究人员尚未对其进行表征。
Claude 注意到,在该酶的基因旁边存在一个伙伴基因,以及一组间隔均匀的 DNA 重复序列。这些重复序列类似于与 CRISPR 系统相关的部分架构。
CRISPR 是一种天然的微生物防御系统,科学家已将其改造为可编程的基因编辑工具。其重复阵列有助于生成 RNA 引导序列,后者可将相关蛋白质引导至特定的遗传靶点。
据报道,ART 排列包含三个组成部分:一种逆转录酶、一个相邻的辅助基因,以及一个长重复阵列。Anthropic 的早期实验表明,该阵列会产生彼此独立的短 RNA 分子。
这一观察结果使 ART 具备科学研究价值。它提出了一种可能性:RNA 分子会引导或影响该系统的活性。不过,研究人员尚未确定它在自然界中的生物学作用。
Anthropic 尚不清楚 ART 在噬菌体或受感染细菌细胞中发挥何种作用。它也尚未证明研究人员能够对该系统进行编程、将其导向选定的 DNA,或安全地加以使用。
该公司的研究公告承认了这一缺口。公告称,该系统具有让人联想到 CRISPR 的特性,同时指出其功能仍然未知。
配套的技术预印本在 Anthropic 公布结果时尚未完成同行评审。同行评审无法解决所有问题,但会让独立专家审视其方法和解读。
MIT 教授、CRISPR 先驱 Feng Zhang 在 Anthropic 公告发布前审阅了这篇预印本。他称 RNA 与重复序列之间的关联“确实很有意思”,并表示这一发现值得进一步研究。
这是一种有意义的支持,但其表述刻意保持有限。“有意思”并不意味着它有用、可编程,或已被验证为一种基因编辑机制。它只是意味着这一模式值得开展更多实验。
因此,准确的事件范围比标题版本更窄。Claude 的酶发现产生了一个新的候选分子系统,并提供了其重复阵列以 RNA 形式表达的早期证据。其机制和实用性仍是悬而未决的问题。
为什么 Anthropic 的 AI 科学发现很重要
重要的变化不在于软件取代了科学家,而在于一个通用 AI 系统能够在异常庞大的生物学搜索中作出有价值的判断。
计算生物学数十年来一直依赖自动化。研究人员经常使用算法比较序列、聚类蛋白质、预测结构,并识别共同出现的基因。
Claude 的角色超出了执行单一固定分析的范围。Anthropic 表示,这些智能体阅读文献、复现已知结果、编写代码、检查基因组邻域、对异常候选项排序,并生成解释其推理过程的报告。
这套工作流结合了研究人员通常会分开的多种活动,其中包括检索、编程、统计检查、模式识别、文献比较以及书面科学论证。
传统流程可以更快、更可预测地完成其中许多步骤。不过,科学家通常会预先定义其执行顺序、阈值和输出。Claude 获得了一个更宽泛的目标,并在搜索过程中作出中间选择。
这一区别解释了该项目为何引发关注。据报道,该系统决定某个逆转录酶家族值得进一步调查,检查了附近 DNA,并识别出该重复阵列。
这些智能体还舍弃了大多数候选项。决定不追踪什么,是科学工作中的核心环节,因为生物学数据库中存在无数相关性和异常现象。
Anthropic 表示,它会研究专家接受或拒绝哪些由 Claude 生成的假设。该公司随后利用这些判断来改进未来指令,实际上是在向系统传授科学品味的某些方面。
这种方法改变了瓶颈。当软件能够生成数百份看似合理的报告时,提出想法会变得更容易。决定哪些想法值得投入实验室时间则变得更重要。
这种转变也为研究人员和 AI 竞争者带来压力。Google DeepMind 通过 AlphaFold 树立了最著名的先例,该系统可根据氨基酸序列预测蛋白质结构。它的影响力来自于大规模解决一个界定明确的科学问题。
Anthropic 追求的是更广泛的模式。它希望 Claude 能够在同一工作流中导航文献、数据、软件工具和实验反馈。其科学工作台将 Claude 与超过 60 个科学数据库和专业研究系统连接起来。
其他实验室也在探索相关的基于智能体的方法。Stanford 研究人员曾使用多组 AI 智能体来提出和评估药物开发策略。Sakana AI 的 AI Scientist 项目则尝试自动化机器学习实验和论文写作。
这些工作在科学质量和自主性方面差异很大。不过,它们共同指向一种竞争:哪家机构能够将强大的模型与可信数据、专家审查和实体实验连接起来。
Anthropic 的 AI 科学发现同样重要,因为它使用的是通用模型。Claude 并非专为寻找逆转录酶或识别某一种基因组特征而构建。
通用系统能够在不同任务间切换,而不必为每一个研究问题训练新模型。对于数据集、假设和软件工具不断变化的实验室而言,这种灵活性很有吸引力。
这也使评估更加困难。专业模型可根据明确的基准进行测试。智能体研究流程包含许多决策,而成功在一定程度上取决于提示词、工具、数据库和人类介入。
公布的数字展示了规模,而非效率。与数月的专家劳动相比,让 950 个智能体运行 21 小时听起来很快。然而,Anthropic 尚未公布与传统计算流程进行完整的经济性比较。
Token 数量无法揭示总计算成本、工程时间、失败项目,以及准备工具和数据所投入的劳动。Anthropic 指出,ART 线索来自一项更广泛的研究计划,而不是一场轻松的聊天机器人对话。
因此,正确的结论在于搜索能力。Claude 似乎能够扩大一个小型专家团队可以考察的生物学可能性范围。即使人类保留每一个关键决策,这也可能加速发现。
对在职科学家而言,这更像是一个扩展后的研究团队,而不是独立同事。智能体可以并行调查多条线索,而人类负责管理实验室资源,并决定何种证据具有说服力。
生物学以外的知识工作者也会认出这种模式。当 AI 能够连接分散信息、保留上下文,并展示其推理供人审查时,它最有价值。经过精心维护的AI 知识库可以支持类似的可审查工作流,而不会假装人类判断已经消失。
真正的争议在于 Anthropic 的自主性主张
核心争议不在于 Claude 是否作出了贡献,而在于它的贡献是否足以称其“自行”发现了该系统。
Anthropic 将这项工作描述为仅在高层级指导下完成的自主发现。这种说法体现了一项重要的技术成就,但它压缩了一连串人类选择。
研究人员选择了逆转录酶作为广泛搜索领域。他们汇集或开放了相关工具和数据库。他们构建了协调众多 Claude 会话的运行框架。
人类同样决定哪些输出值得投入实验室资源。Anthropic 表示,智能体将搜索范围缩小到 20 个有说服力的候选项,但专家审查仍是筛选过程的一部分。
在计算筛选后,人类科学家在实验室菌株中表达蛋白质,并从生化和结构层面对其进行表征。他们在 Claude 的协助下解读结果。
最终结论源自这种合作关系。Claude 发现了该模式,但人类决定该模式构成一个可能新颖的系统,并值得发表。
这并不意味着 Claude 只是一个被动工具。显微镜不会决定该看向哪里,普通搜索软件在发现异常后通常也不会撰写调查计划。
然而,“自行”意味着在问题选择、证据收集、实验、解读和验证方面都具有独立性。已公布的工作流程并未达到这一标准。
更好的框架是将主动性与自主性区分开来。Claude 在一项受限任务中展现了主动性,因为它自行选择分析步骤,并追踪了一个意料之外的候选对象。它并未独立制定研究计划,也没有完成整条证据链。
科学发现也存在多个可能的门槛。发现一种此前未被报道的模式是一个门槛。证明可重复的分子功能则是另一个。确立实际价值的门槛要高得多。
Anthropic 跨过了第一个门槛,并开始接近第二个。该公司发现了一种此前未被表征的基因排列,并报告了实验证据,表明其重复阵列会产生 RNA。
它尚未证明这些 RNA 分子发挥何种作用。它也未证明 ART 能够编辑基因、保护宿主、复制目标序列,或执行其他可编程操作。
这一差异削弱了与 CRISPR 的比较。ART 的重复序列在结构上看起来让人联想到 CRISPR 阵列,但视觉或基因组层面的相似,并不能证明二者行为等同。
CRISPR 之所以具有变革性,是因为多年的研究确立了它的功能,研究人员也学会了如何对其进行编程。ART 仍处于这条路径的起点附近。
独立报道也体现了这种谨慎。一篇 Nature analysis 将该结果描述为对 Anthropic 新实验室的一瞥,同时强调该系统的功能仍未得到解析。
这一发现也出现在由 Anthropic 员工撰写的一篇预印本中。这是分享早期科学成果的常规方式,但这意味着提出商业 AI 主张的机构,也产出了最初的科学证据。
独立复现将降低这种利益冲突。其他团队必须能够找到同一 ART 家族,复现 RNA 相关发现,并检验所提出的机制。
问题不在于企业科学家能否开展有效研究。他们显然可以。担忧在于,产品定位可能会推动比现有证据所支持的更强烈的公开表述。
将 Claude 称为自主发现者,有利于 Anthropic 更广泛的商业论证。该公司正将 Claude 推销为能够处理漫长、复杂知识型工作的系统。
可信的科学成果会成为能力证明、招聘工具,以及面向制药或生物技术客户的展示。这并不意味着该发现是虚假的,但它提高了透明度标准。
完整的说明应展示每个阶段融入了多少人工输入。它应说明初始提示词、工具配置、排序方法、人工剔除标准和失败的搜索运行。
它还应将智能体工作流与更简单的基线方案进行比较。传统的基因组挖掘流程能否以更少的算力找到同样的重复序列?一名受过训练、使用成熟软件的研究生,是否会以类似方式对 ART 进行排序?
缺少这些比较,公众可以判断其新颖性,却无法评估相对效率。Claude 找到了有趣的东西,但证据并未表明智能体群是当时最佳可用方法。
将 Anthropic 的 AI 科学发现描述为协作成果最为稳妥。模型提供了搜索规模和灵活分析。科学家则提供了目标、基础设施、实体实验,以及认知责任。
Claude 酶发现尚未证明什么
最大的未知仍然是生物学层面的,因为目前无人知道 ART 的天然功能,或其异常结构是否具有实际价值。
第一项检验是机制层面的。研究人员需要确定逆转录酶复制什么、重复序列衍生 RNA 如何与其相互作用,以及辅助蛋白发挥何种作用。
他们还必须确定该系统在噬菌体中的用途。它可能支持病毒复制、改变宿主防御、记录信息、与其他病毒竞争,或执行某种无关功能。
这些可能性仍然只是假设。酶旁的重复阵列是一个强有力的线索,但生物学中存在许多功能不同于其表面类比对象的结构。
第二项检验是可编程性。CRISPR 之所以变得有用,是因为研究人员可以借助设计好的 RNA 序列重新定向其活性。ART 尚未展示可比的靶向能力。
科学家需要改变 ART 的重复序列,并证明这种改变能够以可预测方式重新定向该系统。他们还需要测量准确性、效率和非预期影响。
第三项检验是可重复性。独立实验室应确认 RNA 产物确实存在,并确认各组件会作为一个系统协同运作。
第四项检验涉及范围。Anthropic 报告称,ART 主要出现在噬菌体中。研究人员需要确定该家族分布有多广,以及其变体之间有何不同。
即使底层序列原本已可获取,在公开基因组数据中发现的结果也可以具有新颖性。科学新颖性往往来自识别出此前无人描述的关联。
不过,可访问数据的存在也创造了有用的复现检验。外部团队可以检索同一批记录,并确定该模式是否能经受不同方法的检验。
第五项检验涉及 Claude 本身的角色。Anthropic 应提供足够细节,使研究人员能够区分模型推理、流程设计和暴力式并行计算的作用。
约 950 个智能体和 2.1 亿个 token 代表了相当可观的计算投入。其总量或许仍优于专家劳动力投入,但 Anthropic 尚未提供标准化的生产力衡量指标。
成功率同样重要。一个有趣的结果无法揭示同一流程产生误导性候选对象的频率。一个生成大量看似合理故事的系统,可能增加而非减少实验室工作。
Anthropic 承认,大多数候选对象会被淘汰。其研究人员正在研究什么因素能将有价值的提案与较弱提案区分开来,这表明筛选问题仍然相当突出。
语言模型能够针对偶然模式给出自信的解释。生物数据库尤其容易受到影响,因为其庞大规模使偶然关联不可避免。
人工审查能避免部分失败,但也可能引入确认偏差。期待 AI 智能体发现异常系统的研究人员,可能会更宽容地解读处于边缘的模式。
透明披露负面结果将有所帮助。Anthropic 可以报告有多少研究活动未产生可行候选对象、有多少实验室测试失败,以及专家排序发生变化的频率。
该公司还可以发布消融研究。这些测试会移除工作流中的部分环节,以展示智能体规划、文献访问或并行执行,究竟是哪一项带来了所观察到的优势。
该预印本的同行评审状态同样值得关注。同行评审并不完美,但审稿人可以发现被忽略的既有研究、薄弱的对照和替代性解释。
在科学期刊发表不会自动验证 Anthropic 关于自主性的主张。不过,它将强化 ART 作为真正新系统的生物学证据。
更广泛的研究也支持对通用 AI 创造力保持谨慎。一项 2026 年研究涉及数千名科学家,发现当前系统难以在跨学科领域提出既被专家认为原创、又被认为有用的想法。
这项 scientist evaluation 并未否定 ART 的结果。它说明了为何一个成功案例不应被转化为关于机器主导科学的普遍主张。
与需要新社会理论或情境化解读的领域相比,生物学或许更适合智能体式搜索。基因组数据库包含结构化记录,软件可以反复、大规模地检视这些记录。
因此,这一结果或许代表了有意义的特定领域成功,却无法证明普遍的科学自主性。这种解读既符合证据,也保留了其成就价值。
其中也存在安全方面的张力。用于在生物数据中寻找有用机制的同类系统,也可能降低研究有害机制所需的投入。
Anthropic 最近收紧并调整了围绕先进生物学工作的安全措施。合法研究人员有时报告称,安全过滤器会打断普通科学问题。
该公司如今面临两项相互竞争的要求。它希望 Claude 开展雄心勃勃的生物学研究,同时阻止外部用户将类似能力用于危险病原体。
ART 本身来自噬菌体,而非感染人类的病毒。Anthropic 表示,其实验室不处理人类病原体。这些事实限制了该项目的即时风险。
更大的治理问题依然存在。如果智能体系统变得更擅长提出实验方案,组织将需要基于研究人员身份、项目目的、材料和实验室准入的管控措施。
这场讨论不应掩盖科学成果本身,但它应纳入任何对规模的评估之中。更快的假设生成会带来更多机会,也会产生更多需要负责任审查的候选对象。
三个信号将决定这一主张能否站得住脚
下一阶段必须以独立的生物学证据、可复现的工作流和可衡量的研究生产力,取代宣传性语言。
第一个信号是经过验证的 ART 机制。研究人员必须证明该系统的作用,并解释其逆转录酶、重复序列衍生 RNA 与辅助蛋白如何相互作用。
即便 ART 永远不会成为医疗工具,一个令人信服的结果也将强化 Anthropic 的科学主张。发现并不要求立即实现商业化。
可编程活性会进一步提高重要性。如果科学家能将 ART 重新定向至选定目标,那么与 CRISPR 的比较将更具实质内容。
若无法找到连贯的机制,这一叙事将被削弱。ART 或许仍是一个有效的基因组观察结果,却会失去作为重大分子发现的地位。
第二个信号是独立复现。一个无关联实验室应借助共享方法或等效工具,复现计算发现和关键实验。
复现将同时检验生物学和工作流。它可能揭示 Claude 找到的是稳定模式,还是 Anthropic 的内部设置塑造了结果。
外部研究人员还应检索是否存在被忽略的既有描述。当专家将新结果与晦涩的早期工作联系起来后,新颖性主张往往会收窄。
确认将强化 Claude 酶发现确实带来了新知识的论据。重大修正则将表明,为何应谨慎对待预印本和公司公告。
第三个信号是在多个项目中反复取得表现。Anthropic 需要的不只是一个成功候选对象,才能证明这是一种可靠的新研究方法。
未来报告应包括研究活动总数、失败假设、实验室验证转化率、人工小时数、算力使用量,以及与成熟流程的比较。
这些指标将回答研究机构面临的实际问题:AI 智能体能否在单位专家时间内产出更多经验证的发现,还是主要制造更多需要审阅的材料?
Anthropic 已经建立了周边基础设施。其生命科学团队包括从事药物发现、科学工具,以及面向生物学和化学的模型训练的团队。
该公司还与包括 Allen Institute 和 Howard Hughes Medical Institute 在内的研究机构建立了合作关系。这些合作为在 Anthropic 自身实验室之外测试 Claude 提供了机会。
外部使用会比又一次内部展示更具参考价值。独立科学家会带来不同的问题、标准和激励机制。
竞争对手的回应将成为辅助证据。Google DeepMind、OpenAI、专业生物技术公司和学术实验室都在开发 AI 辅助研究系统。
如果多个团队开始报告由通用智能体带来的、可重复的发现,ART 将成为更广泛转型的早期案例。如果类似结果仍然罕见,它则会显得更为特殊。
读者不应将这场讨论视为“欺诈”与“完全自主”之间的二选一。现有证据支持一种影响更为深远的中间立场。
Claude 似乎完成了通常需要受过训练的研究人员才能完成的真实分析工作。人类科学家仍掌控着研究环境,并对每一项实体层面的结论承担责任。
这种安排能够改变科学研究,而不必产生一位完全独立工作的机器科学家。大多数具有重大影响的技术,最初都会改变劳动分工,而非将人从中移除。
因此,Anthropic 的 AI 科学发现值得关注,原因在于它展示了当下的能力:通用 AI 智能体可以搜索生物数据、追踪异常现象,并生成可供实验室验证的假设。
它尚未证明能够从提出问题到得出经验证结论的独立科学研究。Anthropic 的表述走在证据前面,尤其是在暗示 Claude 是自行行动的时候。
务实的回应是关注实验,而不是形容词。应寻找明确界定的 ART 机制、独立重复验证,以及其在多个研究项目中的透明表现。
研究人员和知识工作者也应将同样的标准应用于自己的 AI 工作流。保留来源,记录提示词和决策,公开不确定的步骤,并让具备资质的人员负责验证。
ART 会成为一种可编程的生物工具,还是仅仅是从旧数据中发现的一个耐人寻味的模式?这个答案很重要,但这一工作流也面临同样重要的检验。Anthropic 必须证明,Claude 能够在外部审查下重复这一表现。在此之前,最有力的结论应当谨慎但不失分量:Claude 帮助产生了一条可靠的科学线索,而人类仍将这条线索转化为了科学。



