top of page

Anthropic AI 科学发现主张面临更严苛的检验

9月30日
讀畢需時 16 分鐘

Anthropic 表示,约 950 个 Claude agents 在对基因组数据进行了 21 小时搜索后,发现了一个此前未被表征的酶系统。Anthropic 关于 AI 科学发现的主张意义重大,但“发现”一词的分量,远超一次成功的数据库检索。

Claude 选定了一种不同寻常的逆转录酶,考察了附近的 DNA,并注意到一种重复结构,与 CRISPR 系统的一部分相似。随后,人类科学家审查了这一线索,设计实验室工作,完成全部实体实验,并解读所得证据。

这种分工构成了真正的争议点。Claude 显然做出了有意义的智力贡献,但这一发现仍只是一篇生物学功能未知的预印本。Anthropic 的技术报告称,在另外十次搜索活动中,该系统也未能得出同样的观察结果。

因此,这个故事的意义超越了一个酶候选物。它提出的问题是:一家企业、期刊或研究团队在宣称 AI 系统实现科学发现之前,应当具备哪些证据。

Anthropic 和 Claude 实际发现了什么

Claude 做的不只是总结论文,但它也没有独立完成一项科学研究。

Anthropic 于 2026 年春季成立了分子生物学研究团队。这家位于湾区的实验室将 Claude 的计算搜索与人类科学家开展的实体实验结合起来。

该团队在基因组数据库中搜索未被表征的生物系统。基因组数据库包含来自生物体、病毒和环境样本的 DNA 序列,其中许多基因的功能仍然未知。

在首个公开项目中,Anthropic 要求 Claude 研究逆转录酶。逆转录酶,或 RT,是一种将 RNA 复制为 DNA 的酶。

该公司称,Claude 的 agents 收集了超过 20 万条 RT 序列,识别出约 3,500 个候选系统,并将范围缩小到 20 个候选对象,以生成详细报告。

这次搜索动用了约 950 个并行 agents,运行 21 小时,消耗约 2.1 亿 tokens。这些数字来自 Anthropic,尚未获得独立的运营验证。

一名 Claude agent 检查了一种在巨型噬菌体中发现的异常 RT 周围的原始 DNA。噬菌体是感染细菌的病毒,而巨型噬菌体拥有异常庞大的基因组。

该 agent 注意到 RT 旁边存在一长串重复 DNA 序列。它还识别出一个相邻基因,可能编码一种协同作用的蛋白质。

Claude 统计了重复序列,检查其间距,将基因组排列与已知系统进行比较,并搜索相关文献。随后,它将该候选对象提交给人类审查。

Anthropic 将这种由三部分构成的排列命名为 array-associated reverse transcriptases,即 ARTs。该系统包含 RT、相邻的协同基因,以及一组重复 DNA 序列。

该公司的实验室实验发现,重复序列阵列被转录成不同的短 RNA 分子。这一观察支持了这样一种观点:这些组成部分属于同一个生物系统,而非偶然处于同一区域。

Anthropic 将该排列描述为与 CRISPR 相似,因为两者都含有能够产生 RNA 的重复序列。然而,这一层面的相似性并不能证明两者具有等同功能。

研究人员尚未证明 ART 能够切割 DNA、靶向特定序列、编辑基因,或提供针对病毒的免疫力。其自然功能仍然未知。

该公司在 9 月 23 日发布的酶系统公告中介绍了这一结果。它还发布了一篇技术预印本,而非同行评审论文。

这一差别很重要。现有证据支持此前未被表征的基因组排列及其相关 RNA 产物,但尚不足以支持将 ART 描述为一种新的基因编辑机制。

尽管如此,Claude 的贡献看起来仍比一般的文献检索更具实质性。关键观察并未包含在 Anthropic 最初的提示中。一名 agent 主动选择检查周围 DNA,并将该重复阵列解读为可能具有意义。

这是 Anthropic AI 科学发现主张中最有力的部分。该模型不只是对人类提供的答案进行排序,而是选择了一个方向、注意到异常现象,并构建了可检验的生物学假说。

局限性出现在下一阶段。人类决定了要探索的研究领域,建立了 agent 基础设施,审查报告,挑选出保留下来的线索,并完成实验。

更准确的理解是:这是一个由 AI 发起线索、但在人类控制下运行的发现系统。它是否配得上更简短的“AI 发现”标签,取决于所采用的标准。

Anthropic AI 科学发现检验

可信的 AI 发现需要具备新颖性、因果贡献、验证、可重复性和透明的溯源记录。

科学发现并非单一动作。它包括选择问题、识别模式、提出解释、检验解释,以及说服其他研究人员结果真实可靠。

AI 系统无需完成每一个阶段,才能作出有价值的贡献。人类研究人员同样会在团队、仪器、数据库和专业实验室之间分工开展科学工作。

更难的问题在于因果重要性。Claude 是否改变了项目路径,还是仅仅自动化了无论如何都会产生相同结果的步骤?

五项检验可帮助区分这两种可能性。

第一项是新颖性。一项结果应当增加此前未见于已发表文献、也未被清晰编码在其输入中的内容。

Anthropic 表示,在其报告中没有找到此前将 ART 描述为这一三部分系统的出版物。这支持了其在正式科学记录中的新颖性。

然而,未见于已发表文献,并不等同于人类并不知情。研究人员经常拥有未发表结果、论文草稿、会议讨论和未完成的分析。

第二项是智力贡献。AI 应当作出实质性改变调查方向的决策。

Claude 满足了这项检验的一部分。最初的提示要求寻找有趣的 RT 系统,但并未指示 agents 去寻找定义性的重复阵列。一名 agent 选择读取附近 DNA,并标记了这一意外结构。

这一决定很关键,因为传统的序列搜索流程可以收集相关酶,却未必会解读其基因组周边环境。Claude 将多个线索关联为一个更完整的生物学提案。

第三项是实验验证。当实体实验产生与假说预测一致的证据时,计算模式会更具说服力。

Anthropic 的人类科学家发现了与重复阵列相关的短 RNA 产物。这一结果增强了该阵列具有生物活性的主张。

不过,这仍是早期验证。该实验尚未确定系统的主要功能、靶标,或协同蛋白的作用。

第四项是可重复性。另一支团队应当能够在有文档记录的条件下重复结果或过程。

其他研究人员可以检查 ART 的基因组序列。独立实验室也可以检验其重复序列是否产生 RNA。

但发现过程的可重复性较低。据报道,Anthropic 将搜索活动重跑了十次,但没有一次重新发现定义性的阵列。

相关位点在大多数重跑中都出现了,但 agents 没有检查包含关键模式的上游 DNA。这意味着最初的成功依赖于一次罕见的调查选择。

一次罕见的成功仍然可能构成发现。许多人类发现也涉及偶然、好奇心,或某位研究者注意到他人忽略的现象。

但十次未成功的重跑削弱了一项更宏大的主张,即 Anthropic 已构建出可靠的发现引擎。它们展示的是单一路径下的能力,而非在重复活动中稳定可靠的表现。

第五项是溯源。研究人员需要记录,说明哪个模型接收了哪些数据、使用了哪些工具、人类修改了什么,以及候选对象如何被选出。

溯源对于语言模型尤其重要,因为它们的训练数据不像实验室笔记那样容易检查。即使相关信息通过不清晰的路径影响了模型,结果也可能看起来具有新颖性。

这五项标准比二元裁定提供了更有用的描述。Claude 生成了一个可能具有新颖性的线索,作出了关键观察,并帮助形成可检验的假说。

人类提供了研究目标、评估标准、实验室证据和科学责任。整体结果是协作性的,即便 Claude 的具体贡献表现出不寻常的自主性。

这一框架也避免了对完全独立性的无益要求。科学家依赖仪器、同事、既有论文、软件和机构知识。AI 系统也将在更大的研究组织中运作。

关键门槛不在于 Claude 是否独自工作,而在于该系统是否作出了可追溯的贡献:这种贡献并非由专家预先明确指定,且后来获得了证据支持。

新颖性如今是最受争议的证据

核心争议不在于该 DNA 模式是否存在,而在于 Claude 是否独立得出了研究人员早已知晓的内容。

Anthropic 宣布 ART 后,哥本哈根大学计算生物学家 Mario Rodríguez Mestre 对其原创性叙事提出了质疑。

Rodríguez Mestre 表示,他的团队已研究相关逆转录酶和关联分子约四年。他的团队曾将这些酶非正式地称为“jumbotrons”。

他还表示,团队成员在使用 Claude 获得研究支持时,曾向该模型提供未发表材料。这些材料据称包括草稿和实验信息。

因此,他的担忧很具体。Claude 可能基于公开基因组数据独立推理,也可能是未发表的人类工作通过未知路径影响了其输出。

Anthropic 回应称,它不知道有已发表研究描述 ART 系统。该公司还表示,Claude 不会基于客户对话记录进行训练,其分子生物学团队也无权访问这些对话。

双方说法由独立报道披露,但并未解决溯源问题。

Rodríguez Mestre 未发表的工作并不会自动否定 Anthropic 的发现。独立研究团队经常得出相似结果,尤其是在考察同一批公开数据集时。

但他的说法暴露了当前 AI 发现主张的一项弱点。一家公司可以记录提示和 agent 对话记录,却仍无法完整说明模型开发过程中嵌入的信息。

这引出了几个不同层面的新颖性问题。

发表新颖性考察的是结果是否出现在正式文献中。Anthropic 表示,没有找到此前描述完整 ART 排列的论文。

数据新颖性关注的是:这一模式是否已存在于既有基因组记录中。答案是存在,因为 Claude 是通过搜索公开序列数据发现它的。

解释新颖性关注的是:是否已经有人将这些组成部分识别为一个完整的生物系统。这一点存在争议。

模型新颖性关注的是:Claude 是在这次研究过程中推导出这一解释,还是复现了先前已获得的知识。公开证据尚无法对这个问题作出定论。

当这些类别被混为一谈时,科学归属就会变得困难。一种模式可以存在于旧数据中,而对它的解释仍然是新的。在另一团队私下得出结论之后,第二个团队也可能发表一项有效的独立发现。

这场争议说明,AI 研究系统需要比一段经过润色的对话记录节选更充分的披露。团队应明确模型版本、数据访问情况、检索来源、人工干预、候选项筛选条件以及已知的知识暴露风险。

研究人员也需要针对保密工作制定政策。科学家越来越多地使用通用助手进行编程、编辑、数据分析和文献综述。他们需要获得关于数据存储、训练、检索及组织访问权限的明确保障。

这一问题不止涉及 Anthropic。AI 供应商也可能运营实验室、发表研究成果,并向外部科学家出售工具。即使技术防护措施能够防止数据泄露,这些角色仍会造成利益冲突的观感。

因此,信任依赖于可审计的隔离,而不仅仅是企业的否认。供应商应让其数据控制措施足够清晰,使外部研究人员能够对其进行评估。

研究团队可以将 AI 交互视为信息治理体系的一部分,从而保护自身。提示词、上传的草稿、模型输出和访问政策,都应与实验室记录一同纳入可搜索的知识库。

这种做法无法揭示隐藏的训练数据,但可以确立研究团队分享了什么、何时分享,以及由哪个模型处理了这些材料。

在竞争性研究发表之前,关于 ART 原创性的争议仍未解决。它既不应抹杀 Claude 有据可查的搜索行为,也不应被视为一个无关紧要的传播问题。

新颖性是发现的基础之一。如果研究人员无法审计一个由 AI 衍生的想法来自何处,再有力的标题也将始终存在漏洞。

可靠性比一次幸运成功更重要

一次成功的研究过程表明 Claude 可以为发现作出贡献,而十次失败则表明 Anthropic 尚无法承诺一个可重复的流程。

失败的复运行并非脚注。它们界定了引人注目的演示与可靠科学系统之间的差异。

Claude 最初的研究过程探索了一个庞大的决策树。智能体选择蛋白质家族,追踪基因组邻近区域,排除候选项,并决定哪些原始序列值得进一步仔细检查。

只有一条路径包含了读取相关上游 DNA 的关键选择。随后,模型注意到了重复阵列,并将其与相邻的 RT 联系起来。

这类似于人类的偶然发现。科学家可能因为一个样本看起来异常,或因为意外结果促使其进行另一项测试,而作出重要观察。

科学不要求最初的思考过程以完全相同的方式重现。它要求由此得出的结论经得起独立检验。

因此,即使 Claude 再也无法重新发现 ART,它仍然具有科学意义。当智能体走上不同路径时,这种生物学结构并不会消失。

但对于产品和能力主张而言,失败的复运行依然重要。一个组织无法围绕成功不可预测、且失败率未知的智能体来规划研究能力。

Anthropic 报告的筛选漏斗有助于说明这一问题。超过 200,000 个 RT 被筛选为 3,500 个候选项,继而形成 20 份详细报告,最终才出现一项决定性的观察。

完整评估不能只看成功案例。它还应包括假阳性、重复的已知系统、注释错误、被舍弃的报告、科学家审查时间、计算资源使用情况和实验室成本。

它也应报告失败的研究过程。若只发表成功的搜索,会让一个不稳定的系统显得比实际更可靠。

这正是自主研究智能体面临的验证鸿沟。模型生成假设的速度,可能远快于专家核验它们的速度。

Anthropic 表示,一次研究过程可以生成数百或数千份候选报告。每增加一份报告,都会争夺专业人员的注意力、实验材料、实验室时间和安全审查资源。

因此,瓶颈发生了转移。AI 降低了提出可能性的成本,却可能提高了判断哪些可能性值得信任的成本。

这种转变改变了研究人员应优化的目标。只有当排序系统能将稀缺实验资源引向更优候选项时,生成更多假设才有价值。

可信的基准测试应使用此前未公开的发现,或结果已知的数据集。AI 必须在看不到答案的情况下识别相关线索,而评估者则衡量召回率、精确率、成本和专家劳动投入。

前瞻性研究提供了更严格的检验。团队可以预注册研究目标,冻结模型和智能体系统,公布评估规则,然后在实验结果出现前记录每一个候选项。

独立复现将再增加一层验证。外部实验室可以测试选定线索,却不知道哪些来自人类、哪些来自 AI。

这些做法之所以听起来要求很高,是因为科学发现本就要求很高。聊天机器人基准测试可以接受一个正确答案,而生物学研究必须面对受污染的样本、噪声测定、不完整的注释和替代性解释。

可靠性也因阶段而异。Claude 可能擅长搜索大型序列集合,但在选择实验对照或解释模糊的实验室结果方面可靠性较低。

诚实的评估应分别报告这些能力。将整个系统称为自主系统,掩盖了人类在哪里提供判断,以及模型实际在哪些方面表现良好。

ART 研究过程目前支持一个较为有限的结论:Claude 有时能够在公开基因组数据中导航,注意到未经提示的结构性模式,并提出一项值得测试的假设。

它并不能证明 Claude 能够反复发现重要的生物学成果、取代专家审查,或完成端到端的实验室研究。

这一较为有限的结论仍然意义重大。大多数实用技术最初都以不稳定的能力形式出现,之后才通过工程改进变得可靠。

Anthropic 的下一项挑战不是再产出一段令人难忘的对话记录,而是将罕见的成功转化为可衡量的研究表现。

AI 实验室正汇聚于同一种研究模式

Anthropic 正加入一场更广泛的竞争:将生成假设的智能体与实验验证连接起来。

Google 开发了一种基于多个专业智能体的 AI co-scientist。给定一个研究目标,该系统会生成、批评、排序和完善假设。

已发表的 Co-Scientist study 描述了包括新颖性、合理性、可测试性和安全性在内的标准。领域专家仍然负责界定研究目标并评估输出。

更早期的系统已将语言模型与实验室硬件连接起来。一项 2023 年的化学智能体搜索技术文档、规划流程,并向自动化设备发出指令。

这些项目在自主程度和科学范围上有所不同,但共享同一种架构。AI 负责搜索和规划,工具执行计算工作,人类或机器开展实验。

Anthropic 的方法在实体实验室中仍刻意保持人工操作。该公司表示,其科学家完成所有湿实验工作,因为其项目涉及灵活流程,无法适配完全自动化。

这一设计提供了实际的安全保障。受过训练的生物学家可以拒绝薄弱的假设、发现实验问题,并阻止不安全或无意义的流程。

它也让归属问题更加复杂。人类判断在 Claude 作出贡献前后都会介入,而公司却用 AI 发现这一单数表述来描述最终结果。

更合适的比较不是 AI 科学家与人类科学家,而是一个研究组织与另一个研究组织。

一个组织可能雇用五名使用传统生物信息学工具的科学家。另一个组织可能雇用五名协调数百次模型会话的科学家。它们的相对价值取决于单位时间、资金和专家注意力所带来的经验证发现数量。

这种组织视角也指出了谁将面临压力。

生物信息学平台将面临要求,需要提供更适合智能体访问的序列数据和分析工具。实验室自动化公司则需要提供能够保留控制、权限和完整活动日志的接口。

出版商将需要更明确的贡献声明。现有作者名单很少说明模型是否选择了研究方向、设计了实验、分析了数据,还是仅仅编辑了文字。

大学将需要针对保密材料制定规则。如果机构政策将每一次 AI 交互都视为非正式聊天,研究人员便无法评估优先权争议。

资助机构也可能会询问,重度使用 AI 的项目是在创造真正的知识,还是仅仅用低成本假设淹没审稿人。项目评估将需要关于验证能力的更有力证据。

OECD 制定的自动化框架预见了其中许多问题。科学自动化必须跨工作流程进行评估,而不能通过孤立的模型输出进行判断。

因此,竞争优势可能来自整合,而非仅仅来自模型智能。高价值系统需要可信的数据访问、领域工具、实验能力和严谨的记录。

Anthropic 的实验室拥有这四项要素。它可以根据科学家接受或拒绝哪些假设来更新智能体指令。

这一反馈循环在商业和科学层面都很重要。公司可以将专家判断转化为后续搜索中更好的流程。

这也使外部评估更加重要。私有实验室可以观察那些永远不会公开的失败,改进其系统,并只公布最强的案例。

同行评审在一定程度上缓解了这种不平衡,但传统评审检验的是最终科学主张。它可能不会审计模型的训练暴露、智能体日志、筛选漏斗或被舍弃的候选项。

新的报告标准应同时涵盖生物学和发现过程。否则,读者可以验证这种酶系统,却无法验证关于是谁发现它的主张。

三个信号将决定这一主张是否成立

接下来的证据必须显示出生物学价值、独立新颖性和可重复的 AI 表现。

第一个信号是对 ART 的功能表征。

Anthropic 当前的实验表明,这一重复阵列会产生短 RNA。研究人员仍需确定 RT 复制什么、邻近蛋白质发挥何种作用,以及该系统是否以另一种分子为目标。

连贯生物学功能的证据将增强这一结果的科学重要性。但这并不会自动证明 ART 的运作方式与 CRISPR 相同。

可编程活性将进一步提高这一成果的重要性。然而,目前没有证据支持 ART 能编辑基因或可成为生物技术平台的说法。

第二个信号来自哥本哈根团队及其他独立研究人员的发表成果。

他们的结果可以澄清:这一系统是否已被识别、其特征描述推进到了何种程度,以及他们的解读是否与 Anthropic 一致。

有据可查的时间线将至关重要。草稿日期、实验记录、序列标识符、会议材料以及 Claude 交互日志,可以区分同步发现与事先知情。

Anthropic 可以通过提供详细的溯源说明来强化自身立场。这份说明应解释智能体访问了哪些公开资源,以及如何排除了客户数据。

如果各团队独立识别出这一系统,这一事件将呈现出一种常见的科学模式:当新数据或新工具让问题变得可解时,多个团队往往会得出相似结论。

如果未发表的研究工作影响了 Claude,这一事件将成为警示:不应使用商业 AI 系统处理机密研究。科学结果本身或许依然有效,但其归属将发生重大变化。

第三个信号是对 Anthropic 智能体工作流的前瞻性复现。

Anthropic 应在智能体和评估者都不知道答案的领域中开展更多搜索。它应预先登记任务,保留所有运行记录,并披露成功率。

最有说服力的研究将把 Claude 智能体与专家团队、传统生物信息学流程以及更简单的语言模型工作流进行比较。每个组应获得相同的数据和评估时间窗口。

研究人员随后可以衡量关键结果:经验证的新线索、误报、发现所需时间、计算资源使用、实验室工作量以及专家审阅工时。

反复取得成功将强化 Anthropic 关于 AI 科学发现的叙事。若仍持续依赖罕见且无法复现的路径,则更适合采用较为有限的描述:Claude 是一种有用的探索性工具。

这一较为有限的角色不应被视为失败。科学仪器无需在人的意义上成为发现者,也可以改变研究。

“发现”这一措辞之所以重要,是因为它会影响资金投入、公众期待、科学署名与信任。当企业将能动性赋予其模型时,人类贡献者可能会消失在产品名称之后。

公平的标准应承认机器作出的有意义贡献,同时不假装其背后的机构不存在。

就目前而言,Claude 似乎已跨越了一个重要门槛。它作出了一项未经提示的观察,改变了人类科学家决定测试的内容。

但它尚未跨越所有门槛。其功能仍然未知,原创性存在争议,研究尚待同行评审,而重复开展的活动未能捕捉到这一关键线索。

因此,最站得住脚的结论应是有条件的:当一个 AI 系统作出的新颖、可追溯决策实质性地塑造了经验证的结果,并经受住独立审查时,它可以获得发现方面的认可。

Anthropic 已为该决策及初步验证提供了证据。但它仍需向科学界提供关于新颖性、溯源和可重复性的更有力证据。

读者应关注实验,而非标签。ART 是否会获得明确的功能定义?外部实验室是否会予以确认?Claude 能否在前瞻性测试中生成同样有价值的线索?

这些答案将决定,这究竟是一次幸运的 AI 辅助观察,还是一种可靠研究方法的开端。在此之前,“AI 科学发现”应描述一项正在接受检验的主张,而非既成定论的成就。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page