top of page

Anthropic 生物实验室将 Claude 的药物研发雄心带入现实检验

14分钟前
讀畢需時 15 分鐘

Anthropic 已启用一座实体生物实验设施,尽管围绕 AI 赋能生物风险的担忧日益增加,Anthropic 生物实验室仍推动 Claude 跨越计算机模拟。位于旧金山湾区的这座设施,让 Claude 生成的构想能够进入真实实验;在这里,分子、细胞、仪器和失败的结果取代了基准测试分数。

Anthropic 生命科学负责人 Eric Kauderer-Abrams 在 9 月 18 日发布的 Reuters 采访中证实了这一进展。Anthropic 正将自有设施内的工作与外部合作伙伴开展的实验结合起来。

这种组合也构成了核心矛盾。Anthropic 希望 Claude 加速临床前科学研究,同时向制药客户保证,其数据、研发项目和商业利益仍能受到保护。该公司还必须证明,赋予 AI 系统更高的实验室工作控制权,不会削弱其安全承诺。

Alphabet 旗下的 Isomorphic Labs 多年来一直通过专门的药物发现系统追求类似目标。Anthropic 则采取不同路径:在继续将制药公司作为客户服务的同时,让通用 AI 模型更贴近实验操作。

这并非又一项 AI 与药企之间的合作。Anthropic 正在建设基础设施,以检验 Claude 能否参与一个持续的科学闭环:提出想法、开展实验、审视结果,并决定下一步行动。

Anthropic 生物实验室推动 Claude 超越模拟

Anthropic 最重要的变化发生在实体层面,而非对话层面:Claude 的生物学建议如今能够接受真实实验室证据的检验。

根据这份湿实验室报道,Anthropic 在旧金山湾区建立了该设施。湿实验室是研究人员实际测试生物材料、化学品和实验流程的受控空间。

Kauderer-Abrams 表示,真实实验室工作仍是生物研究的最终检验。他将 Anthropic 的运营模式描述为类似一家生物技术公司:部分实验在内部开展,另一些则交由合作伙伴执行。

这一区别至关重要,因为计算层面的成功并不能证明生物学上的成功。模型可能将某个蛋白质设计评为高分,但所提议的分子可能无法结合、不够稳定、无法正确表达,或表现出安全隐患。

内部实验室缩短了模型提案与挑战该提案的证据之间的距离。Anthropic 能观察 Claude 的推理在哪些环节失效、哪些工具造成阻碍,以及科学家在接受建议前需要哪些信息。

该实验室还让 Anthropic 直接接触实验科学中那些平凡却关键的环节。研究人员必须制备样品、校准设备、记录偏差、调查污染情况,并决定异常结果是否值得再次实验。

这些操作细节很难通过静态的基准测试问题捕捉。当 AI 系统开始协调多种工具,或在无需人工重写每条指令的情况下对结果作出反应时,它们尤为重要。

Anthropic 此前已报告对由 Claude 设计的蛋白质结合体进行实验室测试。minibinder 是一种小型工程化蛋白质,旨在与选定的生物靶点紧密结合。

在该公司的蛋白质设计实验中,外部评估人员为 15 个靶点生产并测试了设计方案。Anthropic 表示,Claude 为其中 14 个靶点生成了成功的结合体。

报告的命中率因模型和实验设置而异。Anthropic 表示,Mythos Preview 在所有靶点上的总体命中率达到 26.7%,而 Opus 4.8 达到 22.6%。

在单独的会话中,当 Mythos 专注于一个靶点时,Anthropic 报告其总体命中率达到 35.1%。这些结果涉及早期蛋白质设计工作,并非获批药物,也不构成其对患者有效的证据。

不过,这些实验解释了 Anthropic 为何希望更直接地接触实验室运营。若系统能够吸收可靠的实验反馈并修订下一项提案,计算输出就会更有价值。

Anthropic 的发言人还谨慎界定了该设施的用途。该公司表示,实验室并非专为药物发现而设,同时拒绝说明其完整用途。

这一限定留下了重要的未解问题。Anthropic 尚未公开说明所研究的疾病、实验室的能力、生物安全等级,或内部开展工作的比例。

不过,方向已经明确。Claude 正从解读生物学信息的助手,转向能够协助协调生成新生物学证据的智能体。

Anthropic 为何需要自己的实验反馈闭环

Anthropic 生物实验室为公司提供了单靠模型训练无法获得的东西:关于 AI 决策如何经受生物学现实检验的第一手证据。

Anthropic 表示,按人员和资源投入计算,生命科学已成为其最大的投资领域之一。该公司还推出了 Claude Science,聘请了专业人士,收购了生物技术专长,并与大型药企建立合作关系。

Reuters 报道称,Anthropic 通过股票交易收购了 Coefficient Bio。Anthropic 证实了这项收购,但未确认报道中提及的交易金额。

Coefficient Bio 带来了计算生物学和药物开发工具方面的经验。这些专业能力可帮助 Anthropic 将通用推理模型转化为科学家能够评估和复现的工作流程。

Anthropic 还在招募实验室运营和生化表征方面的人才。这些职位表明,该组织正准备处理设备、采购、实验数据和质量控制,而不仅仅是开发软件。

其战略吸引力在于速度。当每一项实体测试都必须通过外部承包商完成时,排期与沟通可能拖慢每个设计周期。内部能力让 Anthropic 对选定实验拥有更多控制权。

更短的周期将使研究人员能够更频繁地将 Claude 的预测与实体实验结果进行比较。失败的实验可以转化为结构化反馈,而非消失在合作伙伴的项目档案中。

这一过程类似主动学习,即系统根据最能高效降低不确定性的因素选择下一项实验。模型不只是搜索固定数据集,也参与决定应当生成哪些新数据。

实验室自动化可以加快这一闭环。机器人系统可在接收机器可读指令后,分配液体、移动孔板、采集测量数据,并执行可重复的流程。

据报道,Anthropic 希望 Claude 在有限人工干预下指挥机器人单元。该公司也表示,人类监督仍不可或缺,尤其当实验涉及敏感生物能力或结果存在歧义时。

这正是更大雄心背后的机制。Claude 生成或评估一项假设,软件将该决策转化为仪器操作,实验结果再反馈给模型。

这一循环随后可以重复。每次迭代都可能完善蛋白质设计、淘汰不合适的候选物,或识别科学家在继续推进前所需的一项测量。

然而,速度只有在证据仍值得信赖时才有帮助。自动化工作流程同样可以高效复现一项选择不当的实验。

当观察结果与初始假设冲突时,模型也可能变得过度自信。一个有用的科学智能体必须识别不确定性、呈现替代解释,并保留负面证据。

因此,实验室记录也成为产品问题的一部分。仪器输出、实验方案、模型提示、人类审批和偏差必须通过可追溯的历史记录保持关联。

这一挑战并不局限于 Anthropic。科学团队经常将实验背景信息分散存放于实验记录本、数据库、消息系统和仪器软件中。碎片化记录使人类和 AI 的推理都更难审计。

一个有效的反馈闭环需要的不只是强大的语言模型。它还需要可靠的数据溯源、可互操作的设备、清晰的权限,以及另一支团队能够复现实验结果的证据。

Anthropic 的实验室可以帮助该公司直接面对这些限制。它还可以为 Anthropic 向外部实验室销售的工具提供参考,包括 Claude 与科学硬件之间的接口。

这种商业反馈的重要性或许不亚于任何内部药物项目。运行实验会暴露那些只提供 API 的供应商无法看到的失败模式。

AI 药物发现仍须面对生物学最严苛的筛选

成功的分子设计只是药物开发的输入,而非一种有效药物已经存在的证明。

Anthropic 曾讨论针对传统公司可能认为商业吸引力不足的疾病开展临床前项目。临床前工作包括药物进入人体试验之前进行的实验室和动物研究。

罕见病符合这一策略,因为较小的患者群体会削弱传统开发模式的经济合理性。AI 辅助设计或许能够降低部分早期研究成本,或帮助科学家考察此前鲜少受到关注的靶点。

Kauderer-Abrams 还提到了被视为“不可成药”的疾病。这一术语描述的是那些因结构或行为使有效干预变得困难、从而抗拒传统治疗策略的生物靶点。

复杂分子提供了一条可能的路径。双特异性和三特异性抗体可结合两个或三个靶点,因而可能产生单靶点分子无法实现的治疗效果。

AI 系统或可帮助科学家探索这些更庞大的设计空间。它们能够协调专用模型、检索文献、对候选物排序,并提出供实体测试的序列。

但药物开发包含若干早期设计无法绕过的筛选关卡。一种分子必须展现出合适的效力、选择性、稳定性、可制造性、分布特性和安全性。

随后,它还必须经受人体临床测试。患者之间的生物学差异,可能令一种在计算模型、纯化测定或动物研究中看似颇具说服力的机制失效。

一项由临床影响研究总结的近期分析指出,迄今 AI 对获批药物的贡献仍较有限。候选物识别的进展快于临床验证。

II 期临床试验仍是一项尤其严苛的考验,因为研究人员必须证明其对患者具有实质疗效。更好的预测并不会自动消除这一瓶颈。

Anthropic 尚未表示计划开展临床试验。Kauderer-Abrams 表示,公司正聚焦于成熟制药和生物技术公司尚未解决的临床前需求。

这一区限使 Anthropic 远离开发中最昂贵、监管最严格的环节。但这也意味着,该公司无法独自证明一个治疗项目的最终价值。

与 Isomorphic Labs 的对比颇具启发性。Alphabet 在 DeepMind 对蛋白质结构的研究引发科学界关注后,围绕以 AI 为先导的药物发现创立了这家公司。

Isomorphic 已花费多年时间开发候选项目,并推动其进入临床阶段。这一经验表明,计算能力与在人类身上测试药物之间,仍隔着大量工作。

OpenAI 也在构建生命科学评估基础设施。其 LifeSciBench 基准测试涵盖七类工作流程和七个生物学领域,共包含 750 项由专家编写的任务。

LifeSciBench 尝试衡量贴近现实的研究判断能力,而非简单的事实记忆。其任务包括证据解读、实验设计、故障排查、验证以及转化风险评估。

这些基准测试可以揭示模型是否能连贯地处理研究问题。但它们无法替代设计严谨的对照实验、独立复现或临床证据。

这种差异应当影响人们对 Anthropic 所报告结果的解读。较高的结合剂命中率可以支持进一步研究,但并不能证明 Claude 能更快地开发出安全药物。

更有意义的检验将涉及具备透明基线的重复项目。观察者需要了解人类团队取得了什么成果、Claude 使用了哪些工具,以及每项结果之前经历了多少次失败尝试。

他们还需要来自独立实验室的证据。由供应商自行运行的演示可以识别能力边界,但外部复现更有助于揭示隐藏假设和工作流程优势。

Anthropic 生物实验室为该公司提供了生成更有力证据的场所。但这也增加了区分探索性结果与具有医学意义进展的责任。

Anthropic 的药物雄心带来客户信任难题

Anthropic 希望支持制药客户,同时也在发展这些客户可能视为竞争性业务的相邻能力。

Anthropic 向包括 Genentech、Bristol Myers Squibb 和 Novo Nordisk 在内的机构提供 AI 工具。这些客户处理敏感研究数据、专有靶点和保密实验项目。

该公司表示,客户信息受到保护,并与自身研究相隔离。即便存在技术控制措施,竞争关系的表象仍可能影响客户愿意分享哪些内容。

一家制药公司可能使用 Claude 分析内部数据,同时担心 Anthropic 是否正从中学习可惠及另一项药物项目的通用工作流程经验。这种担忧不止关乎直接访问保密文件。

产品优先级可以反映商业方向。支持请求可能暴露哪些工作流程最重要。集成模式则能显示研究机构在哪些环节遭遇瓶颈。

Anthropic 决定避免开展临床试验,缓解了这种紧张关系的一部分。这使该公司定位为临床前研究和基础设施合作伙伴,而非完整的制药竞争者。

不过,这条边界并非天然永久。一种有前景的内部候选分子可能带来压力,促使公司授权该资产、成立新公司,或与药企合作。

该公司尚未说明将如何治理此类决策。它也未描述内部研究团队与面向客户的生命科学团队是否在正式的信息隔离机制下运作。

信任将取决于具体控制措施。客户会希望获得关于数据保留、模型训练、员工访问、审计日志、事件报告及竞争性使用的明确规则。

Anthropic 新推出的生命科学验证计划处理了一个相关的访问问题。许多正当的生物学任务在仅根据单条提示词判断时,可能看起来像危险请求。

根据这项验证计划,获批机构可访问采用更宽松生物安全防护措施的模型。Anthropic 会在授予访问权限前审查资质、安全实践和研究监督机制。

标准访问权限覆盖常见的研发工作流程。风险较高的项目则需要额外审查及针对项目的批准。

Anthropic 表示,该计划会根据每个组织声明的研究范围监控活动。它将部分执行机制从即时拦截转向对跨多个会话行为的离线审查。

该计划会将被标记的流量数据保留 30 天,以支持这类监控。Anthropic 表示,这些信息会被分区隔离,其生命科学研究团队无法访问。

这些控制措施显示,客户信任与生物安全正在趋于交汇。模型提供商需要拥有足够的可见性来发现滥用行为,同时不能形成让商业信息跨越组织边界流动的渠道。

内部实验室又增加了一层治理要求。Anthropic 必须区分为安全评估、产品开发和潜在治疗研究而开展的实验。

如果缺乏这种明确性,客户可能难以判断 Anthropic 何时是在充当基础设施提供商、研究合作者、评估者,还是潜在竞争者。

风险并不限于蓄意滥用。科学数据可能被误读、不当组合,或因工具配置不当而暴露。

连接到实验室系统的 AI 智能体可能获准访问仪器、数据库和云服务。每一个连接都会增加需要接受安全审查的路径数量。

因此,制药采购方评判 Anthropic 时,看重的不只是模型智能,还包括运营纪律。采购团队将审查访问控制、合同边界、可复现性和故障处理能力。

对 Anthropic 而言,赢得这种信心至关重要。实验室可以改进其产品,但客户数据与内部药物雄心必须在可见层面保持分离。

同样的实验室能力也提高了生物安全风险

帮助 Claude 执行治疗性研究的工具,也可能扩大访问控制薄弱或自动化失误带来的后果。

Anthropic 多次将先进的生物学辅助能力描述为双重用途。同样帮助研究人员设计治疗性蛋白质的知识,也可能在不同意图下支持有害的生物学工作。

该公司在认定自己已无法排除为技术背景有限的行为者提供实质性协助的可能性后,启用了更强的保护措施。这些保护聚焦于化学、生物、放射性和核风险。

Anthropic 承认,AI 能在多大程度上提升真实实验室表现仍存在不确定性。其生物风险研究描述了一项小型的 2024 年试验,涉及八名使用基础生物学操作规程的参与者。

研究没有发现 Claude 相较于互联网访问提升参与者表现的证据。不过,两组表现都出乎意料地出色,限制了该实验能够得出的结论。

此后,Anthropic 与 Sentinel Bio 和 Frontier Model Forum 共同支持了一项规模更大的研究。该研究旨在测试 AI 是否能帮助非专业人士完成通常与专家表现相关的实验室任务。

内部设施可以提供更多有关模型在实体实验周边行为的证据。它能揭示 Claude 何时误解设备、忽略安全条件,或建议非必要程序。

但实验室同样会扩展能力。将模型连接至机器人硬件,会缩短信息与行动之间的距离;这正是实验室自动化需要谨慎控制的原因。

人工审查仍然必要,但这个表述可能掩盖几种不同安排。科学家可能批准每一项行动、只审查计划中的操作规程,或在自动监控发现异常行为后才进行干预。

这些方式提供的保护水平不同。Anthropic 尚未公开详细说明 Claude 可以在实验室内作出哪些决策,或人类必须以多高频率进行批准。

自动化监控带来另一项不确定性。安全系统必须区分正常的科学变异,与表明滥用、污染或不安全实验方向的行为。

误报可能中断正当研究。漏报则可能让一连串单独看来普通的高风险操作继续进行。

验证计划通过监控跨会话模式来识别这一问题。当软件命令流经实验室仪器而非聊天窗口时,也需要类似的推理方式。

安全还取决于硬件层面。仪器需要经过认证的接口、受限权限、经过验证的命令,以及无法被悄然篡改的日志。

模型不应仅因能够生成看似合理的操作规程,就获得广泛的实验室访问权限。其权限应始终限制在每项实验所需的最少工具和材料范围内。

Anthropic 还必须防范自动化偏见。科学家可能因为模型显得系统化而接受其建议,尤其是在数百种实验选项令人工审查变得困难时。

独立核查可以降低这一风险。团队可以要求不同模型或研究人员审查高影响决策,预先设定停止条件,并保留样本以供重复测试。

该公司的公开主张也需要同样谨慎地看待。Anthropic 表示,先进 AI 能加速有益科学,同时其控制措施可减少危险访问。

这项主张的两面都尚未在真实世界实验室中得到充分证实。该设施创造了更好的环境来测试这两项主张,但并不会自动解决问题。

这正是围绕 Anthropic 生物实验室的核心权衡。更直接的实验可以带来更好的证据和工具,同时也会提升安全系统必须治理的能力。

三项信号将显示该战略是否奏效

应通过可复现的结果、可信的治理,以及客户接受其不断扩展角色的证据来评判 Anthropic 的实验室。

第一项信号是获得独立复现的实验项目。Anthropic 需要公布足够细节,让外部科学家能够将 Claude 指导的工作与恰当的人类或计算基线进行比较。

一项有价值的结果应包括失败设计、资源使用情况、研究人员参与程度和预先定义的成功标准。选择性演示无法说明系统是否改善了整个发现流程。

复现将强化 Anthropic 的论点,即通用 AI 能够在文献综述和代码生成之外作出贡献。反复失败则会削弱关于更快实验周期的说法。

第二项信号是针对 AI 指导实验室工作的具体治理框架。Anthropic 应说明批准门槛、仪器权限、审计要求、事件响应,以及客户项目与内部研究之间的隔离。

该框架应区分自动化执行与自主科学决策。这两个概念经常被归为一类,尽管它们带来不同的运营风险。

明确的控制措施将支持 Anthropic 的主张,即更强的生物学能力能够与负责任部署并存。模糊的保证将使客户和安全研究人员无法评估这种平衡。

第三项信号是客户行为。新的制药合作、扩大的部署范围,或由独立方描述的生产环境使用情况,都将表明买方接受 Anthropic 的数据与竞争边界。

客户的犹豫同样具有参考价值。有限的工作负载或严格的排除条款,可能表明药企将 Anthropic 的内部项目视为利益冲突。

读者还应关注 Anthropic 是否会明确一个具体的罕见病或高难度靶点项目。一个具名项目将使这项战略接受可衡量的里程碑检验,而不再只是有关加速科学研究的宽泛表述。

最关键的里程碑仍将处于临床前阶段,可能包括可重复的活性、可接受的选择性、制造可行性,以及能够推动候选药物迈向人体试验的合作伙伴关系。

这些成果不会仅仅因为 Claude 能够操作实验室工具就自然出现。生物学进展依赖于实验设计、可靠的数据、领域专业知识以及严谨的解读。

对于开发者而言,该项目为智能体架构带来了一项严苛考验。实验室智能体需要持久状态、受限权限、异常处理机制,以及模型与人工决策的完整历史记录。

企业采购方应关注治理与证据所有权。每一项自动化建议都必须始终关联到生成它的数据、实验方案、审批记录和仪器输出。

关注这一领域的知识工作者也面临类似的信息问题。各种主张、实验方案、安全报告及合作伙伴公告,将在彼此割裂的信息源中不断累积。

结构化的知识融合工作流程可帮助团队连接这些材料,而不将每一则公告都视为同等分量的证据。基准测试、实验室结果与临床证据之间的区别必须始终清晰可见。

因此,Anthropic biology lab 所检验的不只是 AI 药物发现。它还在检验,一家前沿模型公司能否在一个错误会转化为现实物理后果的领域中安全运作。

Anthropic 通过让 Claude 更接近实验执行,跨越了一条重要边界。如今,它必须证明,更快的迭代周期能够带来可靠的科学成果、受到保护的客户关系,以及可执行的安全控制措施。

未来几个月的问题很具体:Anthropic 会发布可重复的实验室证据和清晰的运营规则,还是其最重大的生物学主张仍将停留在受控演示之中?

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page