top of page

Google Biohub 虚拟细胞投资瞄准生物学缺失的数据

16小时前
讀畢需時 13 分鐘

Google 已加入对 Biohub 虚拟细胞项目的 3 亿美元企业投资,押注更优质的生物数据能够让 AI 成为疾病研究工具。Meta 和 Alphabet 旗下的 Isomorphic Labs 与 Google DeepMind 一同参与。Google Biohub 虚拟细胞投资是涉及 Biohub 和两家美国机构、总额 18 亿美元的更广泛计划的一部分。

这则消息听起来像又一个大型 AI 模型项目。但其真正目标更难实现。Biohub 希望构建能够描述活细胞如何响应药物、基因改变、环境条件及其他干预措施的数据集。

这一区别构成了核心张力。语言模型从人们已发布到互联网上的信息中学习。一个实用的虚拟细胞则需要大量尚不存在的实验观测数据。研究人员必须先在实验室中生成这些观测结果,AI 系统才能从中学习。

因此,由 Mark Zuckerberg 和 Priscilla Chan 创立的 Biohub,正在组织一个数据生产网络,而非宣布一个已经完成的生物模拟器。该项目将企业资本、联邦科研基础设施、科学研究机构以及标准化公共数据集结合在一起。

这一做法也挑战了人们对 AI 竞争的一个常见假设。Google 和 Meta 通常会竞相掌控模型、基础设施、人才和分发渠道。而在这里,它们正为一项共享的生物资源提供资金,因为任何一家公司都难以独自创造足够多的高质量实验数据。

这种合作并未消除商业动机。参与企业将在部分由私营资金支持的数据集公开之前,获得一段时间的优先访问权。该安排将开放科学与企业优势置于同一项目之中。

Google Biohub 虚拟细胞投资扩展为一项 18 亿美元计划

重要的变化并不是一家公司为一个模型提供资金,而是搭建一套用于生产、标准化和计算生物数据的共享系统。

Biohub 于 2026 年 10 月 7 日宣布扩展其 Virtual Biology Initiative。其官方融资公告称,涵盖资金、现有数据、算力和测量技术的综合投入价值达 18 亿美元。

Google DeepMind、Meta 和 Isomorphic Labs 将合计投资 3 亿美元。公开信息并未说明每家公司具体出资多少。因此,将全部金额描述为 Google 的投资并不准确。

美国能源部计划在五年内投入超过 5 亿美元。这笔投入将通过该部门的国家实验室体系,支持实验室测量、生物建模、计算、成像和数据采集。

美国国立卫生研究院将协调由此前超过 5 亿美元联邦投资所形成的资料库和数据集。Biohub 计划帮助将这些资源转化为适用于 AI 训练的标准化材料。

Biohub 在 2026 年 4 月推出 Virtual Biology Initiative 时,已承诺再投入 5 亿美元。这家非营利机构表示,其中 4 亿美元将用于支持新的测量技术,包括先进显微技术、冷冻电子断层扫描,以及用于在多个尺度上修改生物系统的工具。

这些资金类别并不能相互替代。其中一些是新增资金,另一些则代表此前的联邦支出、数据集、设备和算力。18 亿美元总额应被理解为综合资源包,而非单轮现金融资。

该计划汇集了多家科学机构。Biohub 列出的合作方包括 Allen Institute、Broad Institute、Gladstone Institutes、Human Cell Atlas、Human Protein Atlas 和 Wellcome Sanger Institute。Nvidia 将提供计算技术和专业技术支持。

Biohub 还计划建立共享标准、通用标识符和一个统一访问入口。这些较不显眼的工作很重要,因为生物数据集经常采用不同的实验设计、标签、仪器和质量控制方法。

如果未经过谨慎的标准化处理就合并彼此不兼容的数据集,可能会形成一个规模庞大、却仍向模型传授错误经验的资源。模型可能学到的是实验室之间的差异,而非有意义的细胞行为。

该计划旨在于规模扩大前解决这一问题。组织方希望各研究团队设计互补实验、记录更丰富的元数据,并通过兼容系统处理结果。

据 Biohub 科学负责人 Alex Rives 在相关报道中所述,首个大型数据集预计将在约一年后推出。合作方的目标是在五年内实现准确的预测模型。

这些日期是目标,并非已验证的里程碑。Biohub 尚未发布一项通用准确性标准,用以判定其虚拟细胞何时足够可靠、可用于影响重大的研究决策。

真正的瓶颈是实验生物学,而非模型规模

Google Biohub 虚拟细胞投资将数据生成视为限制因素,因为生物学数据无法从公共互联网中抓取。

虚拟细胞是一种计算模型,用于预测细胞在接受生物干预后的变化。这种干预可能包括沉默某个基因、添加药物、改变营养条件,或让细胞暴露于与疾病相关的环境中。

所需输出并不只是细胞的逼真图像。研究人员希望获得有关基因活性、蛋白质、结构、信号通路和可观测行为的预测。不同实验室可能会针对不同问题构建不同模型。

癌症研究人员可能会询问:当某个特定基因被禁用时,肿瘤细胞会如何响应。药物研发者可能在决定哪些化合物值得进入实验室测试之前,对多种化合物进行比较。另一个团队可能会研究免疫细胞在病变组织中的行为。

模型需要配对观测数据来回答这些问题。研究人员必须测量干预前的细胞状态,施加受控改变,并记录由此产生的状态。他们还必须针对不同细胞类型、条件、剂量和时间点重复这一过程。

当前的公共数据集合包含数亿条细胞观测记录。Rives 告诉 Reuters,可靠的预测建模将需要数十亿条,最终甚至数万亿条记录。如此巨大的规模差距,解释了为何该计划涵盖显微镜、实验室自动化和联邦设施。

仅靠规模无法解决问题。数万亿条记录不佳的观测,可能以前所未有的规模保留实验偏差。数据还必须捕捉因果变化、生物学背景、时间和不确定性。

例如,空间转录组学在保留细胞于组织中位置的同时,对分子活性进行绘图。这种背景信息很重要,因为相邻细胞和组织结构都可能改变细胞的行为方式。

冷冻电子断层扫描能够生成细胞内部结构的精细三维视图。扰动筛选则在研究人员改变基因或环境条件后测量响应。每种方法都捕捉了生物学的不同层面。

Biohub 希望协调这些数据模态,而不是将它们视为彼此孤立的集合。该机构的前提是,模型需要学习分子、细胞、组织和生物体层面之间的关系。

这一前提使该计划不同于单纯训练一个更大的神经网络。Google DeepMind 高管 Pushmeet Kohli 表示,这一挑战需要展示活细胞如何响应变化的实验数据。他将开放、标准化的数据共享资源描述为必要基础。

数据瓶颈也改变了研究人员分配实验室时间的方式。一个可信的模型可以在数字环境中筛选大量假设,再将实体实验引导至信息量最大的候选方案。

以研究与阿尔茨海默病相关分子通路的团队为例。如今,他们可能依据已发表证据和专家判断来选择实验。虚拟细胞则可以按照预测效应和不确定性,对干预措施进行排序。

实验室仍将进行决定性的实验。不过,它可以选择一组更小、信息量更高的候选方案。模型随后会从新结果中学习,在预测与测量之间形成循环。

这一工作流类似主动学习,即算法选择最能提升其理解能力的下一批数据点。其实用价值在于更好地选择实验,而不是消除实验。

生物学也会因个体、组织、发育阶段和疾病状态而变化。一个在某种培养细胞系上表现良好的模型,可能会在原代人体组织中失效。一个剂量下的结果也未必能泛化到另一个剂量。

因此,该项目近期最有力的贡献或许是提供更好的研究基础,而非打造通用模拟器。共享数据集能够在某一系统预测所有相关细胞响应之前很久,就支持更专门的模型。

开放数据与企业访问权处于微妙平衡

该计划依赖共享科学,但其融资结构赋予商业参与者暂时的信息优势。

Biohub 表示,最终形成的资源将向科学界开放。Rives 称,由政府资助的数据集不会设置私有禁运期。由企业资助的数据则将遵循不同路径。

商业出资方将在数据公开前获得一段使用期。Biohub 尚未在其公开公告中披露这些禁运期的时长。

这一安排提供了直接的激励。数据生成成本高昂,而优先访问权有助于为企业投资提供合理性。Google DeepMind、Isomorphic Labs 和 Meta 将获得时间,用于训练模型、测试方法或识别有前景的研究方向。

Isomorphic Labs 与商业应用的直接关联最为明确。这家 Alphabet 公司开发用于药物研发的 AI 系统。更早获得广泛的扰动数据集,可能有助于靶点识别或化合物评估。

Google DeepMind 带来了 AlphaFold 等系统的经验,后者可预测蛋白质结构和相互作用。但全细胞建模是另一类问题。蛋白质结构只是动态生物网络中的一个组成部分。

Meta 的商业路径则不那么明确。其 AI 研究机构曾开展生物建模工作,而 Zuckerberg 与 Chan 共同帮助创立了 Biohub。该公司的参与也使其在一项具有战略重要性的科学数据工作中占据一席之地。

大学和规模较小的生物技术公司最终也可能获得相同数据集的访问权。但在禁运期间,资金雄厚的合作方能够在更广泛的社区获得底层资源之前,先行开发模型和工作流。

这种先发优势未必会使开放科学的承诺失效。但当不同参与者在不同时间获得访问权时,它确实引出了“开放”究竟意味着什么的问题。

答案取决于细致的治理安排。研究人员应关注禁运期长短、许可条款、元数据可用性、下载限制,以及是否纳入负面实验结果。

负面结果尤其重要。模型需要学习干预何时没有产生实质性影响,而不只是研究人员何时观察到有趣的反应。选择性发表会扭曲训练数据的分布。

该计划还必须决定外部研究人员如何质疑或纠正其数据集。如果文档不完整,或错误报告依然困难,开放文件的价值将十分有限。

商业访问还可能在算力方面造成另一种失衡。发布一个庞大的生物数据集,并不意味着学术团队有能力负担在其上训练具备竞争力模型的成本。Nvidia 的参与或许能改善基础设施,但资源分配规则至关重要。

因此,Biohub 的模式介于两种并不完美的选择之间。完全专有的数据集会限制科学审查,并使能力集中;纯粹的公共项目则可能难以吸引同等规模的私人投资,或以期望的速度推进。

主要竞争并非 Google 对阵 Meta,而是开放生物基础设施的承诺,与资助它的公司所获得的实际优势之间的较量。

明确的发布时间表将使这种取舍更容易评估。公开的数据集卡片也同样重要,其中应说明实验方法、已知局限、人口覆盖范围、细胞背景及质量检查。

研究人员还需要持久的访问权。一个会更改接口、移除版本或缺乏稳定标识符的公共资源,可能会削弱可重复性。Biohub 的通用标准可能会变得与任何单一模型同样重要。

这一治理问题超出了当前项目。OpenAI 的基金会已开始资助生物和医学数据集,而 Anthropic 则已拓展至基于实验室的生物学研究。AI 公司正日益将专有实验数据视为战略资产。

Biohub 正试图在这场竞争中提出一个共享层。它是否能保持真正有意义的共享,将通过访问政策而非发布日的承诺体现出来。

当前虚拟细胞仍未通过基本泛化测试

最需要保持谨慎的理由来自公开基准:领先模型依然难以稳定预测陌生的细胞反应。

Arc Institute 提供了一个有用的参照。其 Virtual Cell Initiative 开发数据集、模型和年度竞赛,用于测试细胞反应预测能力。

首届挑战要求模型预测研究人员抑制人类胚胎干细胞中特定基因后,基因表达会发生怎样的变化。其基准包含约 30 万个单细胞图谱,覆盖 300 种基因扰动。

来自 114 个国家的 5,000 多人报名参赛。超过 1,200 个团队提交了结果,逾 300 个团队完成了最终提交。如此高的参与度,使该竞赛成为检验当前方法的重要测试。

挑战赛结果令人清醒。Arc 报告称,模型并未在所有评估指标上持续优于简单基线。

获胜系统提升了区分扰动、识别活性发生变化的基因的能力。不过,最佳方法将深度学习与传统统计特征相结合。纯粹的端到端学习尚未解决这一任务。

这一结果并不意味着虚拟细胞不可能实现。它表明,熟悉数据上的强劲表现不能替代对新细胞类型或新干预措施的泛化能力。

这一差异对药物发现至关重要。研究人员需要模型针对尚未测量过的条件提供有用信息。当核心问题本身是未知时,记忆现有数据集中的常见模式价值有限。

Arc 的 2026 年挑战提高了难度。模型必须预测六个细胞系的反应,而这些细胞系的扰动数据在训练期间并未提供。这种零样本设定,即无需针对任务的示例即可进行预测,更接近科学研究中的实际使用场景。

Arc 自己的 STATE 模型同时体现了进展与局限。根据其虚拟细胞项目,STATE 从覆盖 1.67 亿个细胞的观察性数据,以及覆盖 70 种人类背景、超过 1 亿个细胞的扰动数据中学习。

这些数字规模庞大,但相较于生物学的可能性,覆盖范围仍然稀疏。人类细胞包含相互作用的分子系统,它们会随时间变化,并在活体组织中以不同方式作出反应。

细胞系实验也简化了现实。实验室细胞系可以在受控条件下生长,而患者体内的细胞会遇到免疫信号、邻近组织、变化的营养条件以及既往治疗。

虚拟细胞可能可以准确预测基因表达,却遗漏另一项重要结果。一种药物可能改变蛋白质定位、细胞形态、代谢、毒性或细胞间通信,却不会产生明显的转录组特征。

因此,研究人员必须围绕具体决策来定义成功。即使无法复现所有细胞过程,模型仍可能有助于对基因靶点进行排序。另一个模型或许能帮助选择实验,但仍不适合用于临床预测。

“通用虚拟细胞”这一表述可能掩盖了这些更狭窄的门槛。它暗示一个模型可以处理所有细胞和干预措施。更可能的路径是多种模型、测量类型与置信度估计的组合。

一篇虚拟细胞概述指出,研究人员对这一概念并没有统一定义。一些人设想的是视觉模拟,另一些人则指能够回答聚焦生物学问题的预测程序。

这种模糊性使雄心勃勃的时间表更难评判。Biohub 预计将在五年内实现准确的预测模型,但准确性取决于测试方式、细胞背景和可接受的误差范围。

该项目应在宣布成功之前公布评估标准。有用的指标可包括在未见细胞类型、新干预措施、多个实验室以及不同于训练数据的条件下的表现。

外部复现同样重要。在一个实验系统中得出的结果,应由独立实验室使用不同设备和样本进行测试。

最有说服力的展示不会是一段精美的可视化内容,而是一项前瞻性研究:模型推荐实验,独立研究人员执行实验,预测结果改善实际决策。

在这类测试成为常规之前,有关加快药物开发的说法仍属假设。这些模型可能减少早期发现阶段的工作量,但临床开发还包括毒性测试、制造、临床试验和监管审查。

三个信号将表明虚拟细胞这场押注是否奏效

下一阶段应以公开证据进行评判:首个数据集、独立基准表现,以及可执行的访问规则。

第一个信号是 Biohub 的首个大型数据集,预计在 2027 年 10 月左右发布。其规模会受到关注,但覆盖范围和文档质量更为重要。

读者应关注细胞类型、干预措施、剂量、时间点和生物供体的数量;还应检查发布内容是否包含负面结果、原始测量数据、标准化元数据和独立质量控制。

按计划发布、文档完善的数据集将强化 Biohub 的论点:协调投资可以缓解生物学的数据短缺。范围狭窄或延迟的发布则会削弱其五年模型目标。

第二个信号是在真正陌生的生物学场景中的表现。Biohub 及其合作伙伴需要能够阻止模型通过记忆或实验室特有伪影取得成功的基准测试。

Arc 的零样本挑战为这类测试提供了一种范式。未来的评估应增加组织背景、化学干预、更长时间尺度,以及基因表达之外的测量指标。

决定性问题是,预测是否能改善真实的实验选择。模型应识别出科学家原本不会优先考虑的干预措施,并随后产生能够在实验室中经受检验的结果。

在回顾性排行榜上取得成功会令人鼓舞,但仍不完整。前瞻性、经独立复现的实验将提供更有力的证据。

第三个信号是访问与治理条款的公布。Biohub 应披露商业禁运期持续多久、哪些合作伙伴可以获得此类权限,以及每个数据集何时公开。

研究人员还应关注许可、计算资源访问、模型发布政策、隐私保障措施,以及纠正错误记录的机制。这些规则将决定该项目成为基础设施,还是一个延迟公开的企业资产。

该计划的规模使其有机会塑造整个领域的技术标准。即便通用虚拟细胞在五年期限内仍无法实现,这一结果也可能很有价值。

共享标识符和可互操作的数据集将让研究人员能够更公平地比较模型。通用基准将使把选择性结果包装成广泛生物智能的做法更加困难。

对开发者而言,该项目提供了一项超越医学的启示:更好的算法无法无限期弥补缺失、标注不佳或因果关系薄弱的数据。

对生物技术公司而言,该项目可能降低获取有用预训练数据的成本;同时,它也可能通过让大型 AI 公司在药物发现基础设施中提前占据位置而加剧竞争。

对研究机构而言,这一机会伴随着批判性测试模型的责任。科学家应将有用的预测工具与对全面细胞理解的宣称区分开来。

对患者而言,短期预期应保持适度。这项投资不会在明年带来一种新疗法。其近期产出将是数据集、标准、测量系统和实验模型。

Google Biohub 对虚拟细胞的投资意义重大,因为它资助了生物 AI 背后的实体实验工作。它承认,下一次模型改进既取决于实验室,也取决于计算集群。

现在的问题是,Biohub 能否将众多机构、仪器和激励机制转化为可靠证据。请关注首个公开数据集、首个独立前瞻性测试以及最终访问规则。这些结果将表明,这一合作关系是建立了共享的科学基础设施,还是仅仅提出了一个资金充足的承诺。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page