Google Biohubのバーチャルセル投資、生命科学に欠けるデータを狙う
Googleは、より優れた生物学データによってAIを疾患研究のツールに変えられると見込み、Biohubのバーチャルセル構想に対する3億ドルの企業投資に参加した。Google DeepMindとともに、MetaおよびAlphabet傘下のIsomorphic Labsも参加している。このGoogle Biohubのバーチャルセル投資は、Biohubと米国の2政府機関が関わる、総額18億ドル規模のより広範なパッケージの一部を成す。
見出しだけを見れば、また一つ大規模なAIモデルのプロジェクトに映る。だが実際の狙いは、より構築が難しい。Biohubは、生きた細胞が薬剤、遺伝的変化、環境条件、その他の介入にどう応答するかを記述するデータセットを目指している。
この違いが、中心的な緊張を生む。言語モデルは、人々がすでにオンライン上に置いた情報から学習した。一方で、有用なバーチャルセルには、まだ存在しないことが多い実験観測が必要となる。AIシステムがそこから学べるようになる前に、研究者が実験室でその観測結果を生み出さなければならない。
Mark ZuckerbergとPriscilla Chanが設立したBiohubは、完成済みの生物学シミュレーターを発表するのではなく、データ生産ネットワークを組織している。そのプロジェクトは、企業資本、連邦研究インフラ、科学研究機関、標準化された公開データセットを組み合わせる。
このアプローチは、AI競争に関するなじみ深い前提にも異議を唱える。GoogleとMetaは通常、モデル、インフラ、人材、流通を掌握するために競い合う。ここでは、どちらの企業も単独では十分な量の高品質な実験データを容易に作れないため、共同の生物学的リソースに資金を提供している。
この協力は商業的インセンティブをなくすものではない。参加企業は、一部の民間資金によるデータセットについて、それらが公開される前に一時的な早期アクセスを得る。この仕組みは、オープンサイエンスと企業優位性を同じプログラム内に置く。
Google Biohubのバーチャルセル投資、18億ドル規模の取り組みに拡大
重要な変化は、一社が一つのモデルに資金を提供することではない。生物学データを生産、標準化し、その上で計算処理するための共有システムを構築していることだ。
Biohubは2026年10月7日、拡張されたVirtual Biology Initiativeを発表した。同団体の公式資金発表では、資金、既存データ、計算資源、測定技術を合わせたコミットメントの価値を18億ドルとしている。
Google DeepMind、Meta、Isomorphic Labsは合計3億ドルを投資する。公表された数字からは、各社の拠出額は分からない。したがって、この全額をGoogleの投資と表現するのは正確ではない。
エネルギー省は5年間で5億ドル超を拠出する計画だ。この取り組みは、同省の国立研究所システムを通じ、実験室での測定、生物学的モデリング、計算、イメージング、データ収集を支援する。
国立衛生研究所(NIH)は、過去の連邦政府による5億ドル超の投資を通じて作成されたリポジトリとデータセットを調整する。Biohubは、それらのリソースをAI学習に適した標準化素材へ転換する支援を計画している。
Biohubは2026年4月にVirtual Biology Initiativeを導入した際、さらに5億ドルを拠出すると表明した。非営利団体である同組織は、そのうち4億ドルを新たな測定技術に充てるとした。これには、高度な顕微鏡法、クライオ電子線トモグラフィー、複数のスケールで生物学的システムを改変するためのツールが含まれる。
これらの資金カテゴリーは互換的ではない。一部は新規資金を表す一方、他は過去の連邦支出、データセット、機器、計算能力を表す。18億ドルという総額は、単一の資金調達ラウンドではなく、統合されたリソースパッケージとして理解すべきだ。
この取り組みには複数の科学組織が参加する。Biohubは協力機関として、Allen Institute、Broad Institute、Gladstone Institutes、Human Cell Atlas、Human Protein Atlas、Wellcome Sanger Instituteを挙げた。Nvidiaは計算技術と技術的専門知識を提供する。
Biohubはまた、共有標準、共通識別子、中央アクセスポイントの整備を計画している。生物学データセットでは、実験設計、ラベル、機器、品質管理が異なることが多いため、こうした目立ちにくい作業も重要になる。
慎重な正規化をせずに互換性のないデータセットを結合すると、モデルに誤った教訓を与える大規模リソースが生まれかねない。モデルは意味のある細胞挙動ではなく、研究室間の違いを学習する可能性がある。
この取り組みは、規模の拡大によって問題が深刻化する前に対処することを意図している。主催者は、研究グループが補完的な実験を設計し、より豊富なメタデータを記録し、互換性のあるシステムを通じて結果を処理することを目指している。
Biohubの科学責任者Alex Rivesによれば、最初の大規模データセットは約1年後に見込まれるという報道内容。パートナー各社は、5年以内に正確な予測モデルを実現することを目標としている。
これらの日程は目標であり、検証済みのマイルストーンではない。Biohubは、重要な研究判断に使えるほどバーチャルセルが信頼できる状態になったかを判断する、普遍的な精度基準をまだ公表していない。
本当のボトルネックはモデル規模ではなく実験生物学にある
Google Biohubのバーチャルセル投資は、生物学を公開インターネットからスクレイピングできないため、データ生成を制約要因として扱っている。
バーチャルセルとは、生物学的介入の後に細胞がどう変化するかを予測する計算モデルである。介入には、遺伝子のサイレンシング、薬剤の追加、栄養条件の変更、疾患関連条件への細胞曝露などが含まれうる。
求められる出力は、単に細胞のリアルな画像ではない。研究者は、遺伝子活性、タンパク質、構造、シグナル伝達経路、観察可能な挙動についての予測を求めている。研究室ごとに、異なる問いのために異なるモデルを構築する可能性がある。
がん研究者は、特定の遺伝子を無効化した際に腫瘍細胞がどう応答するかを問うかもしれない。医薬品開発者は、どの化合物を実験室で試験する価値があるかを選ぶ前に、複数の化合物を比較する可能性がある。別のチームは、疾患組織内で免疫細胞がどのように振る舞うかを調べるかもしれない。
こうした問いに答えるには、モデルに対応づけられた観測結果が必要となる。研究者は介入前の細胞を測定し、制御された変化を加え、その結果生じた状態を記録しなければならない。この過程を、細胞タイプ、条件、用量、時点にわたって繰り返す必要がある。
現在の公開コレクションには、数億件の細胞観測データが含まれている。RivesはReutersに対し、信頼できる予測モデリングには数十億件、最終的には数兆件が必要になると語った。この規模の隔たりは、この取り組みに顕微鏡、実験室自動化、連邦施設が含まれる理由を説明する。
規模だけでは問題を解決できない。記録が不十分な数兆件の観測データは、前例のない規模で実験バイアスを残しかねない。データには、因果的変化、生物学的文脈、時間、不確実性も捉えられていなければならない。
例えば空間トランスクリプトミクスは、組織内における細胞の位置を保ちながら分子活動をマッピングする。この文脈は重要である。隣接細胞や組織構造が、細胞の挙動を変える可能性があるためだ。
クライオ電子線トモグラフィーは、細胞内構造の詳細な三次元像を生み出す。摂動スクリーニングは、研究者が遺伝子や環境条件を変化させた後の応答を測定する。各手法は、生物学の異なる層を捉える。
Biohubは、これらのモダリティを孤立したコレクションとして扱うのではなく、調整していく方針だ。同組織の前提は、モデルが分子、細胞、組織、生物個体の各レベルにまたがる関係を学習する必要があるというものだ。
この前提は、この取り組みを、より大きなニューラルネットワークを単に学習させる行為と区別する。Google DeepMindの幹部Pushmeet Kohliは、この課題には生きた細胞が変化にどう応答するかを示す実験データが必要だと述べた。同氏は、オープンで標準化されたデータコモンズが必要な基盤だと説明した。
このデータボトルネックは、研究者が実験室の時間をどう配分するかも変える。信頼できるモデルがあれば、多数の仮説をデジタル上でスクリーニングし、最も有益な候補に物理的な実験を振り向けられる可能性がある。
Alzheimer’s diseaseに関連する分子経路を研究するチームを考えてみよう。現在なら、発表済みのエビデンスと専門家の判断に基づいて実験を選ぶかもしれない。バーチャルセルなら、予測される効果と不確実性に基づいて介入を順位付けできる。
最終的な決め手となる実験は、依然として実験室で行われる。ただし、より少数で情報価値の高い候補を選べるようになる。モデルはその新たな結果から学習し、予測と測定の間に循環を生み出す。
このワークフローは、アルゴリズムが自身の理解を最も改善する次のデータポイントを選ぶアクティブラーニングに似ている。実用的な価値は、実験をなくすことではなく、実験選択を改善することにある。
生物学は、個人、組織、発生段階、疾患状態によっても変化する。一つの培養細胞株で良好に機能するモデルが、初代ヒト組織では失敗する可能性がある。一つの用量で得られた結果が、別の用量にも一般化できるとは限らない。
このため、このプロジェクトが短期的に最も大きく貢献するのは、普遍的なシミュレーターではなく、より良い研究基盤かもしれない。共有データセットは、一つのシステムが関連するすべての細胞応答を予測するはるか前から、より限定的なモデルを支援できる。
オープンデータと企業アクセスは不安定な均衡にある
この取り組みは共有科学に依存する一方、その資金構造は商業参加者に一時的な情報優位を与える。
Biohubは、最終的に生み出されるリソースを科学コミュニティに公開するとしている。Rivesによれば、政府資金によるデータセットに民間向けの公開猶予期間は設けられない。一方、企業資金によるデータは異なる経路をたどる。
商業的な資金提供者は、公開前に一定期間、そのデータを利用できる。Biohubは公開発表の中で、こうした公開猶予期間の長さを明らかにしていない。
この仕組みは分かりやすいインセンティブをもたらす。データ生成にはコストがかかり、早期アクセスは企業投資を正当化する助けになりうる。Google DeepMind、Isomorphic Labs、Metaは、モデルの学習、手法の検証、有望な研究方向の特定に時間を使える。
Isomorphic Labsは、最も明確な直接的商業的つながりを持つ。Alphabet傘下の同社は、創薬のためのAIシステムを開発している。幅広い摂動データセットへの早期アクセスは、標的同定や化合物評価を支援する可能性がある。
Google DeepMindは、タンパク質構造や相互作用を予測するAlphaFoldのようなシステムから得た経験を提供する。ただし、細胞全体のモデリングは別の問題である。タンパク質構造は、動的な生物学的ネットワークの内部にある一要素にすぎない。
Metaの商業的な経路は、より明示的ではない。同社のAI研究組織は生物学的モデリングに取り組んできた一方で、ZuckerbergはChanとともにBiohubの設立に関わった。同社の参加は、戦略的に重要な科学データの取り組みの内部に位置づけを得ることにもなる。
大学や小規模なバイオテクノロジー企業も、最終的には同じデータセットにアクセスできる可能性がある。しかし公開猶予期間中は、資金力のあるパートナーが、より広いコミュニティに基礎となるリソースが届く前に、モデルやワークフローを開発できる。
この先行優位が、オープンサイエンスの約束を必ずしも無効にするわけではない。ただし、アクセス時期が異なる場合に「オープン」とは何を意味するのか、という問いを生む。
詳細なガバナンスが成否を左右する。研究者は、エンバーゴ期間、ライセンス条件、メタデータの利用可能性、ダウンロード制限、ネガティブな実験結果が含まれるかどうかを注視すべきだ。
ネガティブな結果は特に重要である。モデルは、研究者が興味深い反応を観察した場合だけでなく、介入に意味のある効果がない場合も学習する必要がある。選択的な公開は、学習分布を歪めることになる。
この取り組みでは、外部研究者がデータセットに異議を唱えたり、訂正したりする方法も決めなければならない。文書化が不十分であったり、誤りの報告が難しいままであったりすれば、ファイルを公開しても価値は限られる。
商用アクセスは、計算資源を巡る別の不均衡を生む可能性がある。巨大な生物学データセットを公開しても、学術チームがそれを使って競争力のあるモデルを学習する余裕があるとは限らない。Nvidiaの関与はインフラの改善につながる可能性があるが、割り当てのルールが重要になる。
したがってBiohubのモデルは、二つの不完全な選択肢の中間に位置する。完全に独占的なデータセットは科学的な検証を制限し、能力を集中させる。一方で、純粋に公共主導の取り組みでは、同程度の民間投資を呼び込んだり、望ましい速度で進めたりするのは難しいかもしれない。
主要な争点はGoogle対Metaではない。オープンな生物学インフラという約束と、それを資金提供する企業に与えられる実務上の優位性との対比である。
明確な公開スケジュールがあれば、このトレードオフは評価しやすくなる。実験手法、既知の限界、人口統計学的カバレッジ、細胞コンテキスト、品質チェックを説明する公開データセットカードも有用だ。
研究者には、持続的なアクセスも必要になる。インターフェースが頻繁に変わり、バージョンが削除され、安定した識別子がない公開リソースは、再現性を損なう恐れがある。Biohubの共通標準は、個々のモデルと同じくらい重要になる可能性がある。
このガバナンスの問題は、現在のプロジェクトにとどまらない。OpenAIの財団は生物学・医療データセットへの資金提供を始めており、Anthropicは実験室ベースの生物学研究を拡大している。AI企業は、独自の実験データを戦略的資産としてますます捉えるようになっている。
Biohubは、この競争の中に共有レイヤーを提案している。それが実質的に共有されたままであるかどうかは、ローンチ時の約束ではなく、アクセス方針によって明らかになる。
現在のバーチャル細胞は、基本的な汎化テストにもなお失敗している
慎重であるべき最も強い理由は公開ベンチマークにある。そこでは、主要モデルでさえ未知の細胞応答を一貫して予測するのに苦戦している。
Arc Instituteは有用な比較対象となる。同研究所のVirtual Cell Initiativeは、細胞応答の予測を検証するデータセット、モデル、年次コンペティションを開発している。
最初のチャレンジでは、ヒト胚性幹細胞において研究者が特定の遺伝子を抑制した後の遺伝子発現変化を、モデルに予測させた。このベンチマークには、300種類の遺伝的摂動を網羅する約30万件の単一細胞プロファイルが含まれていた。
114カ国から5,000人以上が登録した。1,200を超えるチームが結果を提出し、300を超えるチームが最終エントリーを完了した。この参加規模により、このコンペティションは現在のアプローチに対する意味のある検証となった。
チャレンジ結果は厳しいものだった。Arcは、モデルがすべての評価指標において単純なベースラインを一貫して上回ったわけではないと報告している。
優勝システムは、摂動の識別や活性が変化した遺伝子の特定で改善を示した。しかし、最良の手法はディープラーニングと古典的な統計的特徴を組み合わせていた。純粋なエンドツーエンド学習だけでは、この課題は解決されていなかった。
この結果は、バーチャル細胞が不可能だと示すものではない。既知のデータで高い性能を示しても、新しい細胞種や介入への汎化の代わりにはならないことを示している。
この違いは創薬にとって重要である。研究者には、まだ測定されていない条件について有用な知見を示せるモデルが必要だ。中心的な問いが新規性にある場合、既存データセットからよくあるパターンを記憶するだけでは価値が限られる。
Arcの2026年チャレンジは、難易度を引き上げる。モデルは、学習時に摂動データが提供されていない6つの細胞株での応答を予測しなければならない。このゼロショット設定、すなわちタスク固有の例なしに予測する設定は、科学的な利用により近い。
Arc独自のSTATEモデルは、進歩と限界の両方を示している。同研究所のvirtual cell programによると、STATEは70のヒト細胞コンテキストにわたり、1億6,700万細胞を含む観察データと、1億細胞超を含む摂動データから学習した。
これらの数字は大きいが、生物学的にあり得る可能性と比べればカバレッジはなお疎である。ヒト細胞には、時間とともに変化し、生体組織内では異なる反応を示す、相互作用する分子システムが存在する。
細胞株実験も現実を単純化している。実験室の細胞株は管理された条件下で増殖できる一方、患者の体内にある細胞は免疫シグナル、隣接組織、変動する栄養状態、過去の治療にさらされる。
バーチャル細胞は遺伝子発現を正確に予測できても、別の重要な結果を見逃す可能性がある。薬剤は、明白なトランスクリプトーム上のシグネチャーを生じさせずに、タンパク質の局在、細胞形状、代謝、毒性、細胞間コミュニケーションを変化させる可能性がある。
したがって研究者は、特定の意思決定を軸に成功を定義する必要がある。あるモデルは、すべての細胞プロセスを再現できなくても、遺伝子標的の順位付けには有用かもしれない。別のモデルは、臨床予測には適さないままでも、実験の選定を支援できるかもしれない。
「ユニバーサル・バーチャル細胞」という表現は、こうしたより限定的な閾値を曖昧にしうる。あらゆる細胞と介入を扱う単一モデルを想起させるからだ。実際に進む可能性が高いのは、複数のモデル、測定タイプ、信頼度推定を組み合わせる道筋である。
バーチャル細胞の概説は、研究者の間でこの概念に対する定義が一つに共有されていないと指摘した。視覚的なシミュレーションを想定する人もいれば、焦点を絞った生物学的な問いに答える予測プログラムを意味する人もいる。
この曖昧さは、野心的なタイムラインを判断しにくくする。Biohubは5年以内に正確な予測モデルの実現を見込んでいるが、精度はテスト、細胞コンテキスト、許容される誤差に左右される。
プログラムは、成功を宣言する前に評価基準を公開すべきだ。有用な指標には、未見の細胞種、新たな介入、複数の研究所、学習データと異なる条件での性能が含まれる。
外部による再現も重要になる。一つの実験システム内で得られた結果は、異なる機器やサンプルを用いる独立した研究所で検証されるべきだ。
最も説得力のある実証は、洗練された可視化ではない。モデルが実験を推奨し、独立した研究者がそれを実施し、その予測が意思決定を改善する前向き研究である。
そのようなテストが日常的になるまでは、創薬の高速化に関する主張は仮説にとどまる。モデルは初期探索の作業を減らすかもしれないが、臨床開発には毒性試験、製造、治験、規制審査も含まれる。
バーチャル細胞への賭けが機能しているかを示す三つのシグナル
次の段階は、最初のデータセット、独立ベンチマークでの性能、そして強制力のあるアクセスルールという公開された証拠で判断されるべきだ。
第一のシグナルは、2027年10月頃に予定されるBiohub初の大規模データセットである。その規模は注目を集めるだろうが、より重要なのはカバレッジと文書化である。
読者は、細胞種、介入、用量、時点、生物学的ドナーの数を確認すべきだ。また、公開にネガティブな結果、生データ測定値、標準化されたメタデータ、独立した品質管理が含まれるかも確認する必要がある。
十分に文書化されたデータセットが予定通り公開されれば、協調的な投資が生物学におけるデータ不足を解消できるというBiohubの主張を補強する。限定的な公開や遅延は、5年以内というモデル目標を弱めるだろう。
第二のシグナルは、真に未知の生物学に対する性能である。Biohubとそのパートナーには、記憶や研究所固有のアーティファクトによってモデルが成功することを防ぐベンチマークが必要だ。
Arcのゼロショットチャレンジは、そのようなテストの一つのモデルを提供している。将来の評価では、組織コンテキスト、化学的介入、より長い時間スケール、遺伝子発現以外の測定も追加すべきだ。
決定的な問いは、予測が実際の実験上の選択を改善するかどうかである。モデルは、科学者が本来なら優先しない介入を特定し、その後、実験室で再現性のある結果を生み出すべきだ。
過去データに基づくリーダーボードでの成功は有望だが、不十分である。前向きかつ独立して再現された実験は、はるかに強い証拠をもたらす。
第三のシグナルは、アクセス条件とガバナンス条件の公開である。Biohubは、商用エンバーゴの期間、適用されるパートナー、各データセットが公開される時期を明らかにすべきだ。
研究者は、ライセンス、計算資源へのアクセス、モデル公開方針、プライバシー保護、不正確な記録を訂正する仕組みにも注目すべきである。これらのルールが、このプロジェクトがインフラになるのか、それとも遅れて公開される企業資産になるのかを決める。
この取り組みの規模は、分野全体の技術標準を形作る機会を与える。ユニバーサル・バーチャル細胞が5年の期限を超える目標にとどまったとしても、その成果には価値があり得る。
共有識別子と相互運用可能なデータセットがあれば、研究者はより公正にモデルを比較できる。共通ベンチマークは、選択的な結果を幅広い生物学的知能として売り込むことを難しくする。
開発者にとって、このプロジェクトは医学を超えた教訓を示している。より優れたアルゴリズムでも、欠落している、ラベル付けが不十分な、あるいは因果的な裏付けが弱いデータをいつまでも補えるわけではない。
バイオテクノロジー企業にとって、このプログラムは有用な事前学習データを得るコストを下げる可能性がある。同時に、大手AI企業に創薬インフラで早期の地位を与えることで、競争を激化させる可能性もある。
研究機関にとって、この機会にはモデルを批判的に検証する責任が伴う。科学者は、有用な予測ツールと、包括的な細胞理解をうたう主張を区別すべきだ。
患者にとって、当面の期待は控えめであるべきだ。この投資が来年に新しい治療法をもたらすことはない。短期的な成果は、データセット、標準、測定システム、実験モデルとなる。
Google Biohubのバーチャル細胞投資が重要なのは、生物学的AIを支える物理的な作業に資金を提供するからである。次のモデル改善は、計算クラスターと同じくらい研究所に依存することを認めている。
今問われるのは、Biohubが多くの機関、機器、インセンティブを信頼できる証拠へと結び付けられるかどうかだ。最初の公開データセット、最初の独立した前向きテスト、そして最終的なアクセスルールを注視すべきである。その結果が、この提携が共有された科学インフラを生み出したのか、それとも資金豊富な約束に終わったのかを示す。



