生物学的データがAI創薬における真のボトルネックに浮上
Google Newsは、AI創薬における鋭い対立を浮き彫りにした。モデルは大型化を続ける一方で、信頼できる生物学的エビデンスはいまだ希少で、断片的かつ高コストである。
この議論は、テクノロジー業界でおなじみの筋書きに疑問を投げかける。計算能力やパラメータを増やせばモデルは改善できるが、未検証の生物学的システムに関する信頼できる知識を生み出すことはできない。モデルには依然として、細胞、組織、生物個体、患者から得られる観察データが必要だ。
この違いにより、データを中核とする企業と、主にモデルアーキテクチャや計算規模に賭けるチームとの対立が生まれている。Google DeepMindのAlphaFoldは、最も明確な歴史的参照例となる。これは、実験によって決定された極めて価値の高いタンパク質構造の集積から学習することで、構造生物学を変えた。
次の段階はより難しい。創薬には、安定した分子形状の予測以上のものが必要となる。研究者は、相互作用、疾患メカニズム、毒性、投与量、細胞応答、患者間の差異を理解しなければならない。
各段階は、生成が難しく、比較はさらに難しいデータに依存している。生物学的測定値は、実験条件、研究室の手法、試料調製、細胞種、疾患段階、その他多くの要因によって変動する。
したがって中心的な問いは変わりつつある。かつて業界は、どの企業が最も高性能なモデルを構築できるかを問うていた。現在は、そのモデルが必要とする生物学的データを、どの組織が生成し、結び付け、検証できるかを問うようになっている。
この変化はAIの重要性を下げるものではない。AIが信頼できる価値を提供できる領域を定める一方、印象的な予測であっても実験的な証明が必要な領域を浮き彫りにする。
このGoogle Newsの議論が今重要な理由
競争の中心は、モデルの規模から、各予測を支えるエビデンスの品質と関連性へと移りつつある。
研究活動は急速に拡大している。AI Index reportによると、2025年のAI主導のタンパク質研究論文は3,855本で、2024年の2,259本から増加した。これは約71%の成長に相当する。
タンパク質と薬剤の相互作用は、2025年の論文の54.4%を占めた。タンパク質構造予測は23.9%で、前年の28.7%から低下した。
この変化は、研究者が初期の構造予測という課題を越えつつあることを示している。治療薬設計に重要な相互作用へ、より強く焦点を当てているのだ。
しかし、この移行はデータ制約を露呈させる。タンパク質構造は有用なスナップショットを提供するが、医薬品開発は多くの生物学的状態と相互作用に依存する。そうした条件に関する実験測定は、配列や予測構造に比べて依然としてはるかに少ない。
公開データセットも大きく成長している。2026年版AI Indexは、50種類を超えるがん細胞種を1,100種類以上の薬剤に曝露した測定値を含むTahoe-100Mを取り上げた。また、1億件を超える量子力学計算を収録したMetaのOMol25コレクションにも言及している。
これらの数字は膨大に聞こえるが、データセットの規模だけでは誤解を招きかねない。シミュレーションによる分子計算、遺伝子配列、患者の転帰は、それぞれ異なる形態のエビデンスである。一方を他方の代わりに自動的に使うことはできない。
基礎となる測定データも、生物学的空間を均等にはカバーしていない。一部のタンパク質、がん、分子相互作用は集中的に研究されてきた。希少疾患、特殊な結合メカニズム、多様な集団、陰性実験については、カバー状況の一貫性が低い。
モデルは、既知の学習領域内では高い精度を示せる一方、真に新規な生物学には苦戦する可能性がある。この問題は、学習データに含まれる条件を超えた予測を意味する外挿に似ている。
創薬では、まさにそのような挙動がしばしば求められる。科学者が求めているのは、既知の実験室条件下で十分に特徴付けられたタンパク質についてもう一つ予測を得ることではなく、成功事例のない標的に対する治療法である。
Google Newsの見出しは、成熟しつつある業界の議論を捉えている。モデルは単独の製品ではなくなり、実験的学習システムの一構成要素になりつつある。
そのシステムは、何を試験するかを決定し、実験を行い、その条件を記録し、結果を解釈し、得られたエビデンスを将来の意思決定へ戻さなければならない。このループを管理する企業は、モデルへのアクセスだけでは得られないものを手にする。
モデルアーキテクチャは、論文、オープンソース公開、人材の移動、商用サービスを通じて広がり得る。一方、慎重に作成された生物学的データは、専門的な研究室、試料、プロトコル、品質管理を必要とするため、複製にはより時間がかかる。
これは、あらゆる独自データセットが防御可能な優位性を生むという意味ではない。ノイズが多い、または無関係な測定値を大量に集めても、誤ったパターンを強化しかねない。競争上の資産となるのは、追跡可能な条件下で意味のある生物学的問いに答えるデータである。
そのため業界には、ベンチマーク改善以上の成果を示す圧力がかかっている。製薬企業、投資家、科学者、規制当局には、予測を研究室での挙動、そして最終的には患者の転帰へ結び付けるエビデンスが必要だ。
AlphaFoldが示す可能性と限界
AlphaFoldは、卓越した生物学的データが何を可能にするかを示した。しかし、その成功によって、医薬品開発のあらゆる問題が別の構造予測タスクに変わるわけではない。
AlphaFoldは、実験によって決定された三次元構造の公開アーカイブであるProtein Data Bankから学習した。これらの構造は、X線結晶構造解析、核磁気共鳴、クライオ電子顕微鏡といった高度な技術によって作成された。
このアーカイブは、標準化された構造記録、数十年にわたる科学的キュレーション、多くのタンパク質ファミリーにわたる一般化を支える十分な多様性という、価値ある組み合わせを研究者にもたらした。
Google DeepMind’s official AlphaFold overviewによれば、AlphaFoldデータベースは2億種類を超えるタンパク質の予測構造を提供している。こうした予測により、研究室の手法だけでは到達できない規模で、構造に関する仮説へのアクセスが広がった。
このシステムの影響を軽視することは難しい。科学者はAlphaFoldの予測を、仮説形成、実験の解釈、従来は構造が不明だったタンパク質の調査に利用してきた。
しかし、予測構造は医薬品ではない。治療候補は適切に結合し、標的組織へ到達し、安定性を保ち、毒性を避け、変化する生物学的条件下で機能しなければならない。
タンパク質も動的である。コンフォメーション間を移動し、他の分子と相互作用し、単離された構造表現の中とは異なる振る舞いを細胞内で示す。
AlphaFold 3は、タンパク質、DNA、RNA、イオン、小分子を含む相互作用をモデル化することで、このアプローチを拡張した。そのresearch paperは、複数の分子相互作用タスクで精度が向上したと報告している。
この進歩により、同システムは創薬との関連性を高めた。しかし、実験の必要性がなくなったわけではない。モデル出力はあくまで予測であり、その有用性は標的、利用可能な学習事例、提案される相互作用の新規性に左右される。
Natureは2025年、公開学習データが制約となりつつあるため、製薬企業が新たな産業モデルに独自構造データを提供していると報じた。このdata shortageは、特にタンパク質複合体と薬剤らしい分子との相互作用にとって重要だった。
この展開は、現在の議論の中心にある逆転を示している。AlphaFoldの注目度はアルゴリズムへの関心を高めたが、その性能は長年にわたり実験で生成されてきた生物学的データに依存していた。
モデルの技術面での差が縮まるにつれ、独自データがより大きな差別化要因になる可能性がある。高度なアーキテクチャを持ちながら実験的カバレッジが弱い企業は、合成または試験の段階で失敗する、自信に満ちた予測を生み出す危険がある。
逆に、適切に設計された実験を行う企業は、反復的な学習サイクルを通じて、より目立たないモデルを改善できる。各実験は誤りを特定し、不確実性を絞り込み、次の高額な試験に進めるべき候補を見定める助けとなる。
この能動学習プロセスでは、最も有用な新情報をもたらす実験に基づいて試験を選択する。候補を順位付けしたリストの背後に不確実性を隠すのではなく、モデルの不確実性を研究室での作業の指針として扱う。
この違いは重要だ。生物学的データは受動的な燃料ではない。研究者は、どのアッセイを実施するか、どの対照を含めるか、結果をどのようにラベル付けするかを決める。こうした選択が、モデルが学べる内容を決定する。
陰性結果も重要である。結合に失敗した実験や毒性を示した化合物は、重要な境界を定義できる。しかし、成功した知見のほうが注目を集めやすく、発表もしやすいため、陰性データは公開文献から欠落しがちだ。
この出版バイアスは、化学空間と生物学的空間に対するモデルの見方を歪める可能性がある。学習記録が成功事例を強調する場合、予測は失敗に関して適切に較正されなくなるおそれがある。
最も強力なAI創薬システムは、計算と規律ある実験設計を組み合わせることになる。失敗した結果も保存し、メタデータを記録し、実測値とシミュレーションまたは予測値を区別する。
Google Newsはデータに関する物語を取り上げているが、より深い問題は科学的フィードバックにある。AIが有用になるのは、予測が試験につながり、その結果が次の予測を改善するときだ。
競争を分けるのはデータループとモデル規模
主要な競争は企業同士ではなく、閉じた実験データループとモデル優先戦略の間で起きている。
モデル優先の組織は、公開分子データベース、発表済み研究、事前学習済みシステム、ライセンス取得済みソフトウェアから始めることができる。このアプローチは、計算創薬への参入コストを下げる。
また、有望なデモンストレーションを迅速に生み出すこともできる。チームは大規模な研究室運営を構築する前に、仮想化合物をスクリーニングし、結合ポーズを予測し、研究を要約し、候補を生成できる。
不利になるのは、既存データセットに含まれていない生物学にプロジェクトが到達したときだ。公開リソースは競合他社が使用したデータと大きく重複し得る。その盲点も共有された盲点になり得る。
閉ループ型の組織は、計算予測を自動化またはハイスループットの実験に直接結び付ける。結果はモデルへ戻され、システムは独自のエビデンスを使って優先順位を更新できる。
Recursion Pharmaceuticalsは、この戦略の目立つ実例の一つである。同社のofficial platform descriptionは、大規模な細胞画像データセットを生成し、観察可能な細胞変化を化学的または遺伝的介入と結び付けることを強調している。
Absciなどの企業は、タンパク質および抗体設計のために機械学習と研究室システムを組み合わせている。Insilico Medicineは、標的同定、分子生成、臨床開発にまたがるエンドツーエンド戦略を追求してきた。
Google DeepMindとIsomorphic Labsは、高度な構造モデリングと計算創薬の観点からこの分野に取り組んでいる。その取り組みはアルゴリズムの価値を示す一方、製薬企業との提携を通じて、領域専門知識や実験プログラムへのアクセスも提供している。
これらの企業は、単一のカテゴリーにきれいに収まるものではない。本格的な創薬プラットフォームの多くは、モデル、公開エビデンス、独自の測定データ、外部ラボでの作業を組み合わせている。
重要な違いは、各社がどこで複利的な改善を見込んでいるかにある。モデル中心の戦略は、より優れたアルゴリズムと計算資源の拡大が最大の進歩を生むと考える。データループ戦略は、生物学的実験の反復によって、より強固な優位性を築けるとみる。
現時点のエビデンスは両者を組み合わせるアプローチを支持しており、アーキテクチャが成熟するにつれてデータ品質の重要性が高まっている。2026 AI Indexは、新しいタンパク質モデルが単に大型化しているわけではないと指摘した。
同分析は、キュレーションされたデータで学習する、あるいは検索によって補強される、より小規模で特化したシステムへの移行を指摘した。また、より大規模な構造モデルが、タンパク質と低分子の結合に関するベンチマークでAlphaFold 3を明確に上回っていないことも示した。
この結果は、モデルのスケーリングが終わったことを証明するものではない。ベンチマークは選ばれた課題を測定するものであり、実際の創薬プログラムを反映できない場合がある。しかし、パラメータを増やすことが、より良い生物学的予測への確実な道筋ではないことは示唆している。
データでは、生の量よりも多様性も重要である。モデルには、異なる分子ファミリー、細胞種、遺伝的背景、投与量、時点、実験手法にまたがるエビデンスが必要だ。
マルチモーダルデータは、分子構造、遺伝子活性、細胞画像、臨床記録、科学文献といった複数の測定タイプを結び付ける。こうした接続は、分子の挙動をより大きな生物学的アウトカムと関連付けるうえで役立つ。
ただし、モダリティの統合にはそれ自体のリスクもある。記録は異なる集団や実験条件を記述している可能性がある。データセット間の相関は、ある生物学的プロセスが別のプロセスを引き起こしたことを立証しない。
データ来歴、すなわち測定値の記録された起源と処理履歴が不可欠になる。研究者は、各値がどのサンプル、機器、プロトコル、変換処理から得られたのかを把握する必要がある。
来歴がなければ、モデルはラボ由来のアーティファクトを学習しかねない。研究者が本当に関心を持つアウトカムと、実験バッチ、画像装置、またはサンプル前処理法を関連付けてしまう可能性がある。
自律型AIエージェントが標的や実験を選定する場合、この問題はさらに深刻になる。エージェントはデータベースや分析ツールを高速に横断できるが、その速度は切り離されたエビデンスに由来する誤りも増幅し得る。
信頼できる生物学的コンテキスト層は、遺伝子、タンパク質、経路、疾患、化合物、アッセイ、患者群といったエンティティを結び付ける。また、不確実性や相反する結果も保持する必要がある。
ナレッジグラフは、その一つの実装方法を提供する。エンティティとその関係を構造化されたネットワークで表現するものだ。ただし、グラフの信頼性は、元となるデータと関係性の定義の信頼性を超えることはない。
企業の買い手にとって、これは調達時の問いを変える。ベンダーが選定したベンチマークでのモデル精度を比べるだけでは不十分だ。買い手はデータ権利、アッセイのカバレッジ、検証方法、来歴、そしてこれまでに見たことのない標的に対する性能を調べるべきである。
また、計算上の推奨がどの程度の頻度でラボ試験を通過するのかも尋ねるべきだ。有用なプラットフォームは、科学者が却下する候補をただ増やすのではなく、意思決定を改善しなければならない。
したがって競争上の圧力は、エビデンス戦略を持たずにモデルへのアクセスを販売するAI創薬企業に向かう。また、社内データが分断されたシステムに閉じ込められている製薬企業にも向かう。
過去の実験を接続できない組織は、失敗した作業を繰り返したり、不完全な記録でシステムを訓練したりする可能性がある。データ統合は、日常的な情報技術プロジェクトではなく、研究戦略の一部になる。
複雑な技術的エビデンスを扱うナレッジワーカーにとって、適切に維持管理された検索可能なナレッジベースはトレーサビリティを改善できる。ただし創薬では、文書検索は検証済みのラボシステムを置き換えるのではなく、補完するものでなければならない。
より多くの生物学的データでも、より確信度の高い誤答を生み得る
量を関連性、多様性、独立した実験的検証の代替物として扱うとき、データ重視の論点は危険になる。
生物学データセットには、どの生物、組織、疾患、集団が研究対象となるかについての選択が反映されている。また、資金配分の優先順位、臨床へのアクセス、ラボ慣行に由来するバイアスも受け継ぐ。
データセットは数百万件の観測値を含んでいても、人間の生物学のごく狭い範囲しか表していない場合がある。類似した測定を繰り返しても、モデルが新しい疾患メカニズムを扱う方法を学ぶとは限らない。
バッチ効果も別の問題を生む。これは基礎となる生物学ではなく、ラボ、機器、技術者、処理日などによって生じる系統的な差異である。
研究者は正規化や品質管理を適用できるが、補正方法が意味のあるシグナルを除去したり、隠れたアーティファクトを残したりする可能性がある。より大きなデータセットは、バイアスのある結果を統計的により説得力があるように見せることがある。
ラベルにも不確実性がある。不活性と記述された化合物が、不適切な濃度で試験されていた可能性がある。疾患カテゴリーには、複数の異なる分子メカニズムを持つ患者が含まれている場合もある。
こうしたラベルで訓練されたモデルは、生物学の構造ではなくデータベースの構造を学習する可能性がある。記録されたカテゴリーを正確に予測しても、有用な治療介入を特定できないことがある。
因果推論はより深い課題を突き付ける。疾患と関連する遺伝子が、必ずしも良い標的とは限らない。その遺伝子の活性を変えると、代償経路や別の場所での有害作用を引き起こす可能性がある。
創薬には、研究者が生物学的システムを意図的に改変した後に何が起こるかを測定する摂動データが必要だ。それでも、培養細胞で得られた結果が動物や患者に移行するとは限らない。
ヒトデータは特に価値が高いが、プライバシー、同意、アクセス要件がその利用を制限する。臨床記録には欠損値、治療選択バイアス、一貫性のない記録が含まれ得る。
集団の代表性も重要である。特定の祖先集団や医療アクセスのパターンを持つ患者に不均衡に偏って訓練されたモデルは、他の集団で性能にばらつきが出る可能性がある。
独自データは商業的優位性を生むが、秘匿性は外部からの検証を弱め得る。独立した研究者は、非公開データセットが主張された生物学をカバーしているか、あるいは系統的な誤りを含むかを容易に検証できない。
同じ緊張関係は、製薬企業が民間のタンパク質構造を業界のモデリングプロジェクトに提供することに合意した際にも現れた。より多くの構造は予測を改善できる一方、アクセス制限は商業研究と学術研究の格差を広げる可能性がある。
規制当局は、訓練データセットが大規模であるという理由だけで治療法を承認しない。安全性、有効性、製造品質、提案された使用法を裏付けるエビデンスを評価する。
米国食品医薬品局のAIガイダンスは、規制上の意思決定を支援するために用いられるAIモデルについて、リスクベースの信頼性評価を重視している。使用文脈は依然として中心的な要素である。
初期実験の優先順位付けに用いられるモデルと、重要な意思決定におけるエビデンスの代替として使われるモデルでは、結果の重大性が異なる。必要な検証もその違いを反映すべきだ。
臨床結果は依然として最も厳しい試験である。2025年には、無作為化第2a相試験で、特発性肺線維症におけるAI発見標的と薬剤の組み合わせについて、安全性と有効性の兆候が報告された。
臨床上のマイルストーンが重要なのは、計算的な発見を患者エビデンスと結び付けるからだ。それでも、第2a相でのシグナルは、広範な臨床的成功や規制承認を確立するものではない。
この結果は慎重な楽観を促すべきであり、AIが創薬開発を解決したという宣言ではない。多くの候補は、初期研究で有望に見えた後も失敗する。
AIは標的選定と分子設計を加速できる一方で、その後のボトルネックは残る。毒性学、製造、患者募集、投与量、長期アウトカムの測定には、依然として時間とエビデンスが必要である。
したがって、データ中心の見方に対する最も強い批判は、データが重要でないというものではない。企業が「独自の生物学的データ」を検証不能なマーケティング主張として使い得る点にある。
信頼できるデータ優位性は、観測可能な結果を生むはずだ。候補は前向き実験をより高い頻度で通過し、不確実性の推定は適切に較正され、結果はラボ間で再現されるべきである。
企業は適切な失敗事例も開示すべきだ。成功例だけを報告するプラットフォームでは、買い手は性能を評価するための分母を得られない。
業界は、モデルの誇大宣伝をデータの誇大宣伝に置き換えることを避けなければならない。接続された生物学的記録が役立つのは、文脈、不確実性、矛盾するエビデンスを保持するときに限られる。
生物学的データ仮説を検証する3つのシグナル
次の証明は、前向き検証、再現可能なデータ提携、臨床アウトカムの順で得られる。
第1のシグナルは、真に未見の生物学的標的に対する性能である。後ろ向きベンチマークでは、意図せず訓練データと重複したり、よく知られたタンパク質ファミリーに有利に働いたりする可能性がある。
前向き試験は、実験結果が判明する前に始まる。企業はどの候補が機能するかを予測し、その予測を記録してからアッセイを実施する。
この設計は選択的報告を制限し、より明確なヒット率を示す。データ中心のプラットフォームがモデルのみのベースラインを一貫して上回れば、本稿の中心的な判断はより強固になる。
比較には実験コストとサイクルタイムも含めなければならない。精度をわずかに改善しても、非現実的な数のアッセイを必要とするプラットフォームは、有用な優位性を生まない可能性がある。
独立したラボにまたがるエビデンスがあれば、論拠はさらに強まる。再現は、性能が一つのチームの機器、プロトコル、文書化されていない専門知識に依存していないことを示す。
未見の標的で失敗すれば、特に独自プラットフォームの性能が公開モデルと変わらない場合、データ仮説は弱まる。それは、蓄積された測定データが依然として狭すぎるか、ノイズが大きすぎて、信頼できる外挿には不十分であることを示唆するだろう。
第2のシグナルは、製薬データ提携がどのように運営されるかである。発表では、データセットの構成、品質、許容される用途を説明せずに、非公開データへのアクセスが語られることが多い。
意味のある問いは、パートナーがラボや治療領域をまたいで記録を標準化できるかどうかだ。共有スキーマだけでは、一貫性のない実験設計を解決できない。
ベンチマーク手法、来歴標準、または独立して検証可能なサブセットを公表する提携に注目すべきだ。これらの措置は、参加者がデータ品質を科学的問題として扱っていることを示す。
改善されたモデルへのアクセスを誰が保持するかにも注目すべきである。非公開コンソーシアムは商業研究を加速できる一方で、学術研究者や小規模バイオテクノロジー企業への恩恵を限定する可能性がある。
より広範な官民データ取り組みは、分野全体を強化するだろう。独自の創薬プログラムを維持しながら、共通の測定標準に向けた競争前のリソースを生み出せる可能性がある。
検証の詳細を伴わない一連のクローズドな契約は、より弱い裏付けにとどまる。そのような取引は、実証された科学的進歩というより競争上の恐れを反映している可能性がある。
第3のシグナルは、臨床開発を通じた進展である。ラボでのヒット率は重要だが、予測されたメカニズムが医薬品へと転換されるかどうかの最終試験を提供するのは患者である。
最も有益なプログラムは、標的発見と分子設計でAIを活用し、その後、十分に統制された試験を通じて結果を報告する。明確な文書化によって、AIがどこで意思決定に影響したのかを示すべきである。
第2相および第3相試験が成功すれば、これらのプログラムが統合された実験学習ループに基づいていた場合、生物学的データの価値という論拠が強まるでしょう。データ戦略と患者への便益が結び付くことになります。
臨床試験での失敗が繰り返される場合は、より詳細な分析が必要です。失敗は、標的仮説の弱さ、分子設計の不備、予期せぬ毒性、あるいは試験実施上の限界を示している可能性があります。
この区別が重要なのは、「AI-discovered」が多様なワークフローを含む言葉だからです。このラベルだけでは、どのモデル、データセット、あるいは人間の判断が成功または失敗に寄与したのかは分かりません。
したがって、Google Newsを追う読者は、候補化合物の創出スピードに関する主張だけを見るべきではありません。より重要な問いは、科学的・規制上の厳格さを維持しながら、そのシステムが回避可能な失敗を減らせるかどうかです。
AI創薬は、より演出性の低い段階に入りつつあります。モデルのデモンストレーションは続くでしょうが、持続的な進歩は、予測を単に例示するのではなく検証する実験にかかっています。
Google Newsは本質的な対立を浮き彫りにしました。アルゴリズムは可能性を順位付けできますが、現実の生物学に耐えられる可能性を決めるのは生物学そのものです。
今後数か月で、さらなるデータセットの公開、製薬企業との提携、プラットフォームに関する主張が増えるはずです。それぞれを、次の3つの問いで評価してください。
その予測は前向きに行われたものか。独立した実験によって再現されたか。その証拠は、患者にとって重要な意思決定を改善したか。
これらの問いは、研究者、企業の購買担当者、テクノロジー読者にとって実用的なフィルターとなります。また、実用的な生物学的学習システムと、信頼できる証拠を探し求める印象的なモデルとを分ける基準にもなります。



