HierHGT-DTIのコールドスタート予測、創薬で最も難しい試験に挑む
新たな査読済み研究によると、HierHGT-DTIのコールドスタート予測は、未知のタンパク質標的を含む主要な試験で6つの比較モデルを上回った。この結果は、計算創薬における難題に取り組むものだ。モデルは、試験データが学習例に似ている場合には高い性能を示すことが多い。一方、標的に記録済みの相互作用履歴がない場合、精度は大幅に低下し得る。
中国南華大学の研究者、Zhangben Chen氏とYaping Wan氏はHierHGT-DTIを開発した。このシステムは、化学構造とタンパク質配列の情報を、単一の型付きマルチスケールグラフ内で組み合わせる。その後、候補薬剤とタンパク質が相互作用するかどうかを予測する。
争点は単にHierHGT-DTIと別のモデルの対決ではない。移植可能な分子推論と、既知の化合物、タンパク質、化学骨格に一部依存したベンチマーク上の成功との対比である。このモデルは、タンパク質の同一性を学習から除外した条件で最大の優位性を示した。しかし、いくつかの知見は、こうしたスコアだけでは実験室での有用性を確立できない理由も示している。
タンパク質の履歴が消える場面でHierHGT-DTIが勝利
重要な結果はモデルの総合順位ではない。最大の性能差がどこで現れたかである。
査読済み研究は、2026年9月14日にBMC Bioinformaticsで発表された。Chen氏とWan氏は、DrugBank、BioSNAP、BindingDBでHierHGT-DTIを評価した。これらの公開データセットには、薬剤とタンパク質標的の間で記録された関連付けが含まれる。
研究者らは3つの評価設定を用いた。ランダム分割では、相互作用ペアを学習、検証、テストの各グループに配分する。そのため、既知の薬剤とタンパク質が分割の両側に現れる可能性がある。
コールドドラッグ分割では、完全な薬剤の同一性を学習から除外する。コールドプロテイン分割では、タンパク質配列について同じことを行う。3つ目の設定は、確立されたリガンドデータを持たない新たに注目された標的を最もよく表している。
薬剤標的相互作用、すなわちDTI予測は、特定のタンパク質と相互作用する可能性が高い化合物を順位付けする。これは臨床的有効性を確立するものでも、物理的結合を確認するものでもない。その代わり、生化学的または細胞ベースの実験に送る候補リストを絞り込める。
HierHGT-DTIは、DrugBankとBioSNAPにおけるランダムおよびコールドスタートの全6設定で首位に立った。研究者らは、1つの有利な初期化への依存を減らすため、5つのランダムシードで評価を繰り返した。
DrugBankのコールドプロテイン試験では、このモデルはAUROC 0.864、AUPR 0.878を記録した。AUROCは異なる閾値における陽性・陰性例全体での順位付けを測定する。AUPRは抽出された陽性例の精度を重視するため、陽性例が少ない場合に有用である。
DrugBankで最も強力なベースラインは、コールドプロテインAUROC 0.776に達した。したがってHierHGT-DTIは8.8ポイント先行した。AUPRでの優位性は7.9ポイントだった。
BioSNAPの結果も同じ方向を示した。HierHGT-DTIはコールドプロテインAUROC 0.863、AUPR 0.866に達した。最も強いベースラインのAUROCは0.805で、差は5.8ポイントとなった。
こうした差は、既知のテストデータでモデルを分ける通常のわずかな差より大きかった。また、DrugBankおよびBioSNAPのベンチマーク群にまたがる研究の多重比較補正後も維持された。
BindingDBでの結果はそれほど決定的ではなかった。HierHGT-DTIは、コールドプロテインAUPRで最高の0.681を達成した。しかし、HiGraphDTIはコールドプロテインAUROCでわずかに高い0.835を記録し、HierHGT-DTIの0.831を上回った。
HiGraphDTIは、BindingDBのランダムおよびコールドドラッグ設定でも首位に立った。ランダム設定でのAUROCとAUPRは0.934、0.837だった。HierHGT-DTIは0.932、0.829に達した。
この混在した結果は重要である。新モデルの最も強い主張は、未知のタンパク質に対する候補の優先順位付けに集中する。薬剤標的予測タスク全般での普遍的な優位性を確立するものではない。
3つのデータセットにも大きな違いがある。DrugBankには、17,250件の陽性例を含む34,748組の前処理済みペアが含まれていた。BioSNAPには27,457組のペアと13,830件の陽性例が含まれていた。
BindingDBには24,743組のペアが含まれていたが、陽性例は5,784件にとどまり、陽性率は23.4%となった。DrugBankとBioSNAPはいずれも50%に近かった。
AUPRは陽性例の出現率によって変化する。そのため、生の値はデータセット間ではなく、データセット内で比較すべきである。研究はこの制約を明示的に認識していた。
著者らはHierHGT-DTIを、MolTrans、TransformerCPI、DrugBAN、DO-GMA、GeNNius、HiGraphDTIと比較した。これらのベースラインは、配列モデル、アテンションシステム、グラフベースのアプローチを網羅している。
これは、無関係な論文から転載した結果を比較するよりも強力な試験である。すべてのモデルが一致したデータ分割と同じ5つのシードを使用した。この一貫性により、誤解を招く性能差の一般的な原因をいくつか減らせる。
ただし、一致したベンチマークもなおベンチマークにすぎない。スコアは、キュレーションされた例とサンプリングされた未ラベルペアを順位付けするモデルの能力を測る。主要な予測が検証済みの医薬品になるかどうかは示していない。
コールドプロテイン予測が真の圧力を生む理由
未知のタンパク質で失敗するモデルは、既知のリガンドがない標的を生物学が明らかにした際には、限られた助けしか提供できない。
ランダムなテスト分割は、分子予測を実運用より容易に見せる可能性がある。システムは、繰り返し登場するタンパク質、関連化合物、あるいは既知の化学骨格を利用できる。未知の生物学へ意味のある飛躍をせずとも、除外されたペアを順位付けできるかもしれない。
この懸念はHierHGT-DTIより前から存在する。ベンチマーク記憶に関する研究は、リガンドベースの試験が学習化合物との類似性を報いることを示してきた。したがって、ランダム分割での高精度は汎化性能を過大評価し得る。
コールドスタート問題は、こうした支えの一部を取り除く。コールドプロテイン評価では、すべてのテストタンパク質配列が学習および検証データから除外される。モデルは、他で学習したパターンを転移しなければならない。
確立された薬剤によって扱われているのは、ヒトプロテオームの一部にすぎないため、この設定は重要である。過去の研究では、承認薬および臨床段階の治療法に関連する限られたタンパク質群が整理された。また、治療上の関連性を持つ可能性がある多くの未開拓標的も特定された。
標的は、遺伝学、疾患生物学、耐性研究、または新たな経路の証拠によって注目を集めることがある。それでも、従来の教師ありモデルに十分な試験済みリガンドを欠く場合がある。
これは、相互作用履歴を中心に構築されたすべてのDTIシステムに圧力をかける。最新の標的は、しばしばラベルが最も希薄な標的でもある。過去のラベルに強く依存する手法は、創薬チームが最も優先順位付けを必要とする場所で最も弱くなる。
HierHGT-DTIは、証拠源を相互作用履歴から移そうとしている。このモデルは、化学構造をテキストとして符号化する薬剤のSMILES表現を取り込む。また、標的のアミノ酸配列も取り込む。
このモデルは、実験的に解明された三次元タンパク質構造を必要としない。代わりに、生物学的配列からパターンを学習するよう訓練されたタンパク質言語モデル、ESM-2を使用する。
研究では、800万パラメータのコンパクトなESM-2バリアントを使用した。これは各残基について320次元の表現を生成した。同じモデルは、残基間で起こりそうな関係を記述する予測コンタクトマップも生成した。
この選択により、既知の配列はあるものの実験構造が欠けているタンパク質へシステムを適用しやすくなる。同時に、見かけ上の知能の一部は新たなグラフアーキテクチャだけでなく、事前学習済みタンパク質表現から来ていることも意味する。
著者らはこの区別を認めていた。彼らは、同じESM-2埋め込みを用いるより単純な予測器を求めた。このような比較によって、コールドプロテインでの性能向上のどれほどがグラフ設計に由来するかを切り分けられる。
コールドドラッグ評価には別の複雑さがある。除外された分子は、学習化合物と化学的に類似したままであり得る。研究の従来型DrugBankおよびBioSNAPコールドドラッグ分割では、テスト化合物の半数超が学習または検証データとBemis-Murcko骨格を共有していた。
Bemis-Murcko骨格は、分子の中心となる環とそれらをつなぐ骨格を表す。共有しても2つの化合物が同一になるわけではないが、かなりの構造的な既知性を維持し得る。
研究者らはこの問題に対処するため、骨格非共有試験を追加した。HierHGT-DTIのAUROCは、BioSNAPで2.5ポイント、DrugBankで2.1ポイント、BindingDBで1.4ポイント低下した。
こうした低下は、通常のコールドドラッグスコアが保持された骨格類似性の恩恵を受けるという懸念を支持する。ただし、研究でこのより厳格なプロトコルを適用したのはHierHGT-DTIのみだった。6つのベースラインについて直接比較のために再実行はしていない。
コールドプロテイン試験にも関連する隔たりがある。正確なテスト配列は学習から除外されたが、タンパク質は配列ファミリーのクラスタリングによって分離されてはいなかった。近縁のホモログが分割をまたいで残る可能性がある。
つまり、この試験は未知の同一性を表しており、必ずしも未知のタンパク質ファミリーを表すわけではない。より強力な将来のプロトコルでは、配列クラスターまたはファミリー全体を除外することになる。
したがって、HierHGT-DTIのコールドスタート予測は基準を引き上げるが、汎化試験を完成させたわけではない。正確な同一性を超えた強い転移を示している。遠縁のタンパク質ファミリー間での転移は、まだ示していない。
マルチスケールグラフが分子の詳細を結び付ける
HierHGT-DTIの中核機構は、細かな分子シグナルを保持しながら、それらを薬剤全体およびタンパク質全体の判断へ短い経路でつなぐ。
このシステムは、各候補ペアを1つの異種グラフとして表現する。異種とは、すべてのオブジェクトと接続を同一に扱うのではなく、異なるノードおよび関係タイプをグラフが含むことを意味する。
ノードタイプは6種類ある。薬剤側には原子、化学的部分構造、薬剤全体を表す1つのノードがある。タンパク質側には残基、残基コミュニティ、タンパク質全体を表す1つのノードがある。
化学的階層は、74次元の原子記述から始まる。これらは元素の同一性、原子価、電荷、芳香族性、混成、キラリティーを含む特性を符号化する。
次にRDKitが各分子をBRICS部分構造に分割する。BRICSは、化学的に意味のある結合の周辺で分子を分離するルールベースのフラグメンテーション手法である。
タンパク質の階層は、ESM-2の残基埋め込みから始まる。このモデルは、長いタンパク質を切り詰めるのではなく、記録された完全な配列を保持する。配列が1回の処理には長すぎる場合、重複ウィンドウが予測コンタクトを提供する。
残基は、配列上の近接性、予測コンタクト、埋め込み類似性によって接続される。Louvainクラスタリングは、このグラフを中間的なコミュニティへとグループ化する。
ソースコードはこれらのコミュニティノードを「pockets」と呼ぶが、このラベルには注意が必要である。これらは配列情報から導かれた計算上のグループである。実験的に測定されたリガンド結合ポケットではない。
HierHGT-DTIは次に、両方向で隣接するスケールを接続する。原子は部分構造とつながり、部分構造は薬剤全体とつながる。残基は所属するコミュニティとつながり、コミュニティはタンパク質全体とつながる。
直接のショートカットは、原子を薬剤ノードに、残基をタンパク質ノードにも接続する。これらの経路により、詳細な情報はすべての中間レベルを通過せずにグローバル表現へ到達できる。
最後に、各候補ペアについて、双方向エッジが薬剤とタンパク質のスーパーノードを結ぶ。このエッジは陽性例と未ラベル例の双方に現れる。正しい相互作用ラベルを明らかにするものではない。
完全グラフでは、18種類の有向関係タイプを使用する。4つのアテンションヘッドと共有隠れ層サイズ128を備えた、2層の異種グラフ変換器がこれらを処理する。
異種グラフ変換器は、接続されたオブジェクトと関係のタイプを考慮しながらアテンションを適用する。そのためモデルは、化学結合を残基間の接続や階層リンクとは異なるものとして扱える。
各ノードはまず、流入する関係ごとにメッセージを個別に集約する。次に学習済みの配分メカニズムが、それらの関係固有のメッセージを統合する。この計算では、学習された関係の優先度と利用可能な近傍ノードの数の両方を考慮する。
2層を経た後、モデルは薬剤とタンパク質のスーパーノード表現を抽出する。生のベクトル、要素ごとの積、絶対差を組み合わせる。多層予測器がその表現を相互作用スコアへと変換する。
このアーキテクチャが説得力を持つように見えるのは、化学的・生物学的推論で用いられる複数の階層を反映しているためだ。原子は機能構造を形成し、残基はより大きなタンパク質領域を形成し、両者が全体的な挙動に寄与する。
しかし、アブレーション結果はより抑制的な見方を示している。中間階層を除去した場合、6つのDrugBankおよびBioSNAP設定におけるAUPRの変化はマイナス0.0042からプラス0.0041にとどまった。
これらの階層比較はいずれも統計的有意性に達しなかった。完全な双方向階層は、関連する変種の中で6設定中3設定でしか首位にならなかった。
対照的に、直接的な細粒度からグローバルへのショートカットを除去すると、6設定すべてで平均AUPRが低下した。低下幅は0.0002から0.0109だった。
この証拠にも留保が必要である。96件の検定全体に対する補正後も有意性を維持したアブレーション比較はなかった。また、両方のショートカット群を同時に除去すると、どちらの側に原因を帰属すべきかも分からなくなる。
事後検定は別の見方を示した。あるBioSNAPチェックポイントでは、推論時にショートカット関係を除去するとAUROCが0.239低下した。タンパク質内部の関係を除去した場合は0.069、階層を除去した場合は0.038低下した。
これらの診断は、ある学習済みモデルが何に依存していたかを示すものだ。特定の経路がより広範なベンチマーク上の優位性を引き起こしたことを証明するものではない。
したがって、最も裏付け可能なメカニズムは見出しが示すほど広範ではない。HierHGT-DTIは、複数の情報経路を備えた統合システムとして機能する。直接経路は特に重要に見える一方、中間階層は文脈を提供するものの、測定上の利益は一貫しない。
再現性パッケージにより、この主張は検証可能になっている。ソースコード、設定、処理済み分割、マニフェスト、結果要約、再現手順が含まれる。
この透明性は、独立した研究グループによるより厳格な統制実験を支援するはずだ。また、ベンチマーク構築を再現できない論文よりも、この研究を有用なものにしている。
ベンチマークには依然として未知のネガティブが含まれる
最大の不確実性は、報告された計算が正しく実行されたかどうかではない。ラベルが生物学的な問いを明確に表しているかどうかである。
本研究は、この課題を二値の相互作用予測として位置付けている。ポジティブラベルは記録済みの相互作用に対応する。しかし、多くのネガティブラベルは、実験的に非相互作用と確認されたものではない。
それらは未観測の候補ペアである。一部は、研究者がまだ検証していない、あるいは元のデータベースに追加していない真の相互作用を表している可能性がある。
これは生物学データベースで一般的な問題だ。「記録されていない」ことは、必ずしも「相互作用しない」ことを意味しない。未観測のすべてのペアをネガティブとして扱うと、ラベルノイズが導入される。
DrugBankの準備済みプールには、重複排除後に17,250のポジティブペアと17,498の候補ネガティブペアが含まれていた。元のネガティブサンプリングを説明するメタデータは不完全だった。
上流リリースでは、候補の母集団、サンプリングシード、次数重み付け、スキャフォールド制御、タンパク質類似性制御が完全には文書化されていなかった。こうした欠落により、後続の研究者がベンチマークから推論できる範囲は限定される。
著者らは候補構築を変更して、この感度を検討した。エンドポイント次数を考慮したサンプリングでは、選択した検定において一様サンプリングと比べてAUPRが0.040から0.067低下した。
候補ネガティブ比を3対1にすると、AUPRは0.680から0.878の範囲となった。この範囲は、絶対的な性能が研究者によるスクリーニングプールの構築方法に依存することを示している。
指標の選択も見え方を変える。ネガティブ例が支配的な場合、偽陽性率は数値的に小さいままなので、AUROCは安心できる値に見えることがある。
AUPRは、上位にランクされた候補が実際にポジティブかどうかにより直接的に焦点を当てる。2つの指標を比較した研究は、なぜ適合率・再現率評価が不均衡なスクリーニング課題でより有益な場合が多いのかを説明している。
BindingDBはその違いを示している。HiGraphDTIはコールドプロテインでわずかに優れたAUROCを記録した一方、HierHGT-DTIは大幅に優れたAUPRを示した。
実験室の能力が限られる創薬チームにとって、順位付きリストの上位は非常に重要だ。高いAUPRは、優先候補における無駄なアッセイが少ないことを示す可能性がある。
ただし、前向き試験なしに、ベンチマークのAUPRから実際の実験室での成功率を推定することはできない。このモデルは、真に新しい標的を受け取り、検証済み化合物リストを生成したわけではまだない。
本研究には、GABAA受容体アルファサブユニットとの記録済みポジティブ相互作用5件を対象とした小規模な外部解釈演習が含まれていた。選択された化合物にはclonazepam、isoflurane、desfluraneが含まれた。
各ペアについて、研究者らはモデルが最上位に順位付けした5つの残基と予想される粗い領域を比較した。一致は5残基中0から5残基中5までの範囲だった。
未補正の置換検定値が0.050に達したのは1例のみだった。別の1例は0.077で、残りの例ではさらに弱かった。
この不均一な結果は、結合メカニズムを検証するものではない。著者らもその点を明言している。残基コミュニティは計算された近傍であり、5つの例は物理的な結合部位を確立するものではない。
したがって、解釈可能性は予測順位付けとは分けて扱わなければならない。アテンションスコアは、どの入力特徴がモデルに影響したかを示し得る。しかし、それが自動的に生化学的な原因を明らかにするわけではない。
このモデルは、複数の固定された前処理上の決定にも依存している。これには、0.5のコンタクト閾値、1.0のLouvain解像度、3という最小残基コミュニティサイズが含まれる。
これらの設定は体系的には最適化されていない。異なる閾値またはクラスタリング手法により、中間的なタンパク質表現が変化する可能性がある。
本研究では、より大きなESM-2バージョンではなく、800万パラメータのタンパク質モデルを使用した。この選択により計算要件は抑えられたが、より豊かな配列表現が順位付けを変えるかどうかは未解決のままである。
著者らは、事前計算済みの分子およびタンパク質入力を用い、各実行をNvidia RTX 4090 1台で学習させた。9つの主要なデータセット・分割組み合わせにおいて、学習にはシードごとに26.8分から43.6分を要した。
平均テスト推論時間は5.3秒から11.1秒、すなわち毎秒およそ592から890サンプルだった。割り当てGPUメモリのピークは1.53から2.54 GiBの範囲だった。
これらの数値は、最新GPUを1台利用できる多くの学術チームにとって、分類器の再現は実現可能であることを示唆する。配列表現の事前計算には、報告された学習時間に含まれない作業がなお必要になる。
さらに重要なのは、計算へのアクセスしやすさが実験的検証を解決するわけではないことだ。前向きアッセイは、有望な順位付け手法と、現実の意思決定に信頼される発見ツールとを分ける境界であり続ける。
次にHierHGT-DTIのコールドスタート予測を検証すべきこと
報告された改善が、よく知られたベンチマーク慣行を超えて維持されるかどうかは、3つの検証で決まる。
第1のシグナルは、タンパク質ファミリーをホールドアウトした場合の性能である。完全配列の除外は有用だが、近縁のホモログが学習時に現れることは許容してしまう。
より強力な実験では、分割前に配列同一性でタンパク質をクラスタリングすべきである。そのうえで、クラスタ全体またはファミリー全体を学習データから除外する。
その条件でもHierHGT-DTIが優位性を維持すれば、真に未知の標的への転移に関する証拠はより強くなる。急激な低下が見られれば、近縁の生物学的類似体が現在の結果を支えていたことを示すだろう。
この検証には同じ6つのベースラインを含めるべきだ。すべてのモデルで、候補、シード、指標、ハイパーパラメータ予算を同一に保つ必要がある。
第2のシグナルは、前向きな実験室研究である。研究者は既知の相互作用ラベルがないタンパク質を選び、モデルを固定し、利用可能な化合物ライブラリを順位付けすべきだ。
その後、盲検化されたチームが順位付きリストの定義済み部分を検証できる。確認された結合、機能的活性、偽陽性率、実用的なベースラインに対する濃縮度をすべて報告すべきである。
この設計は、どの後ろ向きデータセットでも解決できない問いに答える。上位予測が実験を節約するかどうか、またモデルが継承されたラベル慣行の外側で機能するかどうかを明らかにする。
ネガティブな結果も価値を持つ。誤解を招く配列類似性、データベースバイアス、あるいは結合を捉えずに記録済み相互作用と相関する特徴を明らかにできる可能性がある。
第3のシグナルは、表現を統制したアブレーションである。より単純な予測器にも、同じESM-2残基埋め込み、原子記述子、分割、最適化予算を与えるべきだ。
この比較により、HierHGT-DTIの型付きグラフ構成そのものの価値を切り分けられる。また、事前学習済み配列特徴がコールドプロテインでの改善の大部分を説明しているかどうかも示せる。
著者らはすでに、これを重要な次のステップとして挙げている。また、薬剤側とタンパク質側を分けたショートカットアブレーション、正例・未ラベル学習、時間的分割、対応した候補構築も提案している。
正例・未ラベル学習では、記録済み相互作用をポジティブとして扱う一方、残りのすべてのペアが真のネガティブであるとは仮定しない。この手法は、不完全な生物学データベースをより適切に反映する。
時間的評価は、別の現実的な課題を提供する。モデルはある時点より前に知られていた相互作用で学習し、その後に発見された関連を予測できる。
この構造は、将来の知識が前処理や分割構築に入り込むことを防ぐ。また、導入済みシステムが時間とともに新たな証拠に遭遇する状況にも似ている。
製薬・バイオテクノロジーのチームにとって、短期的な価値はトリアージにある。HierHGT-DTIは、ドッキング、生化学アッセイ、細胞研究、毒性試験、臨床評価を置き換えるものではない。
代わりに、こうした高コストの工程を最初に行うべき化合物・標的ペアを提案できる。新しい標的が数千のもっともらしい候補を生み出し、実験室の能力が限られる場合、この役割は価値を持つ。
開発者は、この研究が示すより広範なエンジニアリング上の教訓にも注目すべきだ。評価設計は、アーキテクチャ設計と同じくらい重要になり得る。ランダム分割は、導入済みシステムが直面する問いとは異なる問いに答える可能性がある。
この種のシステムのモデルカードでは、エンティティ重複、スキャフォールド重複、タンパク質ファミリーの類似性、ネガティブサンプリング、クラス有病率、時間的来歴を記録すべきである。見出しとなる単一スコアだけの報告では、あまりに多くの情報が隠れてしまう。
再現可能な証拠には、整理された記録も必要だ。モデル、データセット、アッセイ結果を比較するチームには、ローカル技術文書から検索可能なナレッジベースを構築する方法のような、検索可能な技術履歴が必要である。そうでなければ、ベンチマークの前提は実験の間で失われかねない。
HierHGT-DTIのコールドスタート予測は、その最良の結果がより厳しい評価設定で現れているため、信頼できる前進である。オープンな実装と条件を揃えた比較も、この研究をさらに強化している。
抑制的な結論であっても重要だ。このシステムは、2つの主要ベンチマークで未知のタンパク質標的をより適切に順位付けし、BindingDBのある適合率・再現率テストでも首位に立った。ただし、物理的な結合、作用機序、臨床的価値を確立したわけではない。
次の判断は独立した研究者に委ねられる。現在の結果を再現し、タンパク質ファミリー単位のホールドアウトを導入し、固定したランキングを実験室で検証する必要がある。こうした手順により、このモデルが転用可能な生物学的知見を見出したのか、それとも入念に構築された別のベンチマークを習熟したにすぎないのかが明らかになる。



