CLSSプロテイン・ユニバース・マップは配列と構造を統合するが、AlphaFoldの代替ではない
CLSSは、しばしば相反するシグナルを示すアミノ酸配列と三次元構造を結び付ける、32次元のプロテイン・ユニバース・マップを作成した。このモデルは、配列、構造、あるいは短い断片のいずれから出発しても、タンパク質ドメインを比較するための単一の座標系を研究者に提供する。
この違いは重要だ。CLSSは、数十億ものタンパク質構造を予測するための新たな試みではない。AlphaFoldなどの関連システムは、すでにこの課題を変革している。CLSSが扱うのは、そうした予測が生み出した整理上の問題、すなわち研究者が膨大なタンパク質コレクションをどう探索し、単一のデータ型では見落とされかねない関係性をどう認識するかである。
2026年8月に発表された査読済み研究は、CLSSが学習時に専門家によるタンパク質分類ラベルを使用せず、それらの主要なパターンを再現したと報告している。また、選定された分類ベンチマークでは、より大規模な複数のタンパク質言語モデルを上回った。この結果は、配列解析と構造解析を別々の段階として扱う従来の研究ワークフローに再考を迫るものだ。
CLSSプロテイン・ユニバース・マップが実際に変えること
CLSSはタンパク質配列と構造を互換性のある座標に変換し、個々の形状を予測することから、タンパク質空間全体の関係性を整理することへと焦点を移す。
ハイファ大学、テルアビブ大学、Earth-Life Science Instituteの研究者らは、Contrastive Learning Sequence-Structure、略称CLSSを開発した。彼らのPNAS studyは2026年8月11日に発表された。
タンパク質配列は、アミノ酸を順番に列挙したものだ。タンパク質構造は、その鎖が三次元空間をどのように占めるかを記述する。どちらにも系統や機能に関する証拠が含まれるが、常に同じことを示すわけではない。
遠縁の配列が似た構造へと折りたたまれることがある一方、近縁の配列も、変異、結合イベント、環境変化の後には異なる挙動を示しうる。この多対多の関係が、普遍的なタンパク質マップの構築を難しくしている。
CLSSは各タンパク質ドメインを、関連する対象同士を近くに配置する数値ベクトルである埋め込みとして表現する。最終的な埋め込みはわずか32次元だ。研究者は視覚的な探索のためにこれらのベクトルを2次元へ投影でき、類似性検索は完全な表現上で実行される。
このモデルは、配列または構造のいずれかを入力として受け取る。その後、対応する配列入力と構造入力にほぼ同じ位置を割り当てることを目指す。この性質はcoembeddingと呼ばれ、異なるデータ型が比較可能な単一の座標空間を共有することを意味する。
既存システムも複数の生物学的モダリティを処理できる。しかし、複数のモダリティを受け入れられることは、その表現が整合していることを保証しない。各入力が別々の内部幾何をたどるため、モデルは同じタンパク質の配列と構造を異なる領域に配置する可能性がある。
研究者らは、評価においてCLSSがESM3、ProstT5、ProTrekよりもこの分離を効果的に回避したと報告している。ドメインの配列から得たマップは、その構造から得たマップとよく似ている。この一貫性により、可視化は隣り合う2冊のアトラス以上のものとなる。
このモデルには主に2つの形態がある。CLSS-fullは完全なドメイン配列と対応する構造を組み合わせる。CLSS-subは構造と配列断片を組み合わせ、より短い断片も同じ表現空間に入れられるようにする。
タンパク質ドメインは、ある程度独立して折りたたまれたり機能したりできるコンパクトな単位だ。進化はドメインやより小さな断片を繰り返し組み替え、新たなタンパク質を生み出す。したがって、断片を意味のある位置に配置できるモデルは、タンパク質全体の比較では隠れてしまう関係を明らかにできる。
これが見出しの背景にある中心的な変化だ。このモデルは、どのデータベースにも収録されていない無限の集合である、自然界で可能なすべてのタンパク質を文字どおり表示するものではない。代表的なドメインを整理し、より広範なタンパク質コレクションを共通のマップに投影する統一的な方法を提供する。
この捉え方は、AIが生物学のアトラスを完成させたと言うより正確だ。CLSSプロテイン・ユニバース・マップは、すべてのタンパク質や生物学的機能の最終目録ではなく、分析のための座標系である。
なぜタンパク質研究には共有座標系が必要だったのか
予測構造の急増は、構造予測だけでは解決できない解釈上のボトルネックを生み出した。
AlphaFoldは、かつてない規模で高精度なタンパク質構造予測を利用可能にした。その公開データベースには、生命系統樹全体の生物にまたがる2億件超の予測構造が収録されている。
ほかのプロジェクトは、この領域をさらに拡大している。reported atlas detailsによると、ESMFold2を基盤とする2026年のリリースでは、10億件超の予測タンパク質構造を含むオープンなアトラスが生成された。現在の研究者は、従来の手作業による分類で無理なく扱える量を大きく超える構造データに直面している。
構造が増えても、生物学的理解が自動的に深まるわけではない。科学者は依然として、どのタンパク質が関連しているか、どの領域が似た分子に結合するか、そして見かけ上の類似性のどれが共通祖先を反映しているかを判断する必要がある。
進化は識別可能な残基パターンを残すため、配列比較は依然として有用だ。しかし、そのパターンは長い時間尺度では薄れていく。2つのタンパク質は、配列が従来のアラインメント手法の検出範囲を超えて分岐した後も、関連するフォールドを保持しうる。
構造比較は、こうした遠い関係の一部を回復できる。しかし、巨大なデータベース全体で詳細な三次元関係を計算・検索するには、多大な計算コストとストレージが必要となる。また、多くの配列では構造が得られない、あるいは不確実である。
コンパクトな埋め込みは、生データと生物学的判断の間に別の層を提供する。タンパク質が短い数値ベクトルになれば、研究者はすべての配列や構造を他の全エントリーと繰り返しアラインメントすることなく、近傍項目を検索できる。
CLSSはさらに、配列由来ベクトルと構造由来ベクトルを比較可能にする。配列しか持たない研究者でも、構造上の関係に基づくランドスケープを検索できる。別の研究者は既知の構造から出発し、その配列パターンが追加の文脈を提供する近傍を見つけられる。
チームは、ECODやCATHの階層ラベルを与えずにCLSSを学習させた。ECODとCATHは、構造的・進化的関係に基づいてタンパク質ドメインを分類する専門家キュレーション型のシステムである。
この欠落にもかかわらず、得られたマップはその階層的組織の多くを再現したと報告されている。この結果は、モデルが評価に用いた分類ラベルを記憶したのではなく、対応付けられた配列と構造のデータに含まれる関係を学習したことを示唆するため重要だ。
このマップは、階層にきれいに収まらない関係も示せる。従来の分類は、分類学上の枝のように、タンパク質を入れ子状のグループに配置する。生物進化は常にそのような整然とした境界に従うわけではない。
ドメインは断片を再利用したり、構成要素を交換したり、中間的な形態を経たりすることがある。連続的なマップなら、曖昧な事例を確立済みの領域の間に配置でき、それぞれを単一の箱に無理に押し込む必要がない。
先行研究はすでに、このようなマップが有用である理由を示していた。2023年の微生物タンパク質研究では、連続的なフォールド空間が記述され、148の新規フォールド候補に分類された438の未観測構造が特定された。そのmicrobial protein mapは、低次元の視点が、一見異なるフォールド間の漸進的な関係を明らかにできることを示した。
CLSSは異なる仕組みと目的を採用する。構造グラフ特徴のみを使用するのではなく、対応付けられた配列と構造から共有表現を学習する。この結果は、タンパク質予測からタンパク質ナビゲーションへの、より広範な転換を後押しする。
この転換は、孤立した配列パイプラインと構造パイプラインを維持するチームに再考を迫る。詳細な作業には個別のツールが引き続き必要だが、その出力には共通のインデックス層が必要となる。そうでなければ、研究者は探索能力を比例して高めないまま、より大きなデータベースを構築するリスクがある。
計算生物学者にとって、実務上の教訓は知識システムでよく知られた問題に似ている。有意義なつながりを保てない限り、材料を集めても発見の問題は解決しない。高密度な科学的証拠を管理するチームも、searchable knowledge baseを構築する際に同じ課題に直面する。
コントラスト学習が配列と構造を結び付ける仕組み
CLSSは、無関係なタンパク質ドメインを区別するのに十分な差異を維持しながら、2つの入力経路が同一性について一致するよう学習させることで機能する。
このアーキテクチャは、異なるエンコーダーが異なる入力型を処理する2タワー設計を採用している。一方のタワーはアミノ酸配列を読み取り、もう一方はタンパク質構造を処理する。
配列タワーは小規模なESM2スタイルのモデルから始まる。構造タワーは凍結されたESM3エンコーダーを使用しており、これはCLSSの学習中に基盤パラメータが変更されないことを意味する。アダプター層が両方の出力を共有の32次元空間へ変換する。
学習はコントラスト学習に依存する。各バッチで、システムは対応する配列と構造の表現を互いに近づける。同時に、対応しないドメイン同士をより遠ざける。
この仕組みは、画像とテキストを結び付けるために使われるアプローチに似ている。このモデルでは、研究者がすべてのドメインファミリーにラベルを付ける必要はない。特定の配列が特定の構造に属するという事実から学習する。
チームは、メモリ40ギガバイトのNVIDIA A100 GPU 8基を用いて、ネットワークを80エポック学習させた。学習には約4日半かかったと報告されている。
学習可能なパラメータは約3,600万にとどまった。この総数は、配列経路の初期化に使われた3,500万パラメータの小規模ESM2モデルに近い。ESM3、ProstT5、ProTrekで報告されている規模を大きく下回る。
モデルサイズだけで品質は決まらない。より大規模なシステムは、特化型モデルが試みない、より広範なタスクや豊かな生成的挙動をサポートすることが多い。それでもCLSSは、焦点を絞った学習目標によって、数十億のパラメータを更新せずとも有用な表現を生み出せることを示している。
この対比は、すべてのタンパク質研究グループがハイパースケールの計算予算を持つわけではないため重要だ。学習可能なコンポーネントが小さければ、このアプローチの再現、適応、拡張への障壁は下がる。コンパクトな埋め込みは、学習後のストレージと検索コストも削減する。
CLSS-fullは完全なドメインに焦点を当てる。その配列タワーと構造タワーは、最も強いクロスモーダルの一致を示したと報告されている。完全なドメインがどちらの経路から入力されても、その近傍は比較的安定して維持される。
CLSS-subは追加モダリティとして断片を受け入れる。学習中、システムはサンプリングされたサブシーケンスを完全なドメイン構造と組み合わせる。その断片を、それが属するより大きな構造的文脈の近くに配置することを学習する。
完全な配列をその構造ごと照合するよりも、この課題は難しい。短いセグメントに含まれる情報は少なく、似たモチーフが無関係なタンパク質にも現れ得る。そのためフラグメントモデルは、完全ドメインのアラインメント精度の一部を犠牲にする一方、競合する表現にはしばしば欠ける能力を獲得している。
進化的な根拠は大きい。自然界がすべてのタンパク質を何もないところから新たに発明することはめったにない。小さな配列セグメントは、長い時間軸の中で複製、改変され、異なるドメインへ挿入され得る。
それ以外は無関係な2つのタンパク質に現れるフラグメントは、遠い共通の歴史を示す可能性がある。また、類似した制約が独立して類似した解決策を生む収斂進化を反映している場合もある。CLSSは調査対象となる候補を提示するが、位置情報だけでこの区別を確定することはできない。
研究者らはさらに、生物学的特性をマップ上に重ね合わせた。有機補因子に関連するドメインは特定の領域に集まり、一方で金属結合ドメインはより広く分布していた。
補因子とは、タンパク質が化学反応を行うのを助ける非タンパク質性の分子またはイオンである。マップ全体での分布は、学習された幾何学が配列類似性を超えた機能的特性に対応しているかを検証する手がかりとなる。
これらの重ね合わせにより、CLSSのタンパク質ユニバースマップは仮説生成に役立つ可能性がある。研究者は、特定のリガンドに結合するタンパク質の近くに位置する未特性化ドメインを見つけ、その近傍に焦点を当てて生化学的試験を優先できるかもしれない。
ただし、マップ上の近接性は表現上の類似性を示す証拠であって、同一機能の証明ではない。隣接するタンパク質でも、重要な活性部位残基は異なる可能性がある。また、異なる生物、細胞内区画、あるいは分子複合体で機能していることもある。
したがって、このモデルの役割は自動化された実験室の判定よりも、検索エンジンに近い。膨大な候補集合を絞り込み、予想外の関連性を明らかにできる。それらの関連が生物学的条件下でも成り立つかどうかは、依然として実験で判断しなければならない。
本当の競争は、統合マッピングと個別分析の間にある
CLSSが問い直すのは断片化された表現パイプラインであり、その基盤情報の多くを提供する構造予測システムではない。
どちらのプロジェクトもAIを用いてタンパク質を調べるため、AlphaFoldとの比較は魅力的に映る。しかし、両者が解いている問題は異なる。
AlphaFoldは、配列からタンパク質の三次元構造を予測する。CLSSは、配列および構造表現を用いてタンパク質ドメイン間の関係をマッピングする。一方は構造候補を生成し、もう一方はより大きな空間にわたる証拠を整理する。
したがって、これらのツールは相互補完的に使える。予測されたAlphaFold構造は構造経路に入り、そのアミノ酸配列は配列経路に入る。両表現の一致は、探索や分類を支えることができる。
ESM3はより広い位置づけにある。タンパク質の配列、構造、機能関連情報を扱え、生成も支援する。CLSSは固定されたESM3構造エンコーダを利用するが、共有空間の学習目標はより狭いマッピング目的に置いている。
ProstT5はタンパク質配列と構造アルファベットの間を変換する。ProTrekは複数の生物学的モダリティと対照学習アプローチを用いる。これらのシステムは、マルチモーダルなタンパク質モデリングがCLSS以前から存在していたことを示している。
この研究のより強い主張は、さらに具体的だ。検証された設定では、CLSSは配列マップと構造マップの間でより一貫性の高い重なりを生み出した。研究者らはまた、タンパク質表現を評価する標準化フレームワークであるProteinShakeの分類タスクで強い性能を示したと報告している。
これらの結果は、統合マッピングが技術的な方向性として有望であることを裏付ける。ただし、タンパク質予測、設計、アノテーション、生成のすべてでCLSSが普遍的に優れていることを示すものではない。
特化された32次元表現は、必然的に情報を圧縮する。その圧縮は広範な関係を強調できる一方、他のタスクに必要な詳細を捨てる可能性がある。残基レベルの相互作用、動的コンフォメーション、天然変性領域、細胞内文脈のすべてを、1本の短いベクトル内にそのまま保持することはできない。
学習分布もまた重要な制約をもたらす。CLSSは、ECODに関連する実験決定例および予測例を含む、既存の構造リソースで表現されたタンパク質ドメインから学習した。
これらのデータベースには膨大な科学的価値があるが、生物学全体から中立的に抽出された標本ではない。実験構造は、研究者が単離、安定化、測定できるタンパク質に偏る。予測コレクションは、利用可能な配列やモデル信頼度に由来するバイアスを引き継ぐ。
より広範なProtein Universe Atlasは以前、配列ネットワーク、構造予測、アノテーションを組み合わせ、未探索のファミリーを特定した。その作成者らも、タンパク質空間の大部分に機能を割り当て続けることの難しさを記録している。
CLSSはその未知の領域を消し去るものではない。再編成するのである。十分に特徴づけられていないドメインにも座標は与えられるが、それによって検証済みの機能、機構、進化的起源が得られるわけではない。
ECODおよびCATHに対する評価も、慎重に解釈する必要がある。ラベルを用いずに専門家による階層分類を再現できることは、有意義な証拠である。しかし、これらの分類も依然として、学習例が抽出された既知のタンパク質景観を反映している。
論文は、ランダムに抽出した学習用・検証用ドメインが同じ一般的な分布に由来すると述べている。この選択は、一般的なファミリーが支配的な網羅的マップを構築するという目標には適している。一方、学習例から意図的に隔てられた遠縁ファミリーだけで検証する場合よりも、要求は低い。
この違いは、CLSSが真に未知の生物学へ一般化できるかをユーザーが問う際に重要となる。標準的な分類での性能だけでは、希少なフォールド、特殊な膜タンパク質、天然変性領域、あるいは十分にサンプリングされていない環境由来の配列をモデルがどのように扱うか、完全には答えられない。
次元削減も、注意を要する別の要因を加える。基礎となるCLSS埋め込みは32次元だが、世界地図として表示されるのは通常2次元にすぎない。t-SNEのようなアルゴリズムは局所的な近傍関係を保てる一方、距離や大域的な幾何学を歪めることがある。
したがって、画面上で目を引くクラスターは、生物学的な結論ではなく手がかりである。研究者は完全な埋め込み空間で近傍を調べ、配列アラインメント、構造重ね合わせ、機能アノテーション、実験と比較する必要がある。
「単一の視点」という表現も、誤った期待を生みかねない。配列と構造は互換性を持つようになるが、あらゆる科学的文脈で交換可能になるわけではない。各モダリティには、固有の証拠、不確実性、失敗モードが含まれている。
科学者が基礎となる遺伝子またはタンパク質を決定するとき、配列は直接観測される。予測構造は、残基や複合体ごとに信頼度が変動する推論である。両者を共通埋め込みに配置しても、証拠としての地位の違いは消えない。
適切な競争軸は、統合マッピングと個別分析の間にある。CLSSは、1つの学習済み座標系が統合された証拠をより検索しやすくすると主張する。どの2つのタンパク質がなぜ近くに現れるのかは、依然として詳細なツールで調べる必要がある。
CLSSがタンパク質発見を変える前に必要なこと
次の試験は、独立した研究者がマップ上の近傍関係を、未知で実験的にも扱いにくいタンパク質にまたがる検証済みの発見へと変えられるかどうかだ。
最初に注目すべきシグナルは、遠縁タンパク質ファミリーでの外部再現性である。研究者は、学習用ドメインとテスト用ドメインの間で配列および構造の重複を厳しく制限する分割を用いてCLSSを評価すべきだ。
その条件下で強い性能を示せば、この表現が転移可能な生物学的原理を捉えているという主張が強まる。大幅に性能が低下すれば、その組織化の多くが既知のファミリー分布に依存していることを示唆する。
2つ目のシグナルは、マップ由来の仮説に対する実験的検証である。最も説得力のある研究は、未知または議論のあるタンパク質から始め、CLSSで予想外の近傍を特定し、予測された関係を実験室で検証するものとなる。
有用な成果には、検証されたリガンド結合、酵素活性、構造的類似性、共有された進化的フラグメントなどが含まれ得る。否定的な結果も同様に有益であり、埋め込みがどの種類の近接性を過大評価しているかを明らかにできる。
3つ目のシグナルは、実用的なデータベース検索およびタンパク質工学ワークフローへの採用である。研究チームは、配列アラインメント、進化的復元、設計での利用を構想している。これらの応用には、魅力的な可視化以上のものが求められる。
データベースが拡大しても、検索ツールは高速であり続けなければならない。研究者が候補が表示された理由を理解できるよう、結果には解釈可能な証拠が必要だ。パイプラインはモデルのバージョン、元となる構造、信頼度スコア、データベース更新も記録する必要がある。
プロジェクトの機関による概要では、タンパク質空間を探索するためのインタラクティブビューアが説明されている。独立した研究室での利用は、このインターフェースが単に見慣れた分類を閲覧させるだけでなく、研究者を検証可能な問いへ導けるかどうかを示すだろう。
タンパク質工学は、さらに高いハードルを課す。有用な近傍関係はフラグメントやドメインテンプレートを示唆できるが、機能するタンパク質の設計には、フォールディング、安定性、活性、発現を横断した適合性が必要となる。
CLSS-subは、短い配列フラグメントを完全なドメインや構造の隣に配置するため、この点で特に興味深い。こうした配置が再利用可能な構成要素を一貫して特定できるなら、タンパク質設計の探索段階を改善する可能性がある。
しかし、フラグメントが過去に再利用されていたからといって、安全に移植できる保証にはならない。その挙動は周辺残基や分子文脈に依存する。実験設計では、近傍の埋め込みを組み立て指示ではなく、候補となる関係として扱う必要がある。
同じ注意は創薬にも当てはまる。ある補因子またはリガンドのタイプに関連するクラスターは、優先順位付けの指針になり得る。しかし、近くにあるすべてのタンパク質が同じ分子に結合する、あるいは創薬可能な部位を持つことを立証するものではない。
ユーザーは、将来のCLSSバージョンが不確実性を明示的に取り込むかどうかにも注目すべきだ。1本のベクトルは、モダリティ間の不一致や低信頼度の構造領域を隠し得る。そうした不一致を可視化すれば、研究者は安定した近傍と脆弱な近傍を区別しやすくなる。
もう1つ有用な進展は、マップ上の位置を残基レベルの説明と結び付けることだ。科学者は、2つのタンパク質が共有コア、短いモチーフ、結合ポケット、あるいは広範なアーキテクチャ上の類似性のどれによって整列するのかを知る必要がある。
この透明性が、CLSSが日常的な分析レイヤーになるかを決める。生物学者は、システムが次の実験を設計する助けになるなら、不完全な予測も受け入れられる。視覚的に説得力のあるマップにおける、説明されない近傍関係を信頼する可能性は低い。
CLSSのより深い意義は、データの豊富さへの応答にある。生物学には今や、膨大な配列、予測構造、アノテーションのコレクションがある。制約となる問題は、これらのコレクションを比較可能かつ検索可能にすることへと、ますます移りつつある。
CLSSのタンパク質ユニバースマップは、その問いに対する有力な回答の1つを提示する。配列と構造を共有言語へ圧縮し、確立された分類を再現し、フラグメントを同じ景観の一部にする。
その達成は、生命のタンパク質を地図化し終えることよりはるかに限定的である。未知の機能、不確かな構造、偏ったデータベース、困難な実験は残る。二次元の可視化で、こうした制約を解消することはできない。
研究者はいま、具体的な問いを立てるべきだ。CLSSの近傍は、他の方法では見つけられなかった関係性へと導くのか。そして、その関係性は実験的検証に耐えうるのか。独立した研究室が繰り返し「はい」と答えるなら、統合タンパク質マッピングは説得力ある見取り図にとどまらない。生物学的発見が始まる方法の一部となる。



