AlphaGenome リリース: 遺伝子制御のための DeepMind の 1Mb コンテキスト AI
- Aisha Washington

- 6月6日
- 読了時間: 9分
更新日:6月17日

2026年1月28日、Google DeepMindはAlphaGenomeを発表しました。これは、DNA配列が遺伝子発現をどのように制御するかを予測するように設計された新しいAIシステムです。最近見られた純粋なDNA言語モデルとは異なり、このツールは配列から機能へのマッピングに特化しています。100万塩基対(1Mb)のコンテキストウィンドウという重要な技術的見出しとともに登場し、以前のツールでは達成が困難だった範囲と解像度でゲノムを分析できるようになります。
研究者やバイオインフォマティシャンにとって、AlphaGenomeの登場はゲノム深層学習モデルの状況を一変させます。これは、次のヌクレオチドの予測を超えて、RNA-seqやATAC-seqのような実際の生物学的読み出しを予測することに移行します。この区別は重要です。なぜなら、タンパク質をコードしないがそれらを調節するDNAの98%である「ダークゲノム」を解釈しようとしている研究室の実用的なニーズに応えるからです。
コミュニティの評価:AlphaGenome vs Evo 2

Natureのドキュメントで説明されているアーキテクチャについて説明する前に、 paper, bioinformatics コミュニティがこのリリースに実際にどのように反応しているかを見る価値があります。Reddit のようなプラットフォームで注目を集めている主な比較対象は、Arc Institute が開発した AlphaGenome と Evo 2 です。
初期のユーザーディスカッションから浮かび上がっているコンセンサスは、両方のモデルが DNA を取り込む一方で、根本的に異なる問題を解決しているということです。Evo 2 は DNA 言語モデル (DNALM) として機能し、シーケンスの次のトークンを予測するようにトレーニングされています。AlphaGenome はシーケンス・トゥ・ファンクション モデルです。シーケンスを受け取り、実験結果を予測します。
計算生物学コミュニティからのユーザーエクスペリエンスレポートは、既存のDNALMに対する特定の不満を浮き彫りにしています。複数のユーザーが、Evo 2は理論的には印象的であるものの、実際のワークフローでは「使用が面倒」であると指摘しました。Evo 2の論文からの結果の再現は、独立した研究室にとって困難であることが判明しており、標準的なゲノム予測タスクでのパフォーマンスは、一貫して最先端レベルに達していません。
AlphaGenomeは、理論的なブレークスルーというよりも、大規模なエンジニアリングの成果として受け止められています。DeepMindは効果的に「マクロ対ミクロ」の問題を解決しました。以前は、モデルは広範なコンテキスト(数百万塩基)を見るか、高解像度(単一塩基)を見るかの選択を迫られていました。AlphaGenomeは両方を管理します。これは、以前のDeepMindプロジェクトで見られた堅牢なエンジニアリングフレームワークを統合し、より安定した、ただしオープン性は低いものの、即時の研究アプリケーションのためのツールを提供します。
AlphaGenomeにおける1Mbコンテキストウィンドウの分析

の技術的な中核は、単一塩基解像度で1Mbのコンテキストウィンドウを処理する能力です。AlphaGenomeこれは、約50万塩基のコンテキストで動作していたBorzoiのようなモデルからの大幅な進歩です。
この拡張されたウィンドウは、単なる見栄えだけの指標ではありません。遺伝子調節は長距離の事柄です。エンハンサー—転写の可能性を高めるDNAの短い領域—は、それが調節する遺伝子から数十万塩基対離れた場所に位置することができます。モデルのウィンドウが狭すぎると、リモートの変異と遺伝子の機能不全との間のつながりを「見る」ことができません。
コンテキストウィンドウを倍増させることにより、AlphaGenomeはこれらの長距離相互作用を捉えます。リリースデータによると、このモデルは同時に以下を予測できます。
5,930のヒト遺伝信号
1,128のマウス遺伝子シグナル。
遺伝子発現、スプライシング、クロマチンプロファイル、染色体接触マップなどのアウトカム。
26の標準タスクとのベンチマーキングにおいて、AlphaGenomeは現在の最先端モデルに25のカテゴリーで匹敵またはそれを上回りました。これは、アーキテクチャがトレーニングデータへの過剰適合だけでなく、真の生物学的シグナルを捉えていることを示唆しています。
非コードDNA解析のためのAlphaGenome
主な用途はAlphaGenomeremioは、DNAの非コード領域の解読にあります。ヒトゲノムの約2%しかタンパク質をコードしないため、疾患関連変異の大部分は非コード領域にあります。これらの領域は細胞のオペレーティングシステムとして機能し、遺伝子がいつ、どこでオンになるかを決定します。
この「ダークゲノム」の理解は、臨床遺伝学における難関でした。コーディング領域の変異は、しばしば解釈が容易です(例:タンパク質を破壊する)。非コーディング領域の変異は、解読困難です。何も起こさないかもしれませんが、重要な調節スイッチを無効にする可能性があります。
AlphaGenomeは、これらの単一バリアントの効果を予測する方法を提供します。モデルに参照配列と変異配列を入力することで、研究者はRNA-seqまたはATAC-seqシグナルにおける予測される違いを確認できます。このバリアント効果予測機能こそが、このモデルを生物学的な好奇心から、希少疾患やがんにおける病原性変異を特定するための潜在的なツールへと変えるものです。
AlphaGenome APIアクセスとオープンソースの状況を評価する

DeepMind の AlphaGenome の配布戦略は、AlphaFold 3 で確立されたパターンに従っており、オープンサイエンスに関する議論を巻き起こしています。
モデルアーキテクチャのコードは、JAX 実装 (google-deepmind/alphagenome) を介して GitHub で公開されています。しかし、モデルの重み(トレーニング中に学習された大規模な数値パラメータ)は完全にオープンソースではありません。代わりに、非商用研究用途の API 経由でアクセスが制限されています。
このアプローチは、特定のユーザー要件を生み出します。研究者は入力を定義して予測を取得できますが、重みなしではローカルクラスターで完全なモデルを実行することはできません。コミュニティの反応は賛否両論です。API は、大規模なコンピューティングリソースを持たないユーザーにアクセスを提供しますが、モデルを変更する必要があるパワーユーザーや、ローカルサーバーから離れることができない高スループットのプライバシー重視のスクリーニングを実行する必要があるユーザーを不満にさせています。
AlphaFold 2 の初期の頃のような「重み利用可能」リリースへの強い需要があります。現在のセットアップは、AlphaFold Server モデルを模倣しています。これは学術界にとっては強力で無料ですが、最終的には基盤となるパラメータに関して「ブラックボックス」です。
AlphaGenomeが依然として苦戦している点
高いベンチマークスコアにもかかわらず、AlphaGenomeは遺伝学における万能ソルバーではありません。 Natureに掲載された論文およびその後の専門家のコメントは、明確な限界を指摘しています。
この分野のリーダーであるAnshul Kundajeの研究室は、このモデルはBorzoiよりも改善されているものの、細胞種特異的な調節には依然として苦戦していると指摘しました。遺伝子が一般的にどのように振る舞うかを予測することと、肝細胞とニューロンでそれぞれどのように振る舞うかを予測することは異なります。AlphaGenomeはこの点を改善していますが、個人間の個々の遺伝子発現のばらつきを完全に捉えることは依然として困難です。
さらに、このモデルは厳密には研究ツールです。臨床現場での使用にはまだ準備ができていません。予測スコアは、特定の遺伝子変化のリスクを誇張することがあり、ウェットラボでの検証なしに患者の診断に使用された場合、偽陽性を引き起こす可能性があります。
遺伝子調節を予測するための技術的要件
統合を検討している方へAlphaGenomeワークフローに組み込むには、入出力要件を理解することが不可欠です。
このモデルはENCODEコンソーシアムからのデータに大きく依存しています。単に文字を読むだけでなく、特定の実験結果にマッピングします。AlphaGenomeの予測を検証するための実験を設計する場合、同じメトリクスを確認する必要があります。
RNA-seq:遺伝子発現レベルについて。
ATAC-seq:クロマチンアクセシビリティ(DNAが密に巻き付いているか、開いているか)について。
Hi-C:3Dゲノム構造とコンタクトマップについて。
このモデルはこれらの特定の実験モードを予測するため、「仮想アッセイ」として機能します。数千もの変異をin silicoでシミュレーションして、クロマチンアクセシビリティを変化させるものを確認し、実際の試薬にお金をかける前に候補を絞り込むことができます。
ゲノム深層学習モデルの未来

AlphaGenomeは、ゲノムAIの統合フェーズを表しています。「AIはDNAを読めるのか?」という初期の興奮から、「AIは実験を確実に予測できるのか?」というエンジニアリングの現実に移行しています。
1Mbウィンドウで単一塩基解像度への移行は、新たな基準を設定します。将来のモデルは、関連性を維持するためにこのスコープに合わせる必要があるでしょう。シーケンスから機能へのモデル(AlphaGenomeなど)と生成言語モデル(Evo 2など)との競争が、来年の研究を定義するでしょう。
現時点では、AlphaGenomeは特定の検証可能な予測において優位性を保っています。これは、新しいシーケンスを考案するために設計された生成モデルではなく、特定の変異に関する特定の答えを必要とする生物学者のためのツールです。APIの利用が広がるにつれて、コミュニティがクローズドウェイトシステムの制限を乗り越えることができれば、疾患の非コードドライバーをスクリーニングするためにそれを利用する論文が急増する可能性があります。
FAQ
AlphaGenomeとEvo 2の違いは何ですか?
AlphaGenomeは、遺伝子発現のような生物学的アッセイの結果を予測するシーケンスから機能へのモデルです。Evo 2は、次のDNAシーケンストークンを予測するように設計されたDNA言語モデル(DNALM)です。これらは異なるアーキテクチャと意図された用途を持ち、AlphaGenomeは予測ベンチマークにより特化しています。
AlphaGenomeに私の研究のためにアクセスするにはどうすればよいですか?
AlphaGenomeには、非営利研究用に提供されているGoogle DeepMind APIを通じてアクセスできます。JAXコードはGitHubで入手可能ですが、モデルの重みはローカル実行のために完全にオープンソースではありません。
AlphaGenomeは非コードDNAでも機能しますか?
はい、非コードDNAの解析がその主な強みです。タンパク質をコードしないゲノムの98%における変異が、遺伝子調節、クロマチン構造、およびスプライシングにどのように影響するかを予測できます。
AlphaGenomeのコンテキストウィンドウはどのくらいですか?
AlphaGenomeは100万塩基対(1Mb)のコンテキストウィンドウを備えています。これにより、染色体上で離れた場所にある遺伝子と調節要素間の長距離相互作用を特定できます。
AlphaGenomeは臨床用途に対応していますか?
いいえ。ベンチマークでは良好なパフォーマンスを発揮しますが、現在のところ研究ツールです。特定の遺伝子変異の重症度に関してエラーを生成する可能性があるため、医学的診断や患者ケアには使用しないでください。


