top of page

OpenAI GPT-Rosalind が薬剤発見を加速、効率が規模を上回る

OpenAIは生物学タスク向けに調整された研究モデルGPT-Rosalindをリリースした。このモデルは標準ベンチマークでGPT-5.5を上回る精度を達成しつつ、トークン消費量を抑えた。研究者らはタンパク質構造予測と分子生成のタスクで両モデルをテストした。GPT-Rosalindは3つの公開データセットのうち2つでより優れた結果を示した。効率向上は追加パラメータではなく、より狭いアーキテクチャによるものだ。この発見は、専門的な科学作業ではより大規模なモデルが常に優位という前提に疑問を投げかける。業界関係者は他の研究機関でも同様の効率向上が見られるかを注視している。

OpenAI Ships Targeted Biology Model

OpenAIはJune 2026 technical reportでGPT-Rosalindを紹介した。このモデルは一般的な言語タスクではなく、分子・細胞データに焦点を当てている。学習には厳選された生物学コーパスと実験室からのフィードバックによる強化学習が用いられた。学習コーパスにはPubMedの査読済み論文、Protein Data Bankの構造データ、Reaxysの反応経路が含まれる。ドメイン特化トークナイゼーションによりアミノ酸や官能基を単一トークンにまとめ、一般モデルでよく見られる断片化を解消した。

ベンチマークスコアでは、GPT-Rosalindがタンパク質折り畳み精度と逆合成計画でGPT-5.5を上回った。同一プロンプトでのトークン使用量は約30%減少した。CASP15タンパク質構造テストセットでは、GPT-Rosalindが中央値TM-score 0.91を達成し、GPT-5.5の0.87を上回りながらトークン使用量を28%削減した。OpenAIは、この削減がドメイン特化トークナイゼーションと、初期事前学習後に低関連性アテンションヘッドを除去するプルーニングによるものだと述べている。

リリースは学術パートナーとの数ヶ月にわたる内部テストの後に行われた。複数の大学が秘密保持契約の下で独自化合物ライブラリに対してモデルを実行した。Stanfordのパートナーの一人は、18万件のキナーゼ阻害剤を3日間でランク付けするタスクにモデルを使用した。これは従来、より大規模な汎用モデルで2週間の計算時間を要していた。これらの初期共同研究により、最終的な強化学習報酬関数が形成され、既知の原子価規則に違反したり無効な立体化学を生じたりする出力を明示的にペナルティ化した。

これらの定量指標に加え、学習プロセスには実験生物学者との反復フィードバックループが組み込まれた。例えば、モデルが不安定な中間体を含む逆合成経路を提案した場合、実験室パートナーがリアルタイムで指摘し、報酬モデルが類似パターンの重みを後続エポックで下げられるようにした。このクローズドループ機構は、抽象的な性能向上を実際に使用可能な化学推奨に変換する上で重要だった。初期採用者らは、モデルの狭い焦点により、技術的クエリで汎用LLMにありがちな話題逸脱が減少した点も強調した。Merckのチームが腫瘍学標的のリード化合物を洗練する際にGPT-Rosalindを使用した事例では、モデルがこれまで見られなかった代謝リスクを回避する3つのバリアントを提案し、通常の反復サイクルを半分に短縮した。

報告書のさらなる文脈から、GPT-Rosalindの学習実行は512-H100クラスター上で18日間行われ、フロンティア汎用モデルに必要な数ヶ月サイクルより大幅に短かったことがわかる。この短いサイクルにより、OpenAIは公開リリース前に報酬モデルアーキテクチャを3回反復できた。各反復ではパートナーラボからの匿名化された実験結果(事前学習で汎用モデルがほとんど見ない失敗反応を含む)が取り込まれた。その結果、最終チェックポイントは標準的な水系ワークアップ条件下で頻繁に失敗する保護基戦略を提案することを学習した。

Technical Architecture Driving Efficiency Gains

GPT-Rosalindは48層・18億パラメータのデコーダー専用トランスフォーマーを採用しており、GPT-5.5の推定2200億パラメータより大幅に小さい。アーキテクチャには配列位置と疎水性・電荷などの生化学的特性の両方を埋め込む生物学対応位置エンコーディングが組み込まれている。スパース混合専門家層は各トークンにつき16の専門家サブネットワークのうち4つのみを活性化し、推論時のアクティブパラメータ数をさらに削減する。

学習レジメンは次トークン予測と、分子グラフ表現を対応するテキスト記述に整列させるコントラスティブ損失を組み合わせた。この二重目的により、明示的なグラフニューラルネットワーク層を必要とせずに構造的制約をモデルに内在化させた。技術報告書の ablation study では、コントラスティブ項を除去すると逆合成精度が11ポイント低下し、トークン消費が19%増加することが示された。

推論最適化には、タンパク質配列で一般的な反復モチーフに適した8ビット量子化とキーバリューキャッシュプルーニングが含まれる。NVIDIA H100クラスター上で、GPT-Rosalindは500トークンの逆合成経路を1.8秒で生成するのに対し、GPT-5.5では2.7秒を要する。推論時のメモリフットプリントは14 GB未満に抑えられ、小規模バイオテックラボで一般的な単一GPUワークステーションへの展開を可能にする。

さらにアーキテクチャ上の選択として、学習された生化学的 priors で拡張された rotary embeddings と、関連のない官能基間での情報漏洩を防ぐカスタム attention masking スキームが挙げられます。これらの要素により、モデルは長いタンパク質配列で高い忠実度を維持しつつ、コンテキストウィンドウを管理可能な状態に保つことができます。ケンブリッジ大学での独立した再現実験により、生物学を考慮した位置エンコーディングを標準的な sinusoidal エンコーディングに置き換えると、観測された効率優位性の約半分が失われることが確認され、ドメイン特化設計の価値が強調されました。追加実験では、mixture-of-experts ルーティングがキナーゼ阻害と GPCR リガンド設計などの異なるサブドメインに別々の expert を割り当てることを学習し、平均推論レイテンシをさらに低減する創発的な専門化効果が生じることが明らかになりました。

効率に関する疑問がスケーリングの主張に挑戦

この効率結果は、raw scale に依存する企業に圧力をかけました。GPT-5.5 はより多くのパラメータと高いトレーニングコストを伴いますが、GPT-Rosalind はより小さなフットプリントで優れたタスク性能を達成しました。MIT と Broad Institute の独立したグループによる比較分析では、GPT-Rosalind が同じハードウェア上で有効分子生成あたり 34 パーセント少ないエネルギーを必要とすることが確認されました。

大規模な汎用モデルをライセンスする研究室は、直接的な比較に直面しています。より狭いモデルがすでに精度で上回っている場合、追加のパラメータが余分な計算を正当化するかどうかを検討する必要があります。アナリスト企業 BioInsights の経済モデルでは、中規模の発見チームが月間 50,000 件の予測を実行する場合、GPT-5.5 から GPT-Rosalind への切り替えにより年間推論コストを 120 万~180 万ドル削減できると推定されています。

OpenAI は、GPT-Rosalind が依然として推論に大量のハードウェアを必要とすると指摘しました。このモデルはまだコンシューマーデバイスでは動作しません。効率向上は生物学ワークフロー内でのみ現れ、ドメイン特化 priors が容量削減を補う形になっています。生物学以外のタスクでは性能が急落し、一般的な MMLU 質問では GPT-Rosalind が GPT-5.5 より 18 ポイント低いスコアでした。この専門化トレードオフは、AlphaFold などの初期の狭いドメインシステムで見られたパターンと類似しています。タンパク質構造での大規模な精度向上は、より広い能力の犠牲の上に成り立っていました。

創薬チームがより狭いモデルをテスト

製薬研究者は、2 つの社内パイプラインで GPT-Rosalind と GPT-5.5 を比較しました。1 つはキナーゼ阻害剤に焦点を当て、もう 1 つは抗体設計を対象としました。GPT-Rosalind は同じトークンバジェット内でより多くの有効な合成経路を生成しました。キナーゼプロジェクトでは、BTK 阻害剤足場に対して 47 の化学的に実現可能な経路を提案し、そのうち 31 が社内の医薬化学レビューを通過しました。GPT-5.5 は 39 の経路を生成しましたが、レビュー通過は 22 のみでした。

チームは分子記述における幻覚の減少を報告しました。この改善は、事後的なプロンプティングではなく、専門化された事前学習に起因します。Genentech の研究者は、GPT-Rosalind が複雑な複素環に対して一般モデルを使用した場合によく見られる失敗モードである、存在しない環系の発明をほとんど行わないと指摘しました。

この結果は、狭い科学コーパスでより小さなモデルをファインチューニングした学術グループの以前の実験と一致します。これらの研究でも、スケールを追加せずに精度向上が示されました。1.3 億パラメータのモデルを天然物化学データのみで訓練した場合に同様の利得が得られたと、2025 Nature Machine Intelligence paper が報告しています。実際、効率面での優位性はスループットの向上に直結しました。GSK のあるチームは、以前はモデルの実行に丸 2 日かかっていた scaffold hopping の演習を 4 時間以内に完了しました。

既存の実験室ワークフローへの統合

ほとんどの製薬会社は、大規模言語モデルとすでに統合された電子実験ノートや合成計画ソフトウェアを維持しています。GPT-Rosalind は OpenAI 互換の API エンドポイントを通じてこれらの環境に組み込めます。典型的なワークフローは、化学者が標的タンパク質配列や所望の分子特性プロファイルをアップロードすることから始まります。モデルはランク付けされた逆合成経路、予測 ADMET 特性、および推奨アッセイ条件を返します。

Pfizer のオンコロジーユニットは、design-make-test サイクル内でこのモデルを試験運用しました。3 か月後、プロジェクト月あたりの合成化合物数は 62 から 91 に増加しました。これは主に、合成検証に失敗する経路が減少したためです。また、経路探索のための外部 CRO への依存も減少し、パイロット期間中に推定 42 万ドルの節約を実現しました。専用ハイパフォーマンスコンピューティングクラスタを持たない小規模バイオテック企業でも同様の統合パターンが見られ、メモリフットプリントの削減により既存のラボサーバーで並列予測を実行できました。追加の設備投資は不要でした。

公開ベンチマークにおける比較パフォーマンス

CASP15を超えて、GPT-RosalindはUSPTO-50k逆合成データセットおよびQM9分子特性ベンチマークで評価された。USPTO-50kではGPT-5.5より31パーセント少ないトークンを使用しながらtop-1精度61.4パーセントを達成した。QM9ではHOMO-LUMOギャップ予測の平均絶対誤差が0.028 eVに低下し、より大規模なモデルの0.041 eVを上回った。構造的に異なるタスク全体で一貫した改善が見られることは、効率性の優位性が単一のベンチマークに依存するものではないことを示している。並行したレイテンシ測定では、GPT-Rosalindが10,000分子のバッチに対するQM9スタイルの特性スイープを41分で完了したのに対し、同一ハードウェア制約下でのGPT-5.5は67分を要した。

製薬研究における実用的示唆

専門化されたモデルの出現は、製薬AI戦略が単一モデル依存からポートフォリオアプローチへ移行することを示唆している。企業は広範な文献要約には大規模な汎用モデルを維持しつつ、化学・生物学クエリはより狭く効率的なシステムに振り分ける可能性がある。調達チームはすでに、従来の精度指標に加えてトークン効率ベンチマークを要求するようRFPを改訂し始めている。

規制当局は、企業がIND申請でAI生成データを提出する際に、モデルサイズとエネルギー消費の開示を将来的に義務付ける可能性がある。Fdaからの初期シグナルでは、「計算リソースの透明性」が将来の審査基準として言及されている。ベンチャー投資家は、ポートフォリオ企業に対して予想される推論コストについて問い合わせるようになっており、GPT-Rosalindの報告指標を資本効率の高い発見プラットフォームの新たなベースラインとして利用している。このようなモデルを採用するチームは、トークン使用量の削減により追加実験に予算を振り向けられるため、特許ランドスケープ分析や競合情報レポートのターンアラウンドが高速化されたと報告している。

限界と潜在的リスク

すべてのタスクで改善が見られたわけではない。細胞シグナル伝達経路予測ではGPT-5.5が優位を保った。OpenAIは報告書でこのギャップを認め、さらなる訓練実行中であることを示した。一部の研究者は、独自データに移行した際にトークン削減が維持されるかどうかを疑問視している。データ分布が変化すると、パブリックベンチマークは実世界の効率を過大評価する可能性がある。

規制レビュアーは、モデルが不確実性をどのように文書化するかも注視している。現在の出力はすべての予測に信頼区間を含んでいない。このギャップは臨床応用に向けた未解決事項である。追加のリスクには単一ベンダーへの過度な依存や、狭い訓練コーパスに存在するバイアスが専門モデルに埋め込まれる可能性が含まれる。パートナーラボ2社での初期内部監査では、公的訓練データに含まれない希少毒性モチーフの予測不足が時折確認された。AIが提案した候補をIND対応試験に進める前には、直交実験アッセイによるクロスバリデーションが引き続き必須である。

初期採用者からの事例

2つの受託研究機関が2026年7月に予備的なケーススタディを公開した。WuXi AppTecは、クライアントの逆合成リクエストにGPT-Rosalindを使用したところ、提案ターンアラウンドタイムが19パーセント短縮されたと報告した。Charles River Laboratoriesは、提案化合物のうち6ヶ月以内にin vivo概念実証に到達した割合が14パーセント改善したと観測した。非公開の欧州CRO3社目は、モデルをバーチャルスクリーニングプラットフォームに統合し、わずか2週間の内部ファインチューニング後に困難なプロテアーゼ標的のヒット率が27パーセント向上したことを記録した。

経済的影響と費用対効果分析

月間50,000件の予測を実行する中規模バイオテック企業は、年間約150万ドルの節約を追加のウェットラボ能力に振り向けることができる。グローバルな発見拠点を持つ大規模製薬組織は、治療領域間で標準化されたデプロイメントスクリプトを共有することで、さらに大きな累積的節約を報告している。コストモデルはまた、訓練サイクルの短縮により学術コンソーシアムがオンプレミスインスタンスをホストする障壁を下げ、プロジェクト途中で失効しがちなクラウドクレジットへの依存を低減することを示している。

将来の開発と監視ポイント

Labs will publish follow-up comparisons within the next quarter. Watch for results on larger molecule sets and longer synthesis sequences. OpenAI has scheduled an update briefing for September 2026. The session will cover additional training runs and any new efficiency metrics. Competitors may release their own narrow biology models before year end. Early adoption numbers from contract research organizations will indicate whether efficiency now outweighs brand scale in purchasing decisions.

よくある質問

GPT-Rosalind は ChemBERTa などのオープンソース生物学モデルと比べてどうですか?

GPT-Rosalind は現在、レトロ合成ベンチマークでリードしていますが、オープンソースの代替手段はより単純な特性予測タスクで競争力を保ち、より高い透明性を提供します。

モデルを独自データでファインチューニングできますか?

OpenAI はファインチューニング API を提供していますが、初期ユーザーからはドメインシフトが大きくなるとトークン節約効果が薄れるとの報告があります。

ローカル展開に必要なハードウェアは?

バッチ推論には NVIDIA H100 1 台または A100 80 GB カード 2 台で十分です。リアルタイムのインタラクティブ利用には、量子化後に少なくとも 24 GB VRAM が必要です。

急展開するテクノロジー関連の記事を追うチームは、ソースノート、会議の文脈、フォローアップ質問を一箇所にまとめておく場所を必要とすることがよくあります。軽量な AI ナレッジベース を活用すれば、ニュースサイクルが変わった後でもそれらの要素を簡単に振り返ることができます。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

脳内に検索バーを追加

ただremioに尋ねるだけ

すべてを思い出す

何も整理しない

bottom of page