HHSのAI臨床試験構想、固定フェーズを適応的エビデンスに置き換える狙い
HHSは、従来の医薬品試験に組み込まれた固定的なフェーズ、重複したインフラ、意思決定の遅れに挑む5年間のプログラムを開始した。HHSのAI臨床試験イニシアチブは、予測モデル、継続的な分析、自動化された運用を一つの研究枠組みに統合する。
中核となるのはSURPASSで、正式名称はSimulation-augmented, Real-time Platform Adaptive Seamless Trialsである。保健高等研究計画局(ARPA-H)が、試験実施施設、医療データ、患者ナビゲーションを対象とする3つの支援プロジェクトとともにこのプログラムを運営する。
直近の期待はスピードにある。より難しい課題は、適応型ソフトウェアが、置き換えようとするプロセスと同等に信頼できるエビデンスを生み出せることを示す点だ。この対立は、規制当局、医薬品スポンサー、臨床試験実施機関、試験施設、統計チームに同時に圧力をかけている。
HHSのAI臨床試験、固定フェーズの先へ
SURPASSは、既存の試験にAIアシスタントを追加するだけのものではない。臨床エビデンスを生み出すための異なる運用モデルを提案している。
HHSは2026年9月30日にSURPASSを発表した。同省の臨床試験プログラムによると、このイニシアチブは予測的な計算モデル、共有インフラ、共通対照群、リアルタイム分析を組み合わせる。
プログラムは5年間の運用を予定している。統計、AI、試験設計、運用、規制にまたがるチームから、秋の後半に提案募集を始める見込みだ。
HHSは当初の発表でプログラムの予算を明らかにしなかった。また、参加者の成功時にどのような規制上の柔軟性が与えられるのかも説明していない。最初のSURPASS報道によると、これは未公表のままである。
こうした欠落は重要だ。SURPASSは単なる事務作業の自動化を超えるためである。3つの技術領域は、試験設計、統計的推論、運用を対象としている。
第1の領域は、フェーズレスの設計エンジンである。デジタルツインなどの予測モデルを利用し、試験開始前に起こり得る臨床上および運用上の結果をシミュレーションする。デジタルツインとは、起こり得る結果を探るために使われる、患者またはプロセスの計算上の表現を指す。
「フェーズレス」という言葉は、臨床試験から安全性のゲートをなくすことを意味しない。従来は分離されていた試験フェーズ間の硬直した引き継ぎを減らし得る、より連続的な構造を表している。
第2の領域は、継続的推論エンジンである。繰り返しのレビュー中も妥当性を維持するよう設計された統計ルールにより、蓄積されるデータを分析する。これにより研究者は、固定された一つの解析日を待たずに、治療群の追加、中止、調整を行える可能性がある。
第3の領域は、エージェント型の運用レイヤーである。この文脈でのエージェントとは、限定的な人間の指示のもとで、定義された一連の運用タスクを完了できるソフトウェアをいう。HHSは、試験の立ち上げ、データクレンジング、治療群の受け入れ、データセットの構築を、こうしたシステムで支援したい考えだ。
したがってSURPASSは、単一の新モデルに依存するのではなく、複数の確立された考え方を組み合わせる。適応的試験はすでに、蓄積するエビデンスに基づく事前規定の変更を認めている。プラットフォーム試験では、共有プロトコルの下で複数の治療法を検証できる。計算モデルもすでに、一部の医薬品開発の意思決定に活用されている。
提案されている変更は、こうした要素を一つの持続的なシステムに組み込むことだ。そのシステムは、設計、患者募集、分析、報告をほぼ別個の段階として扱うのではなく、試験の進行中に学習する。
HHSによれば、医薬品と生物学的製剤の開発にはしばしば10年以上を要し、平均で最大20億ドルの費用がかかり、90%超が失敗に終わる。これらの数値は同機関の発表によるものであり、プログラムの根拠として示されたものと理解すべきだ。
有用な問いは、現行プロセスが遅いかどうかではない。この点に異論を唱える参加者はほとんどいない。問うべきなのは、継続的なプラットフォームが、監査しにくいモデルへ不確実性を移すことなく遅延を取り除けるかどうかである。
この違いが、本記事の中心的な緊張関係を生む。運用の迅速化には価値があるが、試験が方向転換した後も、臨床エビデンスは解釈可能でなければならない。
4つのプロジェクト、4つの異なるボトルネックに挑む
HHSは、試験の遅れを、より優れたアルゴリズムの不足だけではなく、設計、施設、データ、患者に関わるシステム上の問題として捉えている。
SURPASSは試験設計と実行を対象とする。これを補完する3つのARPA-Hプロジェクトは、適応的試験が全国規模で機能するかを左右する条件に取り組む。
STACKは臨床試験施設の能力を対象とする。HHSによると、このプロジェクトはAIを使って施設の立ち上げを加速し、研究経験のない医療施設が試験を実施可能な拠点となることを支援する。
施設の立ち上げには、契約、スタッフの準備、技術環境の整備、規制審査、スポンサーの適格性確認が含まれる。参加する病院が患者登録を始めるまでに数カ月かかるなら、統計設計を高速化しても得られるメリットは小さい。
STACKには地理的な意義もある。適格な施設が増えれば、患者は主要な学術医療センターへ何度も移動する代わりに、自宅近くで試験に参加できるようになる可能性がある。
この拡大には実務上の検証が必要となる。新しい施設は一貫したデータを収集し、参加者を保護し、複雑なプロトコルに従わなければならない。書類業務の自動化は、経験豊富な治験責任医師、訓練を受けたコーディネーター、信頼できる臨床システムの代替にはならない。
COMMONSはデータインフラを扱う。HHSはこれを、同意取得と規制水準のデータアクセスのための、プライバシーを設計段階から組み込んだシステムと説明している。
規制水準のデータは、追跡可能で、統制され、治療の安全性と有効性に関する判断に適したものでなければならない。通常のデータ集約が自動的にこの基準を満たすわけではない。
COMMONSは、登録、予測モデリング、試験運用に必要な情報を接続することを意図している。うまく実装されれば、繰り返されるデータ要求を減らし、適格な患者を見つけやすくできる可能性がある。
一方で、このイニシアチブにおける最大級の実装課題の一つも露呈し得る。病院と研究ネットワークは、異なる形式、異なるガバナンス規則、ばらつきのあるデータ品質の下で情報を保管している。
同意も別の課題となる。情報提供に対する患者の許可は、データが組織間を移動したり、新たな計算分析を支えたりする場合にも、理解可能であり続けなければならない。
CINCHは患者側に焦点を当てる。このプロジェクトは、人々がリアルワールドデータを提供し、ケアを調整し、自身の状況に合う試験を見つけることを支援する狙いだ。
リアルワールドデータは、厳格に管理された試験来院ではなく、日常診療や日常生活から得られる。電子健康記録、保険請求データ、検査結果、レジストリ、接続デバイスで収集される情報などが含まれ得る。
こうした情報源は、治療効果をより広く捉えることを可能にする。一方で、欠損情報、不整合な測定、医療アクセスの不平等によって生じるパターンも含み得る。
そのためCINCHは、患者記録内のキーワードを照合するだけでは不十分だ。有用なナビゲーションシステムは、なぜある試験が関連性を持つと判断されたのかを説明し、適格性の判断に臨床医を関与させ続けなければならない。
SURPASS、STACK、COMMONS、CINCHは一体となって、階層的なプログラムを構成する。SURPASSは試験を再設計する。STACKは実施可能な場所を広げる。COMMONSは統制された情報を提供する。CINCHは患者をシステムにつなぐ。
この構造は、今回の発表をより狭義の臨床AIプロジェクトと区別する。HHSは、一つの予測モデルが成功する薬を選び出すとは約束していない。繰り返しエビデンスを生み出すための共通基盤を構築しようとしている。
この広範な野心は、実行リスクも高める。4つのプロジェクトは相互に依存しているが、関与する組織、技術標準、法的義務はそれぞれ異なる。
どのレイヤーの失敗も、他のレイヤーを制約し得る。より良いマッチングでも、利用できない施設は補えない。より迅速な施設でも、使えないデータを補うことはできない。強力なモデルでも、不十分なガバナンスのプロトコルを救うことはできない。
真の争点はスピードと検証可能なエビデンスの間にある
主な対立はAIと人間の研究者の間ではない。継続的な適応という約束と、安定して再現可能な結論を求める必要性の間にある。
従来のフェーズ境界は遅延を生むが、責任の所在も整理する。スポンサーは、次の段階に進む前にどのエビデンスが必要かを把握できる。審査者は、いつプロトコルが変更され、どのデータセットが意思決定を支えたかを特定できる。
継続的なプラットフォームは、こうした馴染み深い境界を弱める。これにより重複作業をなくせる可能性はあるが、統計計画と監査可能性の重要性は高まる。
適応型プラットフォーム試験は、このトレードオフを示している。単一のマスタープロトコルの下で複数の介入を検証し、効果のない群を除外し、新たな候補を追加し、対照群を共有できる。
COVID-19パンデミックの間、従来型プログラムがスピード面で苦戦するなか、プラットフォーム試験は重要な治療エビデンスを生み出した。その成功は、適応可能なインフラが緊急の問いに効率よく答えられることを示した。
ただし、適応は、研究者が選択に影響し得る結果を見る前に規定されていなければならない。計画外の変更はバイアスを生み、偽陽性のリスクを高め、治療効果を解釈しにくくする可能性がある。
主要なプラットフォーム試験レビューは、こうした研究に必要な設計、実施、監督、報告の要件を説明している。その中心的な教訓は、柔軟性には、より少ない計画ではなく、より多くの計画が必要だということだ。
共有対照群にも同様の規律が必要である。共通対照群は、標準治療に割り当てられる参加者数を減らし、複数の比較における効率を高められる。
新しい治療群を、はるか以前に登録された患者と比較する場合に問題が生じる。医療慣行、疾患パターン、診断方法、患者特性は時間とともに変化し得る。
研究者は、こうした先行参加者を非同時対照群と呼ぶ。これらを使うと統計的検出力を高められる可能性があるが、時間に関連するバイアスを導入するおそれもある。
SURPASSは、繰り返しの分析と適応に対処するため、常に有効な推論エンジンを提案している。HHSはまだ、このエンジンの統計仕様、検証ベンチマーク、規制上の受容基準を公表していない。
同じエビデンス上の負担はデジタルツインにも当てはまる。モデルは登録前に起こり得る結果をシミュレーションでき、チームが仮定を検証したり、弱いプロトコル上の選択を特定したりする助けになる。
シミュレーションはあくまで推定である。その結果には、訓練データで表現された患者、変数、関係性が反映される。
デジタルツインが高齢者、地方の患者、妊娠中の人、複数の疾患を持つ患者を十分に代表していなければ、結果として得られる試験は、不完全な集団を中心に効率化される可能性がある。
したがって検証では、平均的な予測精度以上のものを調べる必要がある。スポンサーと規制当局は、モデルがどこで失敗するのか、不確実性がどのように較正されているのか、施設間で性能が変化するかどうかを把握する必要がある。
また、モデル更新のプロセスも必要になる。継続的に改善するモデルは魅力的に聞こえるが、試験中にソフトウェアを変更すると、過去の意思決定を再構築することが複雑になり得る。
重要なすべての推奨は、特定のモデルバージョン、入力データセット、ルール、人間による承認に結び付けられるべきだ。この記録がなければ、スピードは説明責任を弱めかねない。
HHSはすでに、AIを活用した生物医学研究では、再現性、透明性の高い手法、偏りのない審査を重視すべきだと表明している。同省のAI戦略でも、AIによるエビデンスに支えられた規制当局への申請を、測定可能な成果として挙げている。
SURPASSは、こうした原則が実運用プラットフォームでも通用するかを検証する。HHSは、開発されるツール、標準、規制上の事例がより広い研究システムに恩恵をもたらすことを目指しているため、公開文書は特に重要になる。
目標は、すべての試験をアダプティブにすることではない。一部の問いには、安定した従来型のデザインが適している。また、リアルタイムの変更を導くには十分な速さで測定できないアウトカムもある。
長期生存、遅発性の有害作用、緩徐に進行する疾患は、ソフトウェアが受信データをより高速に分析できるからといって即時に把握できるわけではない。
試験デザインは医学的な問いに従う必要がある。そうでなければ、このプログラムはアダプテーションを手法ではなく目的として扱ってしまうおそれがある。
Operation TrialBlazerが競争の賭け金を引き上げる
SURPASSは、中国の臨床研究能力が拡大するなか、とりわけ医薬品開発を米国でより迅速に進めるための、より大きな連邦政府の取り組みの一部である。
HHSは2026年6月、部門横断の臨床研究イニシアチブとしてOperation TrialBlazerを導入した。ARPA-H、FDA、NIH、国立がん研究所、および連邦の医療技術担当者による取り組みを調整する。
このイニシアチブが掲げる政治的な主張は明確だ。HHSは、初期段階の研究が海外へ移転しており、米国はそれに伴う投資、専門知識、医薬品開発活動を失うリスクがあるとしている。
最も目立つ比較対象は中国である。IQVIAのデータによると、中国企業が世界の試験開始件数に占める割合は、2009年の1%から2024年には30%へ増加した。
米国は、大規模な医薬品市場、経験豊富な規制当局、先進的な研究病院、厚いバイオテクノロジー資金調達といった大きな優位性をなお持つ。
しかし、試験のスピードは、企業がどこで製品を試験し、投資家がどこに資本を投じるかに影響する。制度が尊敬を集めていても、科学プログラムの進行が遅ければ機会を逃しかねない。
SURPASSは、試験デザインと運用上の遅延に取り組む。TrialBlazerの他の施策は、規制審査と申請要件に焦点を当てる。
FDAは、初回ヒト投与試験を対象とするExpedited Investigational New Drugパイロットを開始した。選定されたスポンサーは、適格な研究機関と連携し、申請書の構成要素を段階的に提出できる。
段階的な提出により、規制当局はパッケージ全体の完成前に完了したセクションを審査できる。FDAはまた、申請開発と並行して、一定の機関審査および試験実施施設の立ち上げ作業を進めることも望んでいる。
FDAは、開発段階に応じた化学・製造に関する期待をより明確にすれば、企業は6〜12カ月を短縮できるとしている。こうした推定は、定量的な用量選択と後期段階のマスタープロトコルも扱う同庁の開発ロードマップに記載されている。
後期開発についてFDAは、厳密な主要試験1件に確認的エビデンスを組み合わせて承認を裏付けられる条件を明確化した。また、バスケット試験、アンブレラ試験、プラットフォーム試験に関するドラフトガイダンスも改訂している。
これらの方針が重要なのは、ARPA-Hだけでは規制上の受容を生み出せないためだ。SURPASSはツールや実証に資金を提供できるが、得られたエビデンスが医療製品に関する意思決定を支えられるかどうかを決めるのはFDAである。
両機関の関係が採用を左右する。規制当局がその出力を評価できるという明確な証拠がなければ、スポンサーは新しいシステムを中心に試験プログラムを再構築することをためらうだろう。
逆のリスクもある。国内開発を迅速化しようとする政策的な動きが、不確実性を寛大に解釈する圧力を生む可能性がある。
最も強力な防御策は透明な検証である。迅速な審査は、より早期の調整、より明確な要件、重複作業の削減を意味すべきだ。安全性や有効性の基準を弱めることを意味してはならない。
TrialBlazerの連邦イニシアチブは、近代化によって科学的厳密性を維持すべきだと明言している。今後は、その原則を観測可能な形で実装する必要がある。
このため、プログラムの成功は短縮されたタイムラインだけで測るべきではない。HHSは、プロトコル逸脱、代表性、有害事象の検出、再現性、モデル予測と臨床アウトカムの一致も追跡しなければならない。
国内競争力は緊急性を高めるが、エビデンスの問題を解決するものではない。他の規制当局、臨床医、患者が結論を信頼しないなら、試験が速くなっても米国が得るものは少ない。
HHSが次に証明すべきこと
次の節目では、SURPASSが検証済みのツール、規制当局の審査に対応できるエビデンス、より幅広い患者アクセスを同時に生み出せることを示さなければならない。
最初の兆候は、ARPA-Hの公募の構造である。応募者には、スピード、コスト、参加者負担、統計的妥当性、対象集団のカバー範囲について、測定可能な目標が求められる。
主に自動化機能を中心とした公募では、このプログラムの主張は弱まる。強力な公募では、従来のアプローチに対する前向き検証と、明確な失敗基準が求められるだろう。
チームはまた、人口統計学的グループや参加施設をまたいでモデルをどのように監査するかを明らかにすべきだ。誰が試験に参加するか、どの治療を継続するかを決める判断において、集計された精度だけでは不十分である。
二つ目の兆候は規制上の整合性だ。FDAの関与は、革新的な試験デザインへの一般的な支持から、SURPASSの出力を評価する具体的な手法へと進展しなければならない。
スポンサーには、許容可能なデジタルツインの検証、モデル変更、共有対照群、継続的分析、文書化に関するガイダンスが必要だ。また、従来型のデザインが引き続き必要となる場合も把握する必要がある。
公開された事例が役立つだろう。規制当局が審査したプロトコル、シミュレーション計画、分析フレームワークは、資金提供を受けるチーム以外にもプログラムを有用なものにし得る。
大規模な試験が依存する前に明確な基準を生み出せるなら、規制上の整合性はこのイニシアチブを強化する。持続する曖昧さは、ソフトウェアの技術的性能にかかわらず採用を遅らせる。
三つ目の兆候は、STACK、COMMONS、CINCHから得られる運用上のエビデンスである。HHSは、新たな施設がより速く立ち上がるか、代表性のある集団を募集できるか、患者が同意プロセスを理解できるかを報告すべきだ。
施設数の増加だけに自動的な意味はない。施設は参加者を登録し、データ品質を維持し、スタッフを定着させ、患者を保護しなければならない。
COMMONSは、接続された記録の量ではなく、追跡可能な規制グレードのデータが利用できるかによって評価すべきだ。CINCHは、適切なマッチング、登録の完了、患者の理解によって評価すべきである。
こうした指標によって、HHSのAI臨床試験がアクセスを広げているのか、それともすでに参加の設備を備えた機関での作業を単に加速しているだけなのかが明らかになる。
プログラムは否定的な結果も公開すべきだ。ある疾患領域で性能の低いデジタルツインであっても、そのアプローチが適さない領域に関する貴重なエビデンスを提供できる。
その透明性は、科学的インフラと技術調達キャンペーンを区別する助けとなる。また、HHSが作成したいとしている再利用可能な標準も支えることになる。
臨床チームにとって、短期的な課題は準備である。参加を検討する組織は、データの来歴、モデルガバナンス、同意文言、意思決定ログを今から整理すべきだ。
統計学者、臨床医、データエンジニア、規制専門家、施設運営者の知見は、試験全体を通じて連携を維持しなければならない。チームは、これらのグループにまたがる前提、意思決定、モデル文書を保持するために、検索可能なナレッジベースを利用できる。
このイニシアチブの最も重要な成果は、AIが試験を速くしたという主張ではない。研究者が不要な負担を減らし、厳密性を見えない形で損なうことなく、信頼できる答えにより早く到達したというエビデンスである。
HHSは目標を定めた。ARPA-Hはいま、その手法を示さなければならない。FDAはエビデンスへの道筋を明確にし、資金提供を受けるチームは外部の人々が再現できる結果を公表しなければならない。最初のSURPASSプロジェクトは、スピードを宣伝するのと同じくらい明確に、その検証ルールを明らかにするだろうか。



