Badania kliniczne HHS z AI zastępują stałe fazy adaptacyjnymi dowodami
HHS uruchomił pięcioletni program, który podważa stałe fazy, powielaną infrastrukturę i opóźnione decyzje wpisane w konwencjonalne badania leków. Inicjatywa HHS dotycząca badań klinicznych z AI łączy modele predykcyjne, ciągłą analizę i zautomatyzowane operacje w ramach jednego programu badawczego.
Centralnym elementem jest SURPASS, skrót od Simulation-augmented, Real-time Platform Adaptive Seamless Trials. ARPA-H, Advanced Research Projects Agency for Health, będzie prowadzić program wraz z trzema projektami wspierającymi, dotyczącymi ośrodków badań, danych zdrowotnych i wsparcia pacjentów.
Bezpośrednią obietnicą jest szybkość. Trudniejszym zadaniem będzie udowodnienie, że adaptacyjne oprogramowanie może dostarczać dowody równie wiarygodne jak procesy, które zastępuje. Ten konflikt jednocześnie wywiera presję na regulatorów, sponsorów leków, organizacje prowadzące badania kliniczne, ośrodki badań i zespoły statystyczne.
Badania kliniczne HHS z AI wykraczają poza stałe fazy
SURPASS nie polega po prostu na dodaniu asystenta AI do istniejącego badania. Proponuje inny model operacyjny tworzenia dowodów klinicznych.
HHS ogłosił SURPASS 30 września 2026 r. Według programu badań klinicznych departamentu inicjatywa połączy predykcyjne modele obliczeniowe, wspólną infrastrukturę, wspólne grupy kontrolne i analizę w czasie rzeczywistym.
Program zaplanowano na pięć lat. Oczekuje się, że późną jesienią rozpocznie on zbieranie propozycji od zespołów obejmujących specjalistów od statystyki, AI, projektowania badań, operacji i regulacji.
HHS nie ujawnił finansowania programu w swoim pierwszym komunikacie. Nie wyjaśnił też, jaką elastyczność regulacyjną otrzymają skuteczni uczestnicy, jak wynika z pierwszych informacji o SURPASS.
Te pominięcia są istotne, ponieważ SURPASS wykracza poza automatyzację administracyjną. Jego trzy obszary techniczne dotyczą projektowania badań, wnioskowania statystycznego i operacji.
Pierwszym obszarem jest silnik projektowania bezfazowego. Wykorzystywałby cyfrowe bliźniaki i powiązane modele predykcyjne do symulowania możliwych wyników klinicznych i operacyjnych przed rozpoczęciem badania. Cyfrowy bliźniak to obliczeniowa reprezentacja pacjenta lub procesu, używana do badania prawdopodobnych wyników.
Słowo „bezfazowy” nie oznacza, że badania kliniczne utraciłyby mechanizmy bezpieczeństwa. Opisuje bardziej ciągłą strukturę, która może ograniczyć sztywne przekazania między tradycyjnie oddzielonymi fazami badań.
Drugim obszarem jest silnik ciągłego wnioskowania. Analizowałby gromadzone dane przy użyciu reguł statystycznych zaprojektowanych tak, aby pozostawały ważne podczas wielokrotnych przeglądów. Badacze mogliby wtedy dodawać, kończyć lub dostosowywać ramiona terapeutyczne bez oczekiwania na jedną ustaloną datę analizy.
Trzecim obszarem jest agentowa warstwa operacyjna. W tym kontekście agent to oprogramowanie, które może wykonać określoną sekwencję zadań operacyjnych przy ograniczonym kierowaniu przez człowieka. HHS chce, aby systemy te wspierały przygotowanie badań, oczyszczanie danych, wdrażanie ramion terapeutycznych i tworzenie zbiorów danych.
SURPASS łączy zatem kilka ugruntowanych koncepcji, zamiast opierać się na jednym nowym modelu. Badania adaptacyjne już teraz pozwalają na wcześniej określone zmiany na podstawie gromadzonych dowodów. Badania platformowe mogą testować kilka terapii w ramach wspólnego protokołu. Modele obliczeniowe już wpływają na niektóre decyzje w rozwoju leków.
Proponowana zmiana polega na umieszczeniu tych elementów w jednym trwałym systemie. System ten uczyłby się podczas badania, zamiast traktować projektowanie, rekrutację, analizę i raportowanie jako w dużej mierze odrębne etapy.
HHS twierdzi, że opracowanie leków i produktów biologicznych często trwa ponad dekadę, może kosztować średnio do 2 miliardów dolarów i kończy się niepowodzeniem w ponad 90 procentach przypadków. Dane te pochodzą z komunikatu agencji i należy je rozumieć jako uzasadnienie programu przedstawione przez HHS.
Istotne pytanie nie brzmi, czy obecny proces jest powolny. Niewielu uczestników kwestionuje ten fakt. Pytanie brzmi, czy ciągła platforma może usunąć opóźnienia bez przenoszenia niepewności do modeli trudniejszych do audytowania.
To rozróżnienie tworzy główne napięcie artykułu. Szybsze operacje są wartościowe, ale dowody kliniczne muszą pozostać interpretowalne po zmianie kierunku badania.
Cztery projekty atakują cztery różne wąskie gardła
HHS traktuje powolne badania jako problem systemowy obejmujący projektowanie, ośrodki, dane i pacjentów, a nie tylko niedobór lepszych algorytmów.
SURPASS obejmuje projektowanie i realizację badań. Trzy uzupełniające projekty ARPA-H dotyczą warunków, które określają, czy badanie adaptacyjne może działać w skali krajowej.
STACK jest ukierunkowany na możliwości ośrodków klinicznych. HHS twierdzi, że projekt wykorzysta AI do przyspieszenia uruchamiania ośrodków i pomoże placówkom ochrony zdrowia bez doświadczenia badawczego stać się zdolnymi do prowadzenia badań.
Uruchamianie ośrodka obejmuje umowy, przygotowanie personelu, wdrożenie technologii, przegląd regulacyjny i kwalifikację sponsora. Szybszy projekt statystyczny przynosi niewielką korzyść, jeśli uczestniczące szpitale potrzebują miesięcy, aby rozpocząć rekrutację pacjentów.
STACK wiąże się również z argumentem geograficznym. Większa liczba wykwalifikowanych ośrodków mogłaby pozwolić pacjentom dołączać do badań bliżej domu, zamiast wielokrotnie podróżować do dużego centrum akademickiego.
Ta ekspansja wprowadza praktyczny sprawdzian. Nowe ośrodki muszą zbierać spójne dane, chronić uczestników i przestrzegać złożonych protokołów. Automatyzacja dokumentacji nie zastąpi doświadczonych badaczy, przeszkolonych koordynatorów ani niezawodnych systemów klinicznych.
COMMONS zajmuje się infrastrukturą danych. HHS opisuje go jako system privacy-by-design służący zgodom i dostępowi do danych o jakości regulacyjnej.
Dane o jakości regulacyjnej muszą być identyfikowalne, kontrolowane i odpowiednie do podejmowania decyzji o bezpieczeństwie i skuteczności leczenia. Zwykłe agregowanie danych nie spełnia automatycznie tego standardu.
COMMONS ma łączyć informacje potrzebne do rekrutacji, modelowania predykcyjnego i operacji badawczych. Jeśli zostanie dobrze wdrożony, może ograniczyć powtarzające się zapytania o dane i ułatwić identyfikowanie kwalifikujących się pacjentów.
Może też ujawnić jedno z największych wyzwań wdrożeniowych inicjatywy. Szpitale i sieci badawcze przechowują informacje w różnych formatach, według różnych zasad zarządzania i przy nierównej jakości danych.
Zgoda stanowi kolejne wyzwanie. Zgoda pacjenta na udostępnienie informacji musi pozostać zrozumiała, gdy dane przemieszczają się między instytucjami lub wspierają nowe analizy obliczeniowe.
CINCH koncentruje się na stronie pacjenta. Projekt ma pomagać ludziom udostępniać dane ze świata rzeczywistego, koordynować opiekę i identyfikować badania odpowiadające ich sytuacji.
Dane ze świata rzeczywistego pochodzą z rutynowej opieki i codziennego życia, a nie ze ściśle kontrolowanej wizyty badawczej. Mogą obejmować elektroniczną dokumentację medyczną, dane rozliczeniowe, wyniki laboratoryjne, rejestry i informacje zbierane przez podłączone urządzenia.
Źródła te mogą poszerzyć obraz efektów leczenia. Mogą jednak również zawierać brakujące informacje, niespójne pomiary i wzorce wynikające z nierównego dostępu do opieki.
CINCH musi zatem robić więcej niż dopasowywać słowa kluczowe w dokumentacji pacjenta. Użyteczny system nawigacyjny musi wyjaśniać, dlaczego dane badanie wydaje się istotne, oraz utrzymywać udział klinicystów w decyzjach o kwalifikacji.
Łącznie SURPASS, STACK, COMMONS i CINCH tworzą program warstwowy. SURPASS przeprojektowuje badanie. STACK rozszerza miejsca, w których może ono być prowadzone. COMMONS dostarcza zarządzane informacje. CINCH łączy pacjentów z systemem.
Ta struktura odróżnia ogłoszenie od węższych projektów klinicznych AI. HHS nie obiecuje, że jeden model predykcyjny wybierze skuteczne leki. Próbuje stworzyć wspólną infrastrukturę dla powtarzalnego generowania dowodów.
Ta szersza ambicja zwiększa również ryzyko realizacyjne. Cztery projekty zależą od siebie nawzajem, ale obejmują różne instytucje, standardy techniczne i obowiązki prawne.
Niepowodzenie w którejkolwiek warstwie może ograniczyć pozostałe. Lepsze dopasowanie nie naprawi niedostępnego ośrodka. Szybszy ośrodek nie zrekompensuje bezużytecznych danych. Silny model nie uratuje źle zarządzanego protokołu.
Prawdziwa rywalizacja dotyczy szybkości i weryfikowalnych dowodów
Główny konflikt nie toczy się między AI a badaczami. Chodzi o obietnicę ciągłej adaptacji wobec potrzeby stabilnych, odtwarzalnych wniosków.
Tradycyjne granice między fazami powodują opóźnienia, ale organizują też odpowiedzialność. Sponsorzy wiedzą, jakie dowody muszą istnieć przed przejściem dalej. Recenzenci mogą określić, kiedy protokół się zmienił i który zbiór danych wsparł decyzję.
Ciągła platforma osłabia te znane granice. Może to wyeliminować powielaną pracę, ale sprawia, że planowanie statystyczne i możliwość audytu stają się ważniejsze.
Adaptacyjne badania platformowe ilustrują ten kompromis. Mogą testować kilka interwencji w ramach jednego protokołu nadrzędnego, usuwać nieskuteczne ramiona, dodawać nowych kandydatów i korzystać ze wspólnych grup kontrolnych.
Podczas pandemii COVID-19 badania platformowe dostarczyły istotnych dowodów dotyczących leczenia, gdy konwencjonalne programy miały trudności z szybkością. Ich sukces pokazał, że adaptowalna infrastruktura może skutecznie odpowiadać na pilne pytania.
Adaptacja musi jednak zostać określona, zanim badacze zobaczą wyniki, które mogłyby wpłynąć na ich decyzje. Nieplanowane zmiany mogą tworzyć stronniczość, zwiększać ryzyko wyników fałszywie dodatnich lub utrudniać interpretację efektu leczenia.
Ważny przegląd badań platformowych opisuje wymagania dotyczące projektowania, prowadzenia, nadzoru i raportowania takich badań. Jego główna lekcja jest taka, że elastyczność wymaga większego, a nie mniejszego planowania.
Wspólne grupy kontrolne wymagają podobnej dyscypliny. Wspólna grupa kontrolna może zmniejszyć liczbę uczestników przydzielonych do standardowego leczenia i poprawić efektywność kilku porównań.
Problemy pojawiają się, gdy nowe ramię terapeutyczne porównuje się z pacjentami włączonymi znacznie wcześniej. Praktyka medyczna, wzorce chorób, metody diagnostyczne i charakterystyka pacjentów mogą z czasem się zmieniać.
Badacze nazywają tych wcześniejszych uczestników niejednoczesnymi grupami kontrolnymi. Ich wykorzystanie może zwiększyć moc statystyczną, ale może też wprowadzić stronniczość związaną z czasem.
SURPASS proponuje silnik wnioskowania zachowujący ważność przez cały czas, aby obsłużyć powtarzaną analizę i adaptację. HHS nie opublikował jeszcze specyfikacji statystycznej silnika, punktów odniesienia dla walidacji ani kryteriów akceptacji regulacyjnej.
Ten sam ciężar dowodowy dotyczy cyfrowych bliźniaków. Model może symulować prawdopodobne wyniki przed rekrutacją, pomagając zespołom testować założenia lub identyfikować słabe decyzje protokołowe.
Symulacja pozostaje oszacowaniem. Odzwierciedla pacjentów, zmienne i relacje reprezentowane w danych treningowych.
Jeśli cyfrowy bliźniak niedostatecznie reprezentuje osoby starsze, pacjentów z obszarów wiejskich, osoby w ciąży lub pacjentów z wieloma schorzeniami, wynikające z tego badanie może stać się efektywne wokół niepełnej populacji.
Walidacja musi zatem badać więcej niż średnią dokładność predykcji. Sponsorzy i regulatorzy będą musieli wiedzieć, gdzie model zawodzi, jak kalibrowana jest niepewność oraz czy jego działanie zmienia się między ośrodkami.
Będą również potrzebować procesu aktualizacji modeli. Model, który stale się poprawia, brzmi atrakcyjnie, lecz zmiana oprogramowania podczas badania może skomplikować odtworzenie wcześniejszych decyzji.
Każde istotne zalecenie powinno być powiązane z konkretną wersją modelu, wejściowym zbiorem danych, regułą i zatwierdzeniem przez człowieka. Bez takiego zapisu szybkość może osłabić rozliczalność.
HHS już stwierdził, że badania biomedyczne wspierane przez AI powinny kłaść nacisk na odtwarzalność, przejrzyste metody i bezstronną ocenę. Jego strategia AI wskazuje również, że zgłoszenia regulacyjne wsparte dowodami opartymi na AI są mierzalnym rezultatem.
SURPASS sprawdzi, czy te zasady wytrzymują konfrontację z działającą platformą. Publiczna dokumentacja będzie szczególnie istotna, ponieważ HHS chce, aby powstałe narzędzia, standardy i przykłady regulacyjne przyniosły korzyści całemu systemowi badawczemu.
Celem nie powinno być uczynienie każdego badania adaptacyjnym. Niektóre pytania najlepiej pasują do stabilnych, konwencjonalnych projektów. Inne dotyczą wyników, których nie da się zmierzyć wystarczająco szybko, by kierować zmianami w czasie rzeczywistym.
Długoterminowe przeżycie, opóźnione działania niepożądane i schorzenia rozwijające się powoli nie stają się natychmiastowe tylko dlatego, że oprogramowanie szybciej analizuje napływające dane.
Projekt badania musi wynikać z pytania medycznego. W przeciwnym razie program ryzykuje traktowanie adaptacji jako celu, a nie metody.
Operation TrialBlazer podnosi stawkę konkurencyjną
SURPASS jest częścią szerszej federalnej próby uczynienia Stanów Zjednoczonych miejscem, w którym leki rozwija się szybciej, szczególnie w obliczu rosnących możliwości Chin w zakresie badań klinicznych.
HHS przedstawił Operation TrialBlazer w czerwcu 2026 roku jako ogólnodepartamentalną inicjatywę dotyczącą badań klinicznych. Koordynuje ona działania ARPA-H, FDA, NIH, National Cancer Institute oraz federalnych urzędników odpowiedzialnych za technologie zdrowotne.
Polityczny argument tej inicjatywy jest bezpośredni. HHS twierdzi, że badania na wczesnym etapie przeniosły się za granicę, a Stany Zjednoczone ryzykują utratę związanych z nimi inwestycji, wiedzy eksperckiej i działalności w zakresie rozwoju leków.
Chiny stanowią najbardziej widoczne porównanie. Dane IQVIA wykazały, że udział chińskich firm w globalnej liczbie rozpoczynanych badań wzrósł z 1 procenta w 2009 roku do 30 procent w 2024 roku.
Stany Zjednoczone nadal dysponują istotnymi atutami, w tym dużym rynkiem farmaceutycznym, doświadczonymi regulatorami, czołowymi szpitalami badawczymi i rozbudowanym finansowaniem biotechnologii.
Jednak tempo badań wpływa na to, gdzie firmy testują produkty i gdzie inwestorzy lokują kapitał. Program naukowy, który działa powoli, może tracić szanse nawet wtedy, gdy jego instytucje nadal cieszą się uznaniem.
SURPASS skupia się na opóźnieniach projektowych i operacyjnych. Inne działania TrialBlazer koncentrują się na ocenie regulacyjnej i wymogach dotyczących zgłoszeń.
FDA uruchomiła pilotażowy program Expedited Investigational New Drug dla badań pierwszego zastosowania u ludzi. Wybrani sponsorzy mogą współpracować z kwalifikowanymi instytucjami badawczymi i składać elementy wniosku etapami.
Składanie etapowe pozwala regulatorom oceniać ukończone sekcje, zanim gotowy będzie cały pakiet. FDA chce również, aby część prac związanych z oceną instytucjonalną i uruchamianiem ośrodków mogła postępować równolegle z przygotowaniem wniosku.
Agencja twierdzi, że jaśniejsze oczekiwania dotyczące chemii i produkcji, dostosowane do etapu rozwoju, mogą zaoszczędzić firmom od sześciu do 12 miesięcy. Szacunki te przedstawiono w jej mapie drogowej rozwoju, która obejmuje również ilościowy dobór dawki i główne protokoły badań późnej fazy.
W przypadku późniejszych etapów rozwoju FDA wyjaśniła, kiedy jedno rygorystyczne kluczowe badanie wraz z dowodami potwierdzającymi może uzasadniać zatwierdzenie. Zmieniła również projekt wytycznych dotyczących badań typu basket, umbrella i platformowych.
Te polityki są istotne, ponieważ ARPA-H nie może samodzielnie zapewnić akceptacji regulacyjnej. SURPASS może finansować narzędzia i demonstracje, lecz to FDA decyduje, czy uzyskane dowody wspierają decyzję dotyczącą produktu medycznego.
Relacja między tymi agencjami ukształtuje skalę wdrożenia. Sponsorzy będą niechętnie przebudowywać programy badań wokół nowego systemu bez jasnych dowodów, że regulatorzy potrafią ocenić jego wyniki.
Istnieje też przeciwne ryzyko. Presja polityczna na szybszy krajowy rozwój może prowadzić do zbyt życzliwej interpretacji niepewności.
Najsilniejszą ochroną jest przejrzysta walidacja. Szybsza ocena powinna oznaczać wcześniejszą koordynację, jaśniejsze wymogi i mniej powielanej pracy. Nie powinna oznaczać słabszych standardów bezpieczeństwa ani skuteczności.
Federalna inicjatywa TrialBlazer wyraźnie stwierdza, że modernizacja powinna zachować rygor naukowy. Ta zasada wymaga teraz widocznego wdrożenia.
Dlatego sukces programu nie powinien być mierzony wyłącznie krótszymi harmonogramami. HHS musi również śledzić odchylenia od protokołów, reprezentatywność, wykrywanie zdarzeń niepożądanych, odtwarzalność oraz zgodność między prognozami modeli a wynikami klinicznymi.
Krajowa konkurencyjność zwiększa poczucie pilności, ale nie rozwiązuje problemu dowodowego. Stany Zjednoczone niewiele zyskają dzięki szybszym badaniom, jeśli inni regulatorzy, klinicyści lub pacjenci nie będą ufać ich wnioskom.
Co HHS musi udowodnić w następnej kolejności
Kolejne kamienie milowe muszą pokazać, że SURPASS może jednocześnie tworzyć zwalidowane narzędzia, dowody gotowe do oceny regulacyjnej i szerszy dostęp pacjentów.
Pierwszym sygnałem jest struktura zaproszenia ARPA-H do składania wniosków. Wnioskodawcy potrzebują mierzalnych celów dotyczących szybkości, kosztów, obciążeń uczestników, ważności statystycznej i zasięgu populacyjnego.
Zaproszenie skoncentrowane głównie na funkcjach automatyzacji osłabiłoby założenia programu. Mocne zaproszenie będzie wymagać prospektywnej walidacji względem konwencjonalnych metod oraz jasnych kryteriów niepowodzenia.
Zespoły powinny również określić, jak modele będą audytowane w różnych grupach demograficznych i uczestniczących ośrodkach. Łączna dokładność nie wystarcza przy decyzjach określających, kto trafia do badania lub które leczenie jest kontynuowane.
Drugim sygnałem jest zgodność regulacyjna. Udział FDA musi wyjść poza ogólne wsparcie dla innowacyjnych projektów i objąć konkretne metody oceny wyników SURPASS.
Sponsorzy potrzebują wytycznych dotyczących akceptowalnej walidacji cyfrowych bliźniaków, zmian modeli, wspólnych grup kontrolnych, ciągłej analizy i dokumentacji. Muszą też wiedzieć, kiedy nadal konieczny jest projekt konwencjonalny.
Pomogłyby publiczne przykłady. Protokół, plan symulacji i ramy analityczne poddane ocenie regulatora mogłyby uczynić program użytecznym również poza finansowanymi zespołami.
Zgodność regulacyjna wzmocniłaby inicjatywę, gdyby prowadziła do jasnych standardów, zanim duże badania zaczną od nich zależeć. Utrzymująca się niejednoznaczność spowolni wdrażanie, niezależnie od technicznej wydajności oprogramowania.
Trzecim sygnałem są dowody operacyjne z STACK, COMMONS i CINCH. HHS powinien informować, czy nowe ośrodki są uruchamiane szybciej, czy rekrutują reprezentatywne populacje oraz czy pacjenci rozumieją proces wyrażania świadomej zgody.
Większa liczba ośrodków nie jest automatycznie znacząca. Ośrodki muszą rekrutować uczestników, utrzymywać jakość danych, zatrzymywać personel i chronić pacjentów.
COMMONS należy oceniać na podstawie dostępności danych o jakości regulacyjnej z możliwością prześledzenia pochodzenia, a nie liczby połączonych rekordów. CINCH należy oceniać na podstawie trafnych dopasowań, zakończonej rekrutacji i zrozumienia przez pacjentów.
Miary te ujawniłyby, czy badania kliniczne HHS wykorzystujące AI poszerzają dostęp, czy jedynie przyspieszają pracę w instytucjach już wyposażonych do udziału.
Program powinien również publikować wyniki negatywne. Cyfrowy bliźniak, który słabo działa w jednym obszarze chorobowym, może nadal dostarczać cennych dowodów na to, gdzie takie podejście nie powinno być stosowane.
Taka przejrzystość pomogłaby odróżnić infrastrukturę naukową od kampanii zakupów technologicznych. Wspierałaby też standardy wielokrotnego użytku, które HHS deklaruje, że chce stworzyć.
Dla zespołów klinicznych najbliższym zadaniem jest przygotowanie. Organizacje rozważające udział powinny już teraz zmapować pochodzenie swoich danych, zarządzanie modelami, język zgód i dzienniki decyzji.
Wiedza statystyków, klinicystów, inżynierów danych, specjalistów ds. regulacyjnych i operatorów ośrodków musi pozostać połączona przez cały czas trwania badania. Zespoły mogą korzystać z przeszukiwalnej bazy wiedzy, aby zachować założenia, decyzje i dokumentację modeli we wszystkich tych grupach.
Najważniejszym rezultatem inicjatywy nie będzie twierdzenie, że AI przyspieszyła badania. Będą nim dowody, że badacze szybciej uzyskali wiarygodne odpowiedzi, przy mniejszych niepotrzebnych obciążeniach i bez ukrytej utraty rygoru.
HHS określił ambicję. ARPA-H musi teraz pokazać swoje metody, FDA musi wyjaśnić ścieżkę dowodową, a finansowane zespoły muszą publikować wyniki, które osoby z zewnątrz mogą odtworzyć. Czy pierwsze projekty SURPASS ujawnią swoje zasady walidacji równie jasno, jak promują swoją szybkość?



