top of page

Planowanie biopsji płuca przez GPT-4 wskazało krótsze trasy igły, ale dwa przypadki nie przeszły oceny

5 minut temu
10 minut(y) czytania

Planowanie biopsji płuca przez GPT-4 wygenerowało akceptowalne proponowane ścieżki igły w 28 z 30 przypadków, ale dwie porażki ujawniły istotną lukę bezpieczeństwa. Model działał na opatrzonych adnotacjami, dwuwymiarowych obrazach CT, a nie sterował igłą ani nie oceniał pacjentów podczas procedur na żywo.

Naukowcy z Memorial Sloan Kettering Cancer Center retrospektywnie sprawdzili, czy GPT-4 potrafi rekomendować kąty wejścia do biopsji płuca pod kontrolą CT. Niezależni radiolodzy uznali 93,3 procenta zaproponowanych przez niego ścieżek za wystarczające do wykonania biopsji.

Trasy AI przebiegały przez medianę 5 milimetrów tkanki płucnej, w porównaniu z 23 milimetrami w przypadku tras wcześniej wybranych przez doświadczonych klinicystów. Krócej nie oznacza jednak automatycznie bezpieczniej. Jedna odrzucona trasa przebiegała przez cztery razy więcej tkanki płucnej niż odpowiadająca jej trasa manualna, a druga stwarzała potencjalny problem ze stabilnością igły.

To napięcie ma większe znaczenie niż nagłówkowy odsetek. Badanie sugeruje, że ogólnego przeznaczenia model multimodalny może zinterpretować starannie przygotowany obraz medyczny i stworzyć wiarygodny plan geometryczny. Nie pokazuje natomiast, że GPT-4 poprawia wyniki leczenia, zmniejsza liczbę powikłań ani że potrafi planować biopsje bez szerokiego przygotowania i nadzoru człowieka.

Co faktycznie testowano w badaniu planowania biopsji płuca przez GPT-4

Eksperyment oceniał proponowane kąty wejścia na historycznych obrazach, a nie procedury prowadzone przez AI u pacjentów.

Badanie z otwartym dostępem opublikowano w CVIR Oncology; objęło ono 30 kolejnych procedur biopsji płuca. Naukowcy wykorzystali zanonimizowane obrazy z procedur wcześniej przeprowadzonych przez trzech radiologów interwencyjnych.

Każdy klinicysta miał co najmniej dziesięcioletnie doświadczenie. Grupa pacjentów obejmowała 17 mężczyzn i 13 kobiet, a mediana wieku wynosiła 65 lat. Średnica guzków płucnych wynosiła od 5 do 45 milimetrów, przy medianie 21 milimetrów.

Próba obejmowała pięć zmian szczytowych, siedem zmian podopłucnowych, trzy zmiany przylegające do śródpiersia oraz cztery zmiany w pobliżu podstawy płuca. Lokalizacje te wiązały się z odmiennymi wyzwaniami planistycznymi dotyczącymi żeber, naczyń, tkanki płucnej i stabilności igły.

Biopsja płuca pod kontrolą CT wymaga od lekarza wprowadzenia igły przez ścianę klatki piersiowej do podejrzanej zmiany. Trasa musi dotrzeć do tkanki odpowiedniej do diagnostyki, jednocześnie omijając kości, szczeliny płucne, śródpiersie i duże naczynia krwionośne.

Planowanie uwzględnia również ilość prawidłowej tkanki płucnej, przez którą przechodzi igła. Dłuższe trasy wewnątrzpłucne mogą narażać więcej tkanki, choć długość trasy stanowi tylko jeden z elementów ryzyka proceduralnego.

Badanie nie przekazało GPT-4 niezmodyfikowanego badania CT. Badacz wybrał obraz osiowy, przyciął go i powiększył, a następnie dodał siatkę promienistą przy użyciu GIMP. Obraz przekształcono z jego pierwotnego formatu medycznego do pliku PNG.

Jeden z autorów oznaczył następnie cel niebieskim okręgiem i obrysował wrażliwe struktury na czerwono. Te adnotacje dostarczyły modelowi informacji, które system wdrażany w praktyce musiałby ostatecznie rozpoznawać automatycznie.

Naukowcy przekazali pięć kryteriów planowania w ujednoliconym promptcie. Żądana ścieżka miała dotrzeć do celu, ograniczyć drogę przez tkankę płucną oraz omijać kości, szczeliny i śródpiersie.

Każdy przypadek rozpoczynano w nowej sesji czatu. Naukowcy mogli kontynuować prompting, gdy pierwsza odpowiedź nie uwzględniała wszystkich warunków. Model potrzebował mediany dwóch iteracji, przy rozstępie międzykwartylowym od jednej do trzech.

Zespół zapisał pierwszą odpowiedź uwzględniającą wszystkie żądane parametry. Dwóch doświadczonych radiologów interwencyjnych, z których żaden nie uczestniczył w pierwotnych procedurach, niezależnie oceniło uzyskane ścieżki, nie znając ich pochodzenia.

Taka konfiguracja rozdziela wykonalność od skuteczności klinicznej. Model proponował kąty po tym, jak eksperci wybrali obraz, oznaczyli cel, zidentyfikowali zagrożenia i sformułowali reguły. Radiolog pozostawał niezbędny na każdym ważnym etapie.

Badanie testowało więc wąskie pytanie: czy multimodalny model ogólnego przeznaczenia może wygenerować wiarygodny kąt wejścia na podstawie przygotowanego obrazu? Nie testowało autonomicznej segmentacji, planowania trójwymiarowego, nawigacji na żywo ani robotycznego sterowania igłą.

To rozróżnienie zapobiega przekształceniu obiecującego eksperymentu planistycznego w niepoparte twierdzenie o zautomatyzowanej chirurgii.

Krótsze trasy były najsilniejszym sygnałem badania

GPT-4 proponował znacznie krótsze ścieżki przez tkankę płucną, lecz badanie nie wykazało, że prowadziły one do bezpieczniejszych wyników klinicznych.

Niezależni recenzenci ocenili 28 z 30 tras zaproponowanych przez model jako odpowiednie do wykonania biopsji. Wynik ten dał wskazywany w badaniu wskaźnik wykonalności na poziomie 93,3 procenta.

Ścieżki wygenerowane przez AI przebiegały przez medianę 5 milimetrów tkanki płucnej. Rozstęp międzykwartylowy wynosił od 0 do 25 milimetrów.

Dla porównania, manualne trasy wykorzystane w przeprowadzonych procedurach przecinały medianę 23 milimetrów tkanki płucnej. Ich rozstęp międzykwartylowy wynosił od 5 do 57 milimetrów.

Różnica była statystycznie istotna, przy zgłoszonej wartości p wynoszącej 0,0063. Ścieżki bez przejścia przez tkankę płucną dotyczyły guzków podopłucnowych, które znajdują się przy powierzchni opłucnej.

Bezpośrednia droga do takiej zmiany może pozwolić uniknąć przechodzenia przez prawidłowy miąższ płucny, funkcjonalną tkankę uczestniczącą w wymianie gazowej. Czyni to krótką trasę atrakcyjną geometrycznie, ale sama geometria nie może określić najlepszego podejścia klinicznego.

Średni kąt wejścia AI wynosił 179 stopni, wobec 174 stopni dla tras zastosowanych przez klinicystów. Różnica ta nie była statystycznie istotna.

Podobne średnie nie oznaczały, że model odtwarzał decyzje ludzi. Według głównych wyników tylko osiem z 30 przypadków wykazało dobrą zgodność zgodnie z kryterium porównania przyjętym w badaniu.

Autorzy definiowali zgodność jako kąty wejścia różniące się o nie więcej niż dziesięć stopni oraz podobną trasę przez płaszczyzny tkanek. W innym miejscu przedstawili jeszcze bardziej rygorystyczną interpretację zgodności, wskazując trzy przypadki, co podkreśla wrażliwość wyniku na wybraną definicję.

Ta rozbieżność zasługuje na uwagę, ponieważ wartości centralne mogą ukrywać znaczne różnice między poszczególnymi przypadkami. Dwie grupy tras mogą mieć podobne średnie kąty, a jednocześnie wyraźnie różnić się u konkretnych pacjentów.

AI wydawała się więc znajdować alternatywne trasy, a nie jedynie naśladować przeprowadzone procedury. Niektóre alternatywy wyglądały na krótsze i pozostawały akceptowalne dla recenzentów. Inne ujawniły słabości, które zbiorczy wynik mógłby łatwo ukryć.

Porównanie było też strukturalnie nierówne. Trasy manualne zostały z powodzeniem wykonane u pacjentów, podczas gdy trasy AI istniały jedynie jako linie naniesione na obrazy planistyczne.

Proponowana trasa może wyglądać rozsądnie na jednym przekroju osiowym, lecz stać się niepraktyczna po ocenie sąsiednich przekrojów. Rzeczywiste procedury muszą uwzględniać ruch oddechowy, pozycję ciała, zakotwiczenie igły, ograniczenia sprzętowe i zmieniającą się anatomię.

Pierwotne procedury nie spowodowały poważnych powikłań. U czterech pacjentów wystąpiła minimalna odma opłucnowa, która ustąpiła bez interwencji, a u dwóch pojawiło się łagodne, samoograniczające się krwioplucie.

Tych wyników nie można przypisać AI, ponieważ model nie prowadził procedur. Naukowcy nie symulowali także, czy zastosowanie jego tras zmieniłoby te powikłania.

Wynik dotyczący krótszych tras stanowi zatem użyteczną hipotezę. Wspiera badanie, czy zautomatyzowane planowanie może ujawniać trasy, które klinicyści mogliby przeoczyć, zwłaszcza gdy istnieje kilka geometrycznie poprawnych opcji.

Nie uzasadnia natomiast stwierdzenia, że GPT-4 uczynił biopsje płuca bezpieczniejszymi. Ustalenie tego wymaga badań prospektywnych porównujących wyniki kliniczne w kontrolowanych warunkach.

Dwie odrzucone ścieżki pokazują, dlaczego najkrótsza nie zawsze jest najbezpieczniejsza

Porażki modelu ujawniają konflikt między optymalizacją widocznej metryki a rozumieniem zachowania igły podczas rzeczywistej biopsji.

W przypadku 19 GPT-4 zasugerował ścieżkę przebiegającą przez 20 milimetrów tkanki płucnej. Trasa manualna przebiegała jedynie przez 5 milimetrów.

Rekomendacja AI pokonywała więc czterokrotnie dłuższą drogę przez tkankę płucną, co przeczyło celowi optymalizacji podanemu w promptcie. Zwróciła również szeroki zakres możliwych kątów wejścia, zamiast precyzyjnego, wyraźnie preferowanego planu.

Recenzenci uznali trasę za teoretycznie wykonalną, lecz niereprezentatywną dla dobrej praktyki klinicznej. To rozróżnienie oddaje przepaść między unikaniem oczywistych przeszkód a tworzeniem niezawodnego planu proceduralnego.

Przypadek 27 ujawnił inny problem. Celem był guzek podopłucnowy, co oznacza, że znajdował się blisko zewnętrznej powierzchni płuca.

Proponowana przez AI trasa niepotrzebnie przebiegała przez 5 milimetrów tkanki płucnej. Recenzenci zgłosili również obawy dotyczące stabilności igły.

Bardzo krótka droga przez tkankę zapewniającą podparcie może sprawić, że współosiowa igła biopsyjna będzie niewystarczająco zakotwiczona. Igła może być bardziej podatna na ruch lub przemieszczenie podczas pobierania próbek.

To tworzy główny kompromis badania. Ograniczenie odległości pokonywanej przez prawidłową tkankę płucną brzmi z natury korzystnie, ale stabilna trasa może wymagać wystarczającego zaangażowania tkanki, aby bezpiecznie utrzymać igłę.

Model otrzymał uproszczone reguły, a nie pełne odwzorowanie praktyki proceduralnej. Mógł szukać kąta spełniającego te reguły, nie rozumiejąc wszystkich powodów, dla których radiolog mógłby wybrać mniej bezpośrednie podejście.

Naukowcy przyznali, że analiza pozostała dwuwymiarowa. Radiolodzy zwykle przewijają wiele przekrojów CT i korzystają z rekonstrukcji wielopłaszczyznowych, aby zrozumieć anatomię w trzech wymiarach.

Pojedynczy obraz osiowy nie może w pełni przedstawiać struktur rozciągających się powyżej lub poniżej tej płaszczyzny. Nie może też pokazać, jak pozornie wolna linia zmienia się na całej trójwymiarowej trasie igły.

Obrazy przed przekazaniem ich GPT-4 zostały ręcznie opatrzone adnotacjami. Model nie lokalizował niezależnie każdej zmiany, nie segmentował narządów ani nie definiował niezawodnie marginesów bezpieczeństwa wokół krytycznej anatomii.

W badaniu pominięto również określony minimalny pięciomilimetrowy margines od podobojczykowych i pachowych pęczków nerwowo-naczyniowych. Pozycjonowanie pacjentów utrzymywało te struktury z dala od ocenianych tras, ale przyszłe systemy nie mogą zakładać tego samego warunku.

Prompting wprowadzał kolejne źródło zmienności. Naukowcy zaczynali od ujednoliconego promptu, ale kolejne interakcje nie były w pełni skryptowane, gdy model pomijał kryterium.

Dwóch użytkowników mogłoby zatem pokierować ten sam model ku różnym odpowiedziom. Kliniczny system planowania potrzebowałby powtarzalnego procesu, który daje wyniki możliwe do audytu bez improwizowanej rozmowy.

Przypadki przetwarzano w osobnych sesjach, co ograniczało zanieczyszczenie między przypadkami. Badanie nie ustaliło jednak, czy powtórne uruchomienia na tym samym obrazie zwracałyby ten sam kąt.

Spójność ma znaczenie, gdy rekomendacja wpływa na inwazyjną procedurę. System, który zmienia swój plan między uruchomieniami, potrzebuje metody wyjaśniania, porządkowania i rozstrzygania tych różnic.

Wersja modelu stanowi kolejne wyzwanie. Usługi AI ogólnego przeznaczenia zmieniają się z czasem, czasami bez ujawniania użytkownikom klinicznym każdej modyfikacji technicznej.

Wynik uzyskany z jednej konfiguracji GPT-4 nie może automatycznie przenosić się na późniejszy model. Walidacja medyczna musi dotyczyć kontrolowanej wersji systemu, zdefiniowanych danych wejściowych i udokumentowanego procesu działania.

Systemy tworzone do konkretnych celów pokazują model ogólny w szerszej perspektywie

Wynik GPT-4 jest godny uwagi, ponieważ wykorzystano model ogólnego przeznaczenia, jednak wyspecjalizowane algorytmy już oferują bardziej ustrukturyzowane i powtarzalne metody planowania.

Badanie dotyczące planowania trajektorii z 2024 roku oceniło oprogramowanie stworzone specjalnie do biopsji płuca przez ścianę klatki piersiowej. Łączyło ono trójwymiarowe wykrywanie zmian z optymalizacją bayesowską w celu proponowania trajektorii.

System ten trenowano na 2 147 guzkach z 219 skanów. Naukowcy zweryfikowali wykrywanie zmian na kolejnych 235 skanach zawierających 354 zmiany.

Model osiągnął zgłoszony obszar pod krzywą ROC na poziomie 97,4 procent. Jego średnia czułość wyniosła 93,5 procent, a średnia swoistość osiągnęła 93,2 procent.

Naukowcy porównali proponowane trajektorie z rzeczywistymi drogami biopsji u 150 pacjentów. Za zgodność uznawali różnicę kątową mniejszą niż pięć stopni.

System wygenerował wykonalne drogi w 85,3 procent ocenianych przypadków. Osiemdziesiąt dwa procent odpowiadało rzeczywistym ścieżkom zgodnie z definicją badania, przy średnim odchyleniu kątowym wynoszącym 2,30 stopnia wśród zgodnych tras.

System ten realizował zadania, których GPT-4 nie wykonywał, w tym trójwymiarową segmentację i wykrywanie zmian. Nadal jednak była to ocena retrospektywna, a nie dowód na poprawę wyników leczenia pacjentów.

Wcześniejsze prace również porównywały planowanie AI oparte na regułach z oceną specjalistów. Badanie typu proof-of-concept z 2023 roku wygenerowało pięć kandydackich tras dla każdego z 28 pacjentów.

Czterech doświadczonych lekarzy oceniło 140 ścieżek. Komputer i lekarze przyznali identyczne oceny w 57,9 procent przypadków, a wszystkie 28 najlepszych ścieżek wybranych przez algorytm uznano za bezpieczne.

Nowsze badania rozszerzyły to porównanie. Algorytm rekomendacji trajektorii dla biopsji pod kontrolą CT, znany jako TRAX, generuje i klasyfikuje około 20 000 kandydackich tras po wskazaniu celu przez lekarza.

W porównaniu TRAX obejmującym 53 pacjentów radiolodzy oceniający trasy w zaślepieniu uznali każdą trasę wybraną przez AI i lekarza za bezpieczną. Oceny były identyczne w 58 procentach porównań.

Recenzenci preferowali TRAX w 23 procentach przypadków, a trasę lekarza w 19 procentach. Różnica nie była statystycznie istotna, lecz trasy TRAX były średnio nieco krótsze.

TRAX wybierał również więcej ścieżek poza standardową płaszczyzną osiową. Połowa jego tras wykorzystywała płaszczyznę nachyloną, podczas gdy 81,1 procent tras lekarzy pozostawało osiowych.

Badania te nie tworzą prostego pojedynku z jednym zwycięzcą. Różnią się ich dane wejściowe, definicje, zbiory danych i progi dopasowania tras.

System zaprojektowany do konkretnego celu może kodować ograniczenia anatomiczne, mierzyć odległości i konsekwentnie klasyfikować tysiące tras. Wielomodalny model językowy oferuje większą elastyczność, lecz znacznie bardziej zależy od przygotowania obrazów, promptów i ludzkiej interpretacji.

Rola GPT-4 może więc być bliższa asystentowi planowania niż silnikowi wyznaczania trajektorii. Mógłby pomagać klinicystom porównywać opcje, identyfikować pominięte podejścia lub dokumentować przesłanki wyboru.

Nawet taka rola wspierająca wymaga zabezpieczeń. Interfejs musi odróżniać sugestie modelu od zatwierdzonych planów, wyświetlać pełną trasę anatomiczną i zachowywać zapis ludzkiej weryfikacji.

Istotna rywalizacja nie toczy się między AI a radiologami. Chodzi o automatyczne sugestie geometryczne zestawione z pełnym osądem klinicznym potrzebnym, by zamienić linię na obrazie w bezpieczny zabieg.

Planowanie biopsji płuca przez GPT-4 nadal wymaga walidacji prospektywnej

Kolejne dowody muszą wykazać powtarzalność, działanie w trzech wymiarach i korzyść dla pacjentów, a nie jedynie kolejny wysoki odsetek wykonalności.

Pierwszym sygnałem wartym obserwacji jest odtwarzalność. Naukowcy powinni ponownie uruchamiać identyczne przypadki w kontrolowanych sesjach i mierzyć, jak często model wybiera tę samą trasę.

Powinni również ujednolicić każdy prompt i warunek dalszej interakcji. Jeśli nadal konieczna jest ludzka korekta, badania muszą rejestrować, jak często występuje i w jakim stopniu zmienia rekomendację.

Powtarzalny system wzmocniłby argumenty za wykorzystaniem generatywnej AI w formalnym procesie planowania. Duża zmienność między uruchomieniami osłabiłaby go, nawet gdyby recenzenci uznawali większość pojedynczych wyników za wiarygodne.

Drugim sygnałem jest natywna analiza trójwymiarowa. Przyszłe systemy potrzebują dostępu do pełnych wolumenów CT, a nie do ręcznie wybranych obrazów PNG.

Taki proces powinien automatycznie segmentować zmianę, płuca, naczynia, żebra, szczeliny, śródpiersie i inne istotne struktury. Powinien również obliczać wyraźnie określone marginesy bezpieczeństwa oraz wyświetlać całą trasę.

Połączenie modelu językowego z wyspecjalizowaną segmentacją medyczną mogłoby ograniczyć część sztucznego przygotowania zastosowanego w obecnym badaniu. Stworzyłoby jednak także nowe ryzyka integracyjne, wymagające odrębnej walidacji.

Analiza trójwymiarowa musi uwzględniać różne skanery, ustawienia rekonstrukcji, pozycje pacjentów i lokalizacje zmian. Dane wieloośrodkowe byłyby niezbędne, ponieważ wyniki osiągane w jednym ośrodku onkologicznym mogą nie przenosić się na inne szpitale.

Trzecim sygnałem jest prospektywne porównanie kliniczne. Takie badanie oceniałoby plany wspomagane przez AI przed zabiegami, przy zachowaniu odpowiedzialności wykwalifikowanych radiologów za każdą ostateczną decyzję.

Naukowcy mogliby porównać skuteczność diagnostyczną, odmę opłucnową, krwawienie, czas trwania procedury, ekspozycję na promieniowanie, konieczność zmiany położenia igły i czas rekonwalescencji. Powinni osobno raportować nieudane rekomendacje, zamiast pozwalać, by średnie je maskowały.

Testy prospektywne powinny rozpocząć się ostrożnie. Tryb równoległy mógłby generować rekomendacje bez wpływania na opiekę, umożliwiając badaczom porównanie planów AI z rzeczywistymi decyzjami w warunkach klinicznych.

Późniejsze badania mogłyby ocenić, czy klinicyści korzystający z systemu tworzą lepsze lub bardziej spójne plany. Każdy krok w kierunku bezpośredniego wykonania robotycznego wymagałby znacznie silniejszych dowodów i nadzoru na poziomie urządzenia.

Badanie obejmujące 30 przypadków nie odpowiada na pytanie o skuteczność diagnostyczną, ponieważ proponowane ścieżki nie zostały wykorzystane. Nie może też wykazać, czy krótsza trasa ograniczyłaby zaobserwowane drobne powikłania.

Jego wartość polega na wykazaniu, że ogólny model wielomodalny może uczestniczyć w ściśle ograniczonym zadaniu planistycznym. Wynik ten uzasadnia lepsze eksperymenty, a nie natychmiastowe wdrożenie kliniczne.

Rzeczywistym postępem jest testowalna hipoteza planowania

To badanie wykonalności przekształca planowanie trajektorii z użyciem generatywnej AI w mierzalne pytanie badawcze, pozostawiając odpowiedzialność kliniczną zdecydowanie po stronie specjalistów.

GPT-4 wskazał trasy, które niezależni eksperci uznali za odpowiednie w 28 z 30 historycznych przypadków. Mediana proponowanej przez niego trasy przecinała o 18 milimetrów mniej tkanki płucnej niż zrealizowane ręcznie trasy.

Dane te sprawiają, że metoda zasługuje na dalsze badania. Towarzyszą im jednak dwa odrzucone plany, ręczne przygotowanie obrazów, nieskryptowane prompty uzupełniające oraz dwuwymiarowy widok trójwymiarowej anatomii.

Najbardziej użyteczna interpretacja nie jest ani odrzuceniem, ani celebracją. Model AI ogólnego przeznaczenia rozpoznał wystarczająco dużo struktury wizualnej i proceduralnej, by sugerować wiarygodne alternatywy, ale brakowało mu pełnego kontekstu potrzebnego do niezawodnego planowania.

Dla radiologów badanie wskazuje na wsparcie decyzyjne, które porównuje trajektorie, zamiast zastępować osąd kliniczny. Dla zespołów zajmujących się medyczną AI definiuje ono pracę inżynieryjną, której wciąż brakuje między eksperymentem z chatbotem a zwalidowanym oprogramowaniem.

Dla szpitali i pacjentów standard powinien pozostać oparty na wynikach. Czy wsparcie AI poprawia pobieranie tkanek, ogranicza powikłania, skraca procedury lub zwiększa spójność planowania eksperckiego w różnych warunkach opieki?

Kolejne badania powinny odpowiedzieć na te pytania za pomocą kontrolowanych systemów, pełnych wolumenów CT, zewnętrznych zbiorów danych i prospektywnej oceny klinicznej. Do tego czasu planowanie biopsji płuca przez GPT-4 pozostaje intrygującą drugą opinią na przygotowanym obrazie, a nie nawigatorem dla igły używanej na żywo.

 
 

Zacznij bezpłatnie

Asystent AI działający przede wszystkim lokalnie, z funkcją zarządzania wiedzą osobistą

Aby zapewnić lepsze działanie AI,

remio obsługuje obecnie wyłącznie Windows 10+ (x64) i M-Chip Macs.

Twój partner AI w pracy
Zrób więcej z remio

Planuj. Twórz. Dostarczaj.
Wszystko w jednym miejscu.

bottom of page