La pianificazione delle biopsie polmonari con GPT-4 ha individuato percorsi dell'ago più brevi, ma due non hanno superato la revisione
La pianificazione delle biopsie polmonari con GPT-4 ha prodotto percorsi dell'ago proposti accettabili in 28 casi su 30, ma i due fallimenti hanno evidenziato una significativa lacuna di sicurezza. Il modello ha lavorato su immagini CT bidimensionali annotate, anziché controllare un ago o valutare i pazienti durante procedure in tempo reale.
I ricercatori del Memorial Sloan Kettering Cancer Center hanno testato retrospettivamente se GPT-4 fosse in grado di raccomandare angoli di ingresso per biopsie polmonari guidate da CT. Radiologi indipendenti hanno giudicato adeguato all'esecuzione di una biopsia il 93,3 percento dei percorsi proposti.
I percorsi dell'IA attraversavano una mediana di 5 millimetri di tessuto polmonare, rispetto ai 23 millimetri dei percorsi precedentemente scelti da clinici esperti. Tuttavia, più corto non significa automaticamente più sicuro. Un percorso respinto attraversava quattro volte più tessuto polmonare rispetto al corrispondente percorso manuale, mentre un altro creava un potenziale problema di stabilità dell'ago.
Questa tensione conta più della percentuale riportata nel titolo. Lo studio suggerisce che un modello multimodale di uso generale possa interpretare un'immagine medica accuratamente preparata e produrre un piano geometrico plausibile. Non dimostra che GPT-4 migliori gli esiti, riduca le complicanze o possa pianificare biopsie senza un'ampia preparazione e supervisione umana.
Cosa ha effettivamente testato lo studio sulla pianificazione delle biopsie polmonari con GPT-4
L'esperimento ha valutato angoli di ingresso proposti su immagini storiche, non procedure guidate dall'IA su pazienti.
Lo studio ad accesso aperto è apparso su CVIR Oncology e ha coinvolto 30 procedure consecutive di biopsia polmonare. I ricercatori hanno utilizzato immagini de-identificate provenienti da procedure già eseguite da tre radiologi interventisti.
Ogni clinico aveva almeno dieci anni di esperienza. La coorte di pazienti comprendeva 17 uomini e 13 donne, con un'età mediana di 65 anni. I noduli polmonari variavano da 5 a 45 millimetri di diametro, con un diametro mediano di 21 millimetri.
Il campione comprendeva cinque lesioni apicali, sette lesioni sottopleuriche, tre lesioni paramediastiniche e quattro lesioni vicino alla base del polmone. Queste sedi introducevano diverse difficoltà di pianificazione che coinvolgevano coste, vasi, tessuto polmonare e stabilità dell'ago.
Una biopsia polmonare guidata da CT richiede al medico di far avanzare un ago attraverso la parete toracica fino a una lesione sospetta. Il percorso deve raggiungere tessuto adatto alla diagnosi evitando ossa, scissure polmonari, mediastino e grossi vasi sanguigni.
La pianificazione considera inoltre la quantità di tessuto polmonare normale attraversata dall'ago. Percorsi intrapolmonari più lunghi possono esporre più tessuto, sebbene la lunghezza del percorso rappresenti solo un elemento del rischio procedurale.
Lo studio non ha fornito a GPT-4 un esame CT non modificato. Un ricercatore ha selezionato un'immagine assiale, l'ha ritagliata e ingrandita, quindi ha aggiunto una griglia radiale usando GIMP. L'immagine è stata convertita dal suo formato medico originale in un file PNG.
Un autore ha quindi contrassegnato il bersaglio con un cerchio blu e delineato in rosso le strutture sensibili. Queste annotazioni hanno fornito al modello informazioni che un sistema distribuibile dovrebbe in futuro identificare automaticamente.
I ricercatori hanno fornito cinque criteri di pianificazione attraverso un prompt standardizzato. Il percorso richiesto doveva raggiungere il bersaglio, ridurre il tragitto attraverso il tessuto polmonare ed evitare ossa, scissure e mediastino.
Ogni caso è iniziato in una nuova sessione di chat. I ricercatori potevano continuare a sollecitare il modello quando la prima risposta non affrontava ogni condizione. Il modello ha richiesto una mediana di due iterazioni, con un intervallo interquartile da una a tre.
Il team ha registrato la prima risposta che incorporava tutti i parametri richiesti. Due radiologi interventisti esperti, nessuno dei quali coinvolto nelle procedure originali, hanno esaminato indipendentemente i percorsi risultanti senza conoscerne l'origine.
Questa configurazione separa la fattibilità dalla prestazione clinica. Il modello ha proposto angoli dopo che esperti umani avevano scelto l'immagine, contrassegnato il bersaglio, identificato i rischi e formulato le regole. Un radiologo è rimasto necessario in ogni fase importante.
Lo studio ha quindi testato una domanda circoscritta: un modello multimodale di uso generale può generare un angolo di ingresso plausibile a partire da un'immagine preparata? Non ha testato segmentazione autonoma, pianificazione tridimensionale, navigazione in tempo reale o controllo robotico dell'ago.
Questa distinzione impedisce che un promettente esperimento di pianificazione diventi un'affermazione non supportata sulla chirurgia automatizzata.
I percorsi più brevi hanno generato il segnale più forte dello studio
GPT-4 ha proposto percorsi molto più brevi attraverso il tessuto polmonare, ma lo studio non ha stabilito che tali percorsi producessero esiti clinici più sicuri.
I revisori indipendenti hanno valutato come adeguati all'esecuzione della biopsia 28 dei 30 percorsi proposti dal modello. Questo risultato ha prodotto il dato di fattibilità del 93,3 percento dello studio.
I percorsi generati dall'IA attraversavano una mediana di 5 millimetri di tessuto polmonare. L'intervallo interquartile andava da 0 a 25 millimetri.
In confronto, i percorsi manuali utilizzati nelle procedure completate attraversavano una mediana di 23 millimetri. Il loro intervallo interquartile andava da 5 a 57 millimetri.
La differenza era statisticamente significativa, con un p-value riportato di 0,0063. I percorsi senza attraversamento di tessuto polmonare riguardavano noduli sottopleurici, situati accanto alla superficie pleurica.
Un percorso diretto verso una simile lesione può evitare l'attraversamento del parenchima polmonare normale, il tessuto funzionale coinvolto nello scambio gassoso. Questo rende un percorso breve geometricamente interessante, ma la sola geometria non può definire il miglior approccio clinico.
L'angolo medio di ingresso dell'IA era di 179 gradi, rispetto ai 174 gradi dei percorsi usati dai clinici. Questa differenza non era statisticamente significativa.
Medie simili non significavano che il modello riproducesse le decisioni umane. Secondo i risultati principali, solo otto dei 30 casi hanno mostrato una buona concordanza in base al confronto dichiarato dallo studio.
Gli autori hanno definito una corrispondenza usando angoli di ingresso entro dieci gradi e un percorso simile attraverso i piani tissutali. Altrove, hanno riportato un'interpretazione ancora più rigorosa della corrispondenza, pari a tre casi, evidenziando la sensibilità alla definizione scelta.
Questa discrepanza merita attenzione perché le medie centrali possono nascondere differenze sostanziali a livello di singolo caso. Due gruppi di percorsi possono avere angoli medi simili, pur divergendo ampiamente per i singoli pazienti.
L'IA sembrava quindi individuare percorsi alternativi, non limitarsi a imitare le procedure completate. Alcune alternative apparivano più brevi e restavano accettabili per i revisori. Altre hanno evidenziato debolezze che il risultato aggregato poteva facilmente nascondere.
Il confronto era inoltre strutturalmente diseguale. I percorsi manuali erano stati eseguiti con successo sui pazienti, mentre quelli dell'IA esistevano solo come linee tracciate sulle immagini di pianificazione.
Un percorso proposto può apparire ragionevole in una singola sezione assiale, ma diventare impraticabile quando valutato sulle sezioni adiacenti. Le procedure reali devono considerare il movimento respiratorio, la posizione del corpo, l'ancoraggio dell'ago, i vincoli delle apparecchiature e l'anatomia variabile.
Le procedure originali non hanno prodotto complicanze maggiori. Quattro pazienti hanno sviluppato un pneumotorace minimo, risoltosi senza intervento, e due hanno manifestato emottisi lieve e autolimitante.
Questi esiti non possono essere attribuiti all'IA perché il modello non ha guidato le procedure. I ricercatori non hanno inoltre simulato se l'uso dei suoi percorsi avrebbe modificato tali complicanze.
Il risultato relativo ai percorsi più brevi costituisce di conseguenza un'ipotesi utile. Sostiene la necessità di verificare se la pianificazione automatizzata possa rivelare percorsi che i clinici potrebbero trascurare, in particolare quando esistono diverse opzioni geometricamente valide.
Non supporta l'affermazione che GPT-4 abbia reso più sicure le biopsie polmonari. Per stabilire tale affermazione sono necessari studi prospettici che confrontino gli esiti clinici in condizioni controllate.
Due percorsi respinti mostrano perché il più breve non è sempre il più sicuro
I fallimenti del modello rivelano un conflitto tra l'ottimizzazione di una metrica visibile e la comprensione del comportamento di un ago durante una biopsia reale.
Nel Caso 19, GPT-4 ha suggerito un percorso che attraversava 20 millimetri di tessuto polmonare. Il percorso manuale ne attraversava solo 5 millimetri.
La raccomandazione dell'IA viaggiava quindi quattro volte più lontano attraverso il tessuto polmonare, contraddicendo l'obiettivo di ottimizzazione fornito nel prompt. Ha inoltre restituito un'ampia gamma di possibili angoli di ingresso anziché un piano preciso e chiaramente preferito.
I revisori hanno ritenuto il percorso teoricamente fattibile, ma non rappresentativo di una buona pratica clinica. Questa distinzione coglie il divario tra l'evitare ostacoli evidenti e il produrre un piano procedurale affidabile.
Il Caso 27 ha evidenziato un problema diverso. Il bersaglio era un nodulo sottopleurico, ossia situato vicino alla superficie esterna del polmone.
Il percorso proposto dall'IA attraversava inutilmente 5 millimetri di tessuto polmonare. I revisori hanno inoltre sollevato preoccupazioni sulla stabilità dell'ago.
Un percorso molto breve attraverso il tessuto di supporto può lasciare un ago per biopsia coassiale insufficientemente ancorato. L'ago può diventare più vulnerabile al movimento o allo spostamento durante il prelievo.
Ciò crea il compromesso centrale dello studio. Ridurre la distanza attraverso il tessuto polmonare normale sembra intrinsecamente vantaggioso, ma un percorso stabile può richiedere un sufficiente coinvolgimento del tessuto per mantenere l'ago saldamente in posizione.
Il modello ha ricevuto regole semplificate anziché una rappresentazione completa della pratica procedurale. Poteva cercare un angolo che soddisfacesse tali regole senza comprendere tutte le ragioni per cui un radiologo potrebbe scegliere un approccio meno diretto.
I ricercatori hanno riconosciuto che l'analisi rimaneva bidimensionale. I radiologi umani normalmente scorrono più sezioni CT e usano ricostruzioni multiplanari per comprendere l'anatomia in tre dimensioni.
Una singola immagine assiale non può rappresentare pienamente le strutture che si estendono sopra o sotto quel piano. Non può inoltre mostrare come una linea apparentemente libera cambi lungo l'intero percorso tridimensionale dell'ago.
Le immagini sono state annotate manualmente prima di raggiungere GPT-4. Il modello non ha localizzato autonomamente ogni lesione, segmentato gli organi o definito in modo affidabile margini di sicurezza attorno all'anatomia critica.
Lo studio ha inoltre omesso un margine minimo specificato di cinque millimetri dai fasci neurovascolari succlavi e ascellari. Il posizionamento dei pazienti ha mantenuto tali strutture lontane dai percorsi valutati, ma i sistemi futuri non possono presumere la stessa condizione.
Il prompting ha introdotto un'altra fonte di variabilità. I ricercatori hanno iniziato con un prompt standardizzato, ma le interazioni successive non erano completamente scriptate quando il modello ometteva un criterio.
Due utenti potrebbero quindi orientare lo stesso modello verso risposte diverse. Un sistema di pianificazione clinica avrebbe bisogno di un processo riproducibile che produca risultati verificabili senza una conversazione improvvisata.
I casi sono stati elaborati in sessioni separate, riducendo la contaminazione tra casi. Tuttavia, lo studio non ha stabilito se esecuzioni ripetute sulla stessa immagine avrebbero restituito lo stesso angolo.
La coerenza è importante quando una raccomandazione influenza una procedura invasiva. Un sistema che cambia il proprio piano tra un'esecuzione e l'altra necessita di un metodo per spiegare, classificare e risolvere tali differenze.
Anche la versione del modello presenta un'altra sfida. I servizi di IA di uso generale cambiano nel tempo, talvolta senza rendere disponibili agli utenti clinici tutte le modifiche tecniche.
Un risultato ottenuto con una configurazione di GPT-4 non può trasferirsi automaticamente a un modello successivo. La validazione medica deve riferirsi a una versione controllata del sistema, a input definiti e a un processo operativo documentato.
I sistemi progettati per uno scopo specifico inquadrano il modello generale
Il risultato di GPT-4 è degno di nota perché ha utilizzato un modello generalista, ma algoritmi specializzati offrono già metodi di pianificazione più strutturati e riproducibili.
Uno studio sulla pianificazione dei percorsi del 2024 ha valutato un software progettato specificamente per la biopsia polmonare transtoracica. Combinava il rilevamento tridimensionale delle lesioni con l'ottimizzazione bayesiana per proporre traiettorie.
Il sistema è stato addestrato utilizzando 2.147 noduli provenienti da 219 scansioni. I ricercatori hanno validato il rilevamento delle lesioni con altre 235 scansioni contenenti 354 lesioni.
Il modello ha raggiunto un'area sotto la curva ROC riportata del 97,4%. La sensibilità media è stata del 93,5%, mentre la specificità media ha raggiunto il 93,2%.
I ricercatori hanno confrontato le traiettorie proposte con i percorsi bioptici effettivi di 150 pazienti. Hanno classificato come corrispondente un percorso con una differenza angolare inferiore a cinque gradi.
Il sistema ha generato percorsi fattibili nell'85,3% dei casi valutati. L'82% corrispondeva ai percorsi reali secondo la definizione dello studio, con una deviazione angolare media di 2,30 gradi tra i percorsi corrispondenti.
Quel sistema affrontava compiti che GPT-4 non ha svolto, inclusi la segmentazione tridimensionale e il rilevamento delle lesioni. Tuttavia, rimaneva anch'esso una valutazione retrospettiva, non una dimostrazione di migliori esiti per i pazienti.
Anche lavori precedenti hanno messo alla prova una pianificazione AI basata su regole rispetto al giudizio degli specialisti. Uno studio proof-of-concept del 2023 ha generato cinque percorsi candidati per ciascuno dei 28 pazienti.
Quattro medici esperti hanno valutato 140 percorsi. Il computer e i medici hanno assegnato punteggi identici nel 57,9% dei casi e tutti i 28 migliori percorsi selezionati dall'algoritmo sono stati considerati sicuri.
Ricerche più recenti hanno ampliato questo confronto. Il Trajectory Recommendation Algorithm for CT-guided Biopsy, noto come TRAX, genera e classifica circa 20.000 percorsi candidati dopo che un medico identifica il bersaglio.
In un confronto su TRAX condotto su 53 pazienti, radiologi in cieco hanno valutato come sicuro ogni percorso selezionato dall'AI e dal medico. Le valutazioni erano identiche nel 58% dei confronti.
I revisori hanno preferito TRAX nel 23% dei casi e il percorso del medico nel 19%. La differenza non era statisticamente significativa, ma i percorsi TRAX erano in media leggermente più brevi.
TRAX ha inoltre selezionato più percorsi al di fuori del piano assiale standard. La metà dei suoi percorsi utilizzava un piano angolato, mentre l'81,1% dei percorsi dei medici rimaneva assiale.
Questi studi non producono una semplice gara con un unico vincitore. I loro input, le definizioni, i dataset e le soglie di corrispondenza dei percorsi differiscono.
Un sistema progettato ad hoc può codificare vincoli anatomici, quantificare le distanze e classificare in modo coerente migliaia di percorsi. Un modello linguistico multimodale offre maggiore flessibilità, ma dipende più fortemente dalla preparazione delle immagini, dal prompting e dall'interpretazione umana.
Il ruolo di GPT-4 potrebbe quindi essere più vicino a quello di un assistente alla pianificazione che di un motore per le traiettorie. Potrebbe aiutare i clinici a confrontare opzioni, identificare approcci trascurati o documentare le ragioni alla base di una selezione.
Anche questo ruolo di supporto richiede salvaguardie. L'interfaccia deve distinguere i suggerimenti del modello dai piani approvati, mostrare il percorso anatomico completo e conservare una registrazione della revisione umana.
La competizione significativa non è tra AI e radiologi. È tra suggerimenti geometrici automatizzati e il giudizio clinico completo necessario per trasformare una linea su un'immagine in una procedura sicura.
La pianificazione della biopsia polmonare con GPT-4 necessita ancora di validazione prospettica
Le prossime evidenze devono dimostrare ripetibilità, prestazioni tridimensionali e benefici per i pazienti, non soltanto un'altra alta percentuale di fattibilità.
Il primo segnale da osservare è la riproducibilità. I ricercatori dovrebbero rieseguire casi identici in sessioni controllate e misurare con quale frequenza il modello seleziona lo stesso percorso.
Dovrebbero inoltre standardizzare ogni prompt e condizione di follow-up. Se resta necessaria una correzione umana, gli studi devono registrare con quale frequenza avviene e quanto modifica la raccomandazione.
Un sistema riproducibile rafforzerebbe l'argomento a favore dell'uso dell'AI generativa in un flusso di lavoro formale di pianificazione. Un'ampia variazione tra le esecuzioni lo indebolirebbe, anche se i revisori considerassero plausibile la maggior parte dei singoli output.
Il secondo segnale è l'analisi tridimensionale nativa. I sistemi futuri necessitano dell'accesso a interi volumi CT, anziché a immagini PNG selezionate manualmente.
Quel flusso di lavoro dovrebbe segmentare automaticamente la lesione, i polmoni, i vasi, le costole, le scissure, il mediastino e altre strutture rilevanti. Dovrebbe inoltre calcolare margini di sicurezza espliciti e mostrare l'intero percorso.
La combinazione di un modello linguistico con una segmentazione medica dedicata potrebbe risolvere parte della preparazione artificiale dello studio attuale. Creerebbe anche nuovi rischi di integrazione che richiedono una validazione separata.
L'analisi tridimensionale deve gestire scanner diversi, impostazioni di ricostruzione, posizioni dei pazienti e sedi delle lesioni. I dati multicentrici sarebbero essenziali, perché le prestazioni in un centro oncologico potrebbero non trasferirsi ad altri ospedali.
Il terzo segnale è un confronto clinico prospettico. Un simile studio valuterebbe i piani assistiti dall'AI prima delle procedure, mantenendo radiologi qualificati responsabili di ogni decisione finale.
I ricercatori potrebbero confrontare resa diagnostica, pneumotorace, sanguinamento, durata della procedura, esposizione alle radiazioni, riposizionamento dell'ago e tempi di recupero. Dovrebbero riportare separatamente le raccomandazioni non riuscite, invece di lasciare che le medie le nascondano.
I test prospettici dovrebbero iniziare con cautela. Una modalità ombra potrebbe generare raccomandazioni senza influenzare l'assistenza, permettendo agli investigatori di confrontare i piani AI con le decisioni reali in condizioni operative.
Successivamente, gli studi potrebbero valutare se i clinici che utilizzano il sistema elaborino piani migliori o più coerenti. Qualsiasi passaggio verso l'esecuzione robotica diretta richiederebbe evidenze sostanzialmente più solide e una supervisione a livello di dispositivo.
Lo studio su 30 casi non offre alcuna risposta sulla resa diagnostica perché i percorsi proposti non sono stati utilizzati. Non può nemmeno dimostrare se un percorso più breve avrebbe ridotto le complicanze minori osservate.
Il suo valore consiste nel dimostrare che un modello multimodale generalista può partecipare a un esercizio di pianificazione strettamente vincolato. Questa scoperta giustifica esperimenti migliori, non un'immediata implementazione clinica.
Il vero progresso è un'ipotesi di pianificazione verificabile
Questo studio di fattibilità trasforma la pianificazione delle traiettorie con AI generativa in una domanda di ricerca misurabile, lasciando al contempo la responsabilità clinica saldamente nelle mani degli specialisti.
GPT-4 ha identificato percorsi che esperti indipendenti hanno considerato adeguati in 28 dei 30 casi storici. Il suo percorso proposto mediano attraversava 18 millimetri di tessuto polmonare in meno rispetto ai percorsi manuali completati.
Questi dati rendono il metodo meritevole di approfondimento. Si affiancano però a due piani respinti, alla preparazione manuale delle immagini, a prompt di follow-up non predefiniti e a una visione bidimensionale di un'anatomia tridimensionale.
L'interpretazione più utile non è né il rifiuto né la celebrazione. Un modello AI generalista ha riconosciuto abbastanza struttura visiva e procedurale da suggerire alternative plausibili, ma gli mancava il contesto completo necessario per una pianificazione affidabile.
Per i radiologi, lo studio indica un supporto decisionale che confronta le traiettorie anziché sostituire il giudizio clinico. Per i team di AI medica, definisce il lavoro ingegneristico ancora mancante tra un esperimento con chatbot e un software validato.
Per ospedali e pazienti, lo standard dovrebbe restare basato sugli esiti. L'assistenza dell'AI migliora il campionamento dei tessuti, riduce le complicanze, abbrevia le procedure o rende la pianificazione esperta più coerente nei diversi contesti assistenziali?
I prossimi studi dovrebbero rispondere a queste domande con sistemi controllati, volumi CT completi, dataset esterni e una valutazione clinica prospettica. Fino ad allora, la pianificazione della biopsia polmonare con GPT-4 rimane un intrigante secondo parere su un'immagine preparata, non un navigatore per un ago in tempo reale.



