GPT-4-Planung für Lungenbiopsien fand kürzere Nadelwege, aber zwei scheiterten in der Prüfung
Die GPT-4-Planung für Lungenbiopsien lieferte in 28 von 30 Fällen akzeptable vorgeschlagene Nadelwege, doch die zwei Fehlschläge offenbarten eine folgenschwere Sicherheitslücke. Das Modell arbeitete mit annotierten zweidimensionalen CT-Bildern, statt eine Nadel zu steuern oder Patienten während laufender Eingriffe zu beurteilen.
Forscher des Memorial Sloan Kettering Cancer Center prüften retrospektiv, ob GPT-4 Einstichwinkel für CT-gesteuerte Lungenbiopsien empfehlen könnte. Unabhängige Radiologen bewerteten 93,3 Prozent der vorgeschlagenen Wege als für die Durchführung einer Biopsie geeignet.
Die KI-Wege durchquerten im Median 5 Millimeter Lungengewebe, verglichen mit 23 Millimetern bei Wegen, die zuvor von erfahrenen Klinikern ausgewählt worden waren. Kürzer bedeutet jedoch nicht automatisch sicherer. Ein abgelehnter Weg durchquerte viermal so viel Lungengewebe wie der entsprechende manuelle Weg, während ein anderer ein potenzielles Problem bei der Nadelstabilität verursachte.
Diese Spannung ist wichtiger als die Schlagzeilenquote. Die Studie legt nahe, dass ein multimodales General-Purpose-Modell ein sorgfältig vorbereitetes medizinisches Bild interpretieren und einen plausiblen geometrischen Plan erstellen kann. Sie zeigt nicht, dass GPT-4 Ergebnisse verbessert, Komplikationen verringert oder Biopsien ohne umfangreiche menschliche Vorbereitung und Aufsicht planen kann.
Was die Studie zur GPT-4-Planung für Lungenbiopsien tatsächlich testete
Das Experiment bewertete vorgeschlagene Einstichwinkel auf historischen Bildern, nicht KI-gesteuerte Eingriffe an Patienten.
Die frei zugängliche Studie erschien in CVIR Oncology und umfasste 30 aufeinanderfolgende Lungenbiopsien. Die Forscher verwendeten de-identifizierte Bilder von Eingriffen, die bereits von drei interventionellen Radiologen durchgeführt worden waren.
Jeder Kliniker verfügte über mindestens zehn Jahre Erfahrung. Die Patientenkohorte umfasste 17 Männer und 13 Frauen bei einem medianen Alter von 65 Jahren. Die Lungennoduli reichten im Durchmesser von 5 bis 45 Millimetern, mit einem Median von 21 Millimetern.
Die Stichprobe umfasste fünf apikale Läsionen, sieben subpleurale Läsionen, drei paramediastinale Läsionen und vier Läsionen nahe der Lungenbasis. Diese Lokalisationen brachten unterschiedliche Planungsherausforderungen im Zusammenhang mit Rippen, Gefäßen, Lungengewebe und Nadelstabilität mit sich.
Bei einer CT-gesteuerten Lungenbiopsie führt ein Arzt eine Nadel durch die Brustwand in eine verdächtige Läsion ein. Der Weg muss für die Diagnose geeignetes Gewebe erreichen und zugleich Knochen, Lungenfissuren, Mediastinum und große Blutgefäße vermeiden.
Bei der Planung wird auch berücksichtigt, wie viel normales Lungengewebe die Nadel durchquert. Längere intrapulmonale Wege können mehr Gewebe belasten, auch wenn die Weglänge nur ein Element des Eingriffsrisikos darstellt.
Die Studie gab GPT-4 keine unveränderte CT-Untersuchung. Ein Forscher wählte ein axiales Bild aus, schnitt es zu und vergrößerte es und fügte mithilfe von GIMP ein Radialraster hinzu. Das Bild wurde aus seinem ursprünglichen medizinischen Format in eine PNG-Datei umgewandelt.
Ein Autor markierte anschließend das Ziel mit einem blauen Kreis und umrandete sensible Strukturen in Rot. Diese Annotationen gaben dem Modell Informationen, die ein einsatzfähiges System letztlich automatisch identifizieren müsste.
Die Forscher übermittelten über einen standardisierten Prompt fünf Planungskriterien. Der gewünschte Weg musste das Ziel erreichen, die Strecke durch Lungengewebe verringern und Knochen, Fissuren sowie das Mediastinum vermeiden.
Jeder Fall begann in einer neuen Chat-Sitzung. Die Forscher konnten weiter nachfragen, wenn die erste Antwort nicht jede Bedingung berücksichtigte. Das Modell benötigte im Median zwei Iterationen, bei einem Interquartilsbereich von eins bis drei.
Das Team dokumentierte die erste Antwort, die alle angeforderten Parameter berücksichtigte. Zwei erfahrene interventionelle Radiologen, die an den ursprünglichen Eingriffen nicht beteiligt waren, prüften die resultierenden Wege unabhängig voneinander und verblindet hinsichtlich ihrer Herkunft.
Dieses Setup trennt Machbarkeit von klinischer Leistung. Das Modell schlug Winkel vor, nachdem menschliche Experten das Bild ausgewählt, das Ziel markiert, Risiken identifiziert und die Regeln formuliert hatten. Ein Radiologe blieb in jeder wichtigen Phase erforderlich.
Die Studie testete daher eine eng gefasste Frage: Kann ein multimodales General-Purpose-Modell aus einem vorbereiteten Bild einen plausiblen Einstichwinkel erzeugen? Sie testete weder autonome Segmentierung noch dreidimensionale Planung, Live-Navigation oder robotische Nadelsteuerung.
Diese Unterscheidung verhindert, dass aus einem vielversprechenden Planungsexperiment eine unbelegte Behauptung über automatisierte Chirurgie wird.
Die kürzeren Wege lieferten das stärkste Signal der Studie
GPT-4 schlug deutlich kürzere Wege durch Lungengewebe vor, doch die Studie belegte nicht, dass diese Wege sicherere klinische Ergebnisse erzeugten.
Unabhängige Gutachter bewerteten 28 der 30 vom Modell vorgeschlagenen Wege als für die Durchführung der Biopsie geeignet. Dieses Ergebnis ergab die Machbarkeitsquote der Studie von 93,3 Prozent.
Die KI-generierten Wege durchquerten im Median 5 Millimeter Lungengewebe. Der Interquartilsbereich reichte von 0 bis 25 Millimetern.
Zum Vergleich durchquerten die bei den abgeschlossenen Eingriffen verwendeten manuellen Wege im Median 23 Millimeter. Ihr Interquartilsbereich lag zwischen 5 und 57 Millimetern.
Der Unterschied war statistisch signifikant, mit einem berichteten p-Wert von 0,0063. Wege ohne Durchquerung von Lungengewebe betrafen subpleurale Noduli, die unmittelbar an der Pleuraoberfläche liegen.
Ein direkter Weg in eine solche Läsion kann die Durchquerung normalen Lungenparenchyms vermeiden, also des am Gasaustausch beteiligten Funktionsgewebes. Das macht einen kurzen Weg geometrisch attraktiv, doch Geometrie allein kann nicht den besten klinischen Zugang bestimmen.
Der mittlere KI-Einstichwinkel betrug 179 Grad, verglichen mit 174 Grad für die von Klinikern verwendeten Wege. Dieser Unterschied war nicht statistisch signifikant.
Ähnliche Mittelwerte bedeuteten nicht, dass das Modell menschliche Entscheidungen reproduzierte. Laut den Hauptergebnissen zeigten nur acht der 30 Fälle eine gute Übereinstimmung nach dem in der Studie angegebenen Vergleichsmaßstab.
Die Autoren definierten eine Übereinstimmung als Einstichwinkel innerhalb von zehn Grad und einen ähnlichen Weg durch Gewebeebenen. An anderer Stelle berichteten sie von einer noch strengeren Auslegung mit Übereinstimmung in drei Fällen, was die Sensitivität gegenüber der gewählten Definition hervorhebt.
Diese Diskrepanz verdient Aufmerksamkeit, weil zentrale Durchschnittswerte erhebliche Unterschiede auf Einzelfallebene verdecken können. Zwei Gruppen von Wegen können ähnliche mittlere Winkel aufweisen und sich bei einzelnen Patienten dennoch stark unterscheiden.
Die KI schien daher alternative Wege zu finden, statt die abgeschlossenen Eingriffe bloß nachzuahmen. Einige Alternativen wirkten kürzer und blieben für Gutachter akzeptabel. Andere offenbarten Schwächen, die das Gesamtergebnis leicht verbergen könnte.
Der Vergleich war zudem strukturell ungleich. Die manuellen Wege waren bei Patienten erfolgreich durchgeführt worden, während die KI-Wege nur als Linien über Planungsbildern existierten.
Ein vorgeschlagener Weg kann in einem axialen Schnitt plausibel erscheinen, bei der Bewertung benachbarter Schichten jedoch unpraktisch werden. Reale Eingriffe müssen Atembewegungen, Körperposition, Nadelverankerung, Geräteeinschränkungen und sich verändernde Anatomie berücksichtigen.
Bei den ursprünglichen Eingriffen traten keine schweren Komplikationen auf. Vier Patienten entwickelten einen minimalen Pneumothorax, der ohne Intervention abklang, und zwei erlitten eine leichte, selbstlimitierende Hämoptyse.
Diese Ergebnisse können der KI nicht zugeschrieben werden, da das Modell die Eingriffe nicht steuerte. Die Forscher simulierten auch nicht, ob die Nutzung seiner Wege diese Komplikationen verändert hätte.
Das Ergebnis der kürzeren Wege ist folglich eine nützliche Hypothese. Es unterstützt die Prüfung, ob automatisierte Planung Wege aufdecken kann, die Kliniker möglicherweise übersehen, insbesondere wenn mehrere geometrisch gültige Optionen bestehen.
Es stützt nicht die Behauptung, GPT-4 habe Lungenbiopsien sicherer gemacht. Um diese Behauptung zu belegen, sind prospektive Studien erforderlich, die klinische Ergebnisse unter kontrollierten Bedingungen vergleichen.
Zwei abgelehnte Wege zeigen, warum der kürzeste nicht immer der sicherste ist
Die Fehlschläge des Modells offenbaren einen Konflikt zwischen der Optimierung einer sichtbaren Kennzahl und dem Verständnis dafür, wie sich eine Nadel bei einer tatsächlichen Biopsie verhält.
In Fall 19 schlug GPT-4 einen Weg vor, der 20 Millimeter Lungengewebe durchquerte. Der manuelle Weg durchquerte nur 5 Millimeter.
Die KI-Empfehlung verlief somit viermal weiter durch Lungengewebe und widersprach dem im Prompt vorgegebenen Optimierungsziel. Zudem gab sie eine breite Spanne möglicher Einstichwinkel zurück, statt eines präzisen, klar bevorzugten Plans.
Die Gutachter hielten den Weg theoretisch für machbar, jedoch nicht für repräsentativ für gute klinische Praxis. Diese Unterscheidung verdeutlicht die Lücke zwischen dem Vermeiden offensichtlicher Hindernisse und der Erstellung eines verlässlichen Eingriffsplans.
Fall 27 offenbarte ein anderes Problem. Das Ziel war ein subpleuraler Nodus, also nahe an der äußeren Oberfläche der Lunge gelegen.
Der vorgeschlagene KI-Weg durchquerte unnötigerweise 5 Millimeter Lungengewebe. Die Gutachter äußerten außerdem Bedenken hinsichtlich der Nadelstabilität.
Ein sehr kurzer Weg durch stützendes Gewebe kann dazu führen, dass eine koaxiale Biopsienadel nicht ausreichend verankert ist. Die Nadel kann während der Probenentnahme anfälliger für Bewegung oder Verrutschen werden.
Daraus ergibt sich der zentrale Zielkonflikt der Studie. Die Verringerung der Strecke durch normales Lungengewebe klingt grundsätzlich vorteilhaft, doch ein stabiler Weg kann genügend Gewebekontakt erfordern, um die Nadel sicher zu halten.
Das Modell erhielt vereinfachte Regeln statt einer vollständigen Abbildung der Eingriffspraxis. Es konnte nach einem Winkel suchen, der diese Regeln erfüllte, ohne jeden Grund zu verstehen, aus dem ein Radiologe einen weniger direkten Zugang wählen könnte.
Die Forscher räumten ein, dass die Analyse zweidimensional blieb. Menschliche Radiologen scrollen normalerweise durch mehrere CT-Schichten und nutzen multiplanare Rekonstruktionen, um die Anatomie dreidimensional zu verstehen.
Ein einzelnes axiales Bild kann Strukturen, die ober- oder unterhalb dieser Ebene verlaufen, nicht vollständig darstellen. Es kann auch nicht zeigen, wie sich eine scheinbar freie Linie über den vollständigen dreidimensionalen Verlauf der Nadel verändert.
Die Bilder wurden manuell annotiert, bevor sie GPT-4 erreichten. Das Modell lokalisierte nicht eigenständig jede Läsion, segmentierte keine Organe und definierte keine Sicherheitsabstände zu kritischer Anatomie zuverlässig.
Die Studie ließ zudem einen festgelegten Mindestabstand von fünf Millimetern zu den neurovaskulären Bündeln unterhalb des Schlüsselbeins und in der Achselhöhle aus. Die Patientenpositionierung hielt diese Strukturen von den bewerteten Wegen fern, doch künftige Systeme können dieselbe Bedingung nicht voraussetzen.
Auch das Prompting führte eine weitere Variabilitätsquelle ein. Die Forscher begannen mit einem standardisierten Prompt, aber Folgeinteraktionen waren nicht vollständig skriptbasiert, wenn das Modell ein Kriterium verfehlte.
Zwei Nutzer könnten dasselbe Modell daher zu unterschiedlichen Antworten lenken. Ein klinisches Planungssystem bräuchte einen reproduzierbaren Prozess, der prüfbare Ergebnisse ohne improvisierte Konversation liefert.
Die Fälle wurden in separaten Sitzungen verarbeitet, was eine Kontamination zwischen den Fällen verringerte. Die Studie stellte jedoch nicht fest, ob wiederholte Durchläufe mit demselben Bild denselben Winkel zurückgeben würden.
Konsistenz ist wichtig, wenn eine Empfehlung einen invasiven Eingriff beeinflusst. Ein System, das seinen Plan zwischen Durchläufen verändert, benötigt eine Methode, um diese Unterschiede zu erklären, einzuordnen und aufzulösen.
Auch die Modellversion stellt eine Herausforderung dar. General-Purpose-KI-Dienste verändern sich im Laufe der Zeit, manchmal ohne dass klinischen Nutzern jede technische Modifikation offengelegt wird.
Ein Ergebnis aus einer GPT-4-Konfiguration kann nicht automatisch auf ein späteres Modell übertragen werden. Medizinische Validierung muss an eine kontrollierte Systemversion, definierte Eingaben und einen dokumentierten Betriebsprozess gebunden sein.
Spezialisierte Systeme rücken das General-Purpose-Modell in die richtige Perspektive
Das Ergebnis von GPT-4 ist bemerkenswert, weil dabei ein allgemeines Modell eingesetzt wurde; spezialisierte Algorithmen bieten jedoch bereits strukturiertere und besser reproduzierbare Planungsmethoden.
Eine Studie zur Pfadplanung aus dem Jahr 2024 bewertete Software, die speziell für transthorakale Lungenbiopsien entwickelt wurde. Sie kombinierte dreidimensionale Läsionserkennung mit bayesischer Optimierung zur Vorschlagserstellung von Trajektorien.
Dieses System wurde mit 2.147 Knoten aus 219 Scans trainiert. Die Forschenden validierten die Läsionserkennung anhand weiterer 235 Scans mit 354 Läsionen.
Das Modell erreichte eine berichtete Fläche unter der ROC-Kurve von 97,4 Prozent. Seine mittlere Sensitivität lag bei 93,5 Prozent, während die mittlere Spezifität 93,2 Prozent erreichte.
Die Forschenden verglichen vorgeschlagene Trajektorien mit den tatsächlichen Biopsiewegen von 150 Patienten. Als Übereinstimmung definierten sie eine Winkelabweichung von weniger als fünf Grad.
Das System erzeugte in 85,3 Prozent der bewerteten Fälle umsetzbare Wege. 82 Prozent stimmten nach der Definition der Studie mit den tatsächlichen Wegen überein; unter den übereinstimmenden Wegen betrug die mittlere Winkelabweichung 2,30 Grad.
Das System bearbeitete Aufgaben, die GPT-4 nicht ausführte, darunter dreidimensionale Segmentierung und Läsionserkennung. Dennoch handelte es sich ebenfalls um eine retrospektive Bewertung und nicht um einen Nachweis besserer Patientenergebnisse.
Frühere Arbeiten testeten zudem regelbasierte KI-Planung gegen die Einschätzung von Spezialisten. Eine Proof-of-Concept-Studie aus dem Jahr 2023 erzeugte für jeden von 28 Patienten fünf mögliche Wege.
Vier erfahrene Ärzte bewerteten 140 Wege. Der Computer und die Ärzte vergaben in 57,9 Prozent der Fälle identische Bewertungen, und alle 28 vom Algorithmus ausgewählten besten Wege wurden als sicher eingestuft.
Neuere Forschung hat diesen Vergleich erweitert. Der Trajectory Recommendation Algorithm for CT-guided Biopsy, bekannt als TRAX, erzeugt und bewertet rund 20.000 mögliche Wege, nachdem ein Arzt das Ziel identifiziert hat.
In einem TRAX-Vergleich mit 53 Patienten bewerteten verblindete Radiologen jeden von der KI und jedem von Ärzten ausgewählten Weg als sicher. In 58 Prozent der Vergleiche waren die Bewertungen identisch.
Die Gutachter bevorzugten TRAX in 23 Prozent der Fälle und den ärztlichen Weg in 19 Prozent. Der Unterschied war statistisch nicht signifikant, doch die TRAX-Wege waren im Durchschnitt etwas kürzer.
TRAX wählte außerdem mehr Wege außerhalb der üblichen axialen Ebene. Die Hälfte seiner Wege nutzte eine angewinkelte Ebene, während 81,1 Prozent der ärztlichen Wege axial blieben.
Diese Studien ergeben keinen einfachen Wettbewerb mit einem eindeutigen Gewinner. Ihre Eingaben, Definitionen, Datensätze und Schwellenwerte für die Wegübereinstimmung unterscheiden sich.
Ein speziell entwickeltes System kann anatomische Einschränkungen kodieren, Distanzen quantifizieren und Tausende Wege konsistent bewerten. Ein multimodales Sprachmodell bietet größere Flexibilität, ist jedoch stärker von Bildaufbereitung, Prompting und menschlicher Interpretation abhängig.
Die Rolle von GPT-4 könnte daher eher der eines Planungsassistenten als die einer Trajektorien-Engine sein. Es könnte Klinikern helfen, Optionen zu vergleichen, übersehene Ansätze zu erkennen oder die Gründe für eine Auswahl zu dokumentieren.
Auch diese unterstützende Rolle erfordert Schutzmechanismen. Die Schnittstelle muss Modellvorschläge von freigegebenen Plänen unterscheiden, den vollständigen anatomischen Verlauf anzeigen und eine Dokumentation der menschlichen Prüfung bewahren.
Der entscheidende Wettbewerb lautet nicht KI gegen Radiologen. Es geht um automatisierte geometrische Vorschläge gegenüber der umfassenden klinischen Beurteilung, die erforderlich ist, um aus einer Linie auf einem Bild einen sicheren Eingriff zu machen.
Die Planung von Lungenbiopsien mit GPT-4 benötigt weiterhin prospektive Validierung
Die nächsten Nachweise müssen Reproduzierbarkeit, dreidimensionale Leistung und Patientennutzen zeigen – nicht nur erneut einen hohen Anteil umsetzbarer Vorschläge.
Das erste zu beobachtende Signal ist die Reproduzierbarkeit. Forschende sollten identische Fälle in kontrollierten Sitzungen wiederholen und messen, wie häufig das Modell denselben Weg auswählt.
Sie sollten außerdem jeden Prompt und jede Bedingung für Folgeanfragen standardisieren. Bleibt eine menschliche Korrektur notwendig, müssen Studien dokumentieren, wie oft sie erfolgt und wie stark sie die Empfehlung verändert.
Ein reproduzierbares System würde die Argumente für den Einsatz generativer KI in einem formalen Planungsworkflow stärken. Große Unterschiede zwischen einzelnen Durchläufen würden sie schwächen, selbst wenn Gutachter die meisten Einzelergebnisse als plausibel einstufen.
Das zweite Signal ist eine native dreidimensionale Analyse. Künftige Systeme benötigen Zugriff auf vollständige CT-Volumina statt auf manuell ausgewählte PNG-Bilder.
Dieser Workflow sollte die Läsion, Lungen, Gefäße, Rippen, Fissuren, das Mediastinum und andere relevante Strukturen automatisch segmentieren. Er sollte zudem explizite Sicherheitsabstände berechnen und den gesamten Verlauf darstellen.
Die Kombination eines Sprachmodells mit spezialisierter medizinischer Segmentierung könnte einige künstliche Vorbereitungsschritte der aktuellen Studie adressieren. Zugleich entstünden neue Integrationsrisiken, die separat validiert werden müssten.
Die dreidimensionale Analyse muss unterschiedliche Scanner, Rekonstruktionseinstellungen, Patientenpositionen und Läsionslagen bewältigen. Multizentrische Daten wären entscheidend, da sich die Leistung an einem Krebszentrum möglicherweise nicht auf andere Krankenhäuser übertragen lässt.
Das dritte Signal ist ein prospektiver klinischer Vergleich. Eine solche Studie würde KI-gestützte Pläne vor Eingriffen bewerten, während qualifizierte Radiologen weiterhin für jede endgültige Entscheidung verantwortlich blieben.
Forschende könnten diagnostische Ausbeute, Pneumothorax, Blutungen, Eingriffsdauer, Strahlenexposition, Neupositionierung der Nadel und Erholungszeit vergleichen. Nicht erfolgreiche Empfehlungen sollten getrennt ausgewiesen werden, statt sie durch Durchschnittswerte zu verschleiern.
Prospektive Tests sollten vorsichtig beginnen. Ein Schattenmodus könnte Empfehlungen erzeugen, ohne die Versorgung zu beeinflussen, sodass Forschende KI-Pläne unter realen Bedingungen mit tatsächlichen Entscheidungen vergleichen können.
Spätere Studien könnten bewerten, ob Kliniker mit dem System bessere oder konsistentere Pläne erstellen. Jeder Schritt hin zu einer direkten robotischen Ausführung würde wesentlich stärkere Evidenz und eine Aufsicht auf Geräteebene erfordern.
Die Studie mit 30 Fällen liefert keine Antwort zur diagnostischen Ausbeute, da die vorgeschlagenen Wege nicht genutzt wurden. Sie kann auch nicht zeigen, ob ein kürzerer Weg die beobachteten geringfügigen Komplikationen reduziert hätte.
Ihr Wert liegt darin, zu zeigen, dass ein allgemeines multimodales Modell an einer eng begrenzten Planungsaufgabe teilnehmen kann. Dieses Ergebnis rechtfertigt bessere Experimente, nicht einen unmittelbaren klinischen Einsatz.
Der eigentliche Fortschritt ist eine überprüfbare Planungshypothese
Diese Machbarkeitsstudie macht die Trajektorienplanung mit generativer KI zu einer messbaren Forschungsfrage und belässt die klinische Verantwortung eindeutig bei Spezialisten.
GPT-4 identifizierte Wege, die unabhängige Experten in 28 von 30 historischen Fällen als angemessen bewerteten. Sein medianer vorgeschlagener Weg durchquerte 18 Millimeter weniger Lungengewebe als die tatsächlich ausgeführten manuellen Wege.
Diese Zahlen machen die Methode untersuchenswert. Sie stehen jedoch neben zwei abgelehnten Plänen, manueller Bildaufbereitung, nicht standardisierten Folge-Prompts und einer zweidimensionalen Darstellung dreidimensionaler Anatomie.
Die hilfreichste Interpretation ist weder Ablehnung noch Feier. Ein KI-Modell für allgemeine Zwecke erkannte genug visuelle und prozedurale Struktur, um plausible Alternativen vorzuschlagen, verfügte jedoch nicht über den vollständigen Kontext, der für eine verlässliche Planung erforderlich ist.
Für Radiologen weist die Studie auf Entscheidungshilfen hin, die Trajektorien vergleichen, statt klinisches Urteil zu ersetzen. Für Teams im Bereich medizinischer KI definiert sie die noch fehlende technische Arbeit zwischen einem Chatbot-Experiment und validierter Software.
Für Krankenhäuser und Patienten sollte der Maßstab ergebnisorientiert bleiben. Verbessert KI-Unterstützung die Gewebeentnahme, reduziert sie Komplikationen, verkürzt sie Eingriffe oder macht sie die Expertenplanung in verschiedenen Versorgungskontexten konsistenter?
Die nächsten Studien sollten diese Fragen mit kontrollierten Systemen, vollständigen CT-Volumina, externen Datensätzen und prospektiver klinischer Bewertung beantworten. Bis dahin bleibt die Planung von Lungenbiopsien mit GPT-4 eine interessante Zweitmeinung zu einem vorbereiteten Bild, nicht jedoch ein Navigator für eine Nadel im laufenden Eingriff.



