La planification de biopsies pulmonaires avec GPT-4 a identifié des trajectoires d’aiguille plus courtes, mais deux ont échoué à l’examen
La planification de biopsies pulmonaires avec GPT-4 a produit des trajectoires d’aiguille jugées acceptables dans 28 cas sur 30, mais les deux échecs ont révélé une importante lacune de sécurité. Le modèle travaillait à partir d’images CT annotées en deux dimensions, sans contrôler une aiguille ni évaluer les patients durant des procédures en direct.
Des chercheurs du Memorial Sloan Kettering Cancer Center ont évalué rétrospectivement si GPT-4 pouvait recommander des angles d’entrée pour des biopsies pulmonaires guidées par CT. Des radiologues indépendants ont jugé que 93,3 % de ses trajectoires proposées étaient adéquates pour réaliser une biopsie.
Les trajectoires de l’IA traversaient une médiane de 5 millimètres de tissu pulmonaire, contre 23 millimètres pour les trajectoires précédemment choisies par des cliniciens expérimentés. Toutefois, plus court ne signifie pas automatiquement plus sûr. Une trajectoire rejetée traversait quatre fois plus de tissu pulmonaire que la trajectoire manuelle correspondante, tandis qu’une autre créait un problème potentiel de stabilité de l’aiguille.
Cette tension compte davantage que le pourcentage mis en avant. L’étude suggère qu’un modèle multimodal généraliste peut interpréter une image médicale soigneusement préparée et produire un plan géométrique plausible. Elle ne démontre pas que GPT-4 améliore les résultats, réduit les complications ou peut planifier des biopsies sans une préparation et une supervision humaines poussées.
Ce que l’étude sur la planification de biopsies pulmonaires avec GPT-4 a réellement évalué
L’expérience a évalué des angles d’entrée proposés sur des images historiques, et non des procédures sur des patients guidées par l’IA.
L’étude en accès libre est parue dans CVIR Oncology et portait sur 30 procédures consécutives de biopsie pulmonaire. Les chercheurs ont utilisé des images désidentifiées de procédures déjà réalisées par trois radiologues interventionnels.
Chaque clinicien possédait au moins dix ans d’expérience. La cohorte de patients comptait 17 hommes et 13 femmes, avec un âge médian de 65 ans. Les nodules pulmonaires mesuraient entre 5 et 45 millimètres de diamètre, pour un diamètre médian de 21 millimètres.
L’échantillon comprenait cinq lésions apicales, sept lésions sous-pleurales, trois lésions paramédiastinales et quatre lésions proches de la base pulmonaire. Ces localisations introduisaient différents défis de planification liés aux côtes, aux vaisseaux, au tissu pulmonaire et à la stabilité de l’aiguille.
Une biopsie pulmonaire guidée par CT exige qu’un médecin fasse progresser une aiguille à travers la paroi thoracique jusqu’à une lésion suspecte. La trajectoire doit atteindre un tissu adapté au diagnostic tout en évitant les os, les scissures pulmonaires, le médiastin et les principaux vaisseaux sanguins.
La planification tient également compte de la quantité de tissu pulmonaire normal traversée par l’aiguille. Des trajets intrapulmonaires plus longs peuvent exposer davantage de tissu, bien que la longueur de la trajectoire ne représente qu’un élément du risque procédural.
L’étude n’a pas fourni à GPT-4 un examen CT non modifié. Un chercheur a sélectionné une image axiale, l’a recadrée et agrandie, puis y a ajouté une grille radiale avec GIMP. L’image a été convertie depuis son format médical d’origine en fichier PNG.
Un auteur a ensuite marqué la cible d’un cercle bleu et délimité les structures sensibles en rouge. Ces annotations fournissaient au modèle des informations qu’un système déployable devrait à terme identifier automatiquement.
Les chercheurs ont fourni cinq critères de planification au moyen d’un prompt standardisé. La trajectoire demandée devait atteindre la cible, réduire le trajet dans le tissu pulmonaire et éviter les os, les scissures et le médiastin.
Chaque cas débutait dans une nouvelle session de chat. Les chercheurs pouvaient poursuivre les prompts lorsque la première réponse ne traitait pas toutes les conditions. Le modèle a nécessité une médiane de deux itérations, avec un intervalle interquartile de une à trois.
L’équipe a consigné la première réponse intégrant tous les paramètres demandés. Deux radiologues interventionnels expérimentés, dont aucun n’avait participé aux procédures initiales, ont évalué indépendamment les trajectoires obtenues sans connaître leur origine.
Cette configuration distingue la faisabilité de la performance clinique. Le modèle a proposé des angles après que des experts humains eurent choisi l’image, marqué la cible, identifié les dangers et formulé les règles. Un radiologue demeurait nécessaire à chaque étape importante.
L’étude a donc examiné une question restreinte : un modèle multimodal généraliste peut-il générer un angle d’entrée plausible à partir d’une image préparée ? Elle n’a pas évalué la segmentation autonome, la planification en trois dimensions, la navigation en direct ni le contrôle robotisé d’une aiguille.
Cette distinction évite de transformer une expérience de planification prometteuse en affirmation non étayée sur la chirurgie automatisée.
Les trajectoires plus courtes ont produit le signal le plus fort de l’étude
GPT-4 a proposé des trajets nettement plus courts à travers le tissu pulmonaire, mais l’étude n’a pas établi que ces trajets amélioraient la sécurité clinique.
Les évaluateurs indépendants ont jugé adéquates pour la biopsie 28 des 30 trajectoires proposées par le modèle. Ce résultat a produit le chiffre de faisabilité de 93,3 % mis en avant par l’étude.
Les trajectoires générées par l’IA traversaient une médiane de 5 millimètres de tissu pulmonaire. L’intervalle interquartile allait de 0 à 25 millimètres.
À titre de comparaison, les trajectoires manuelles utilisées lors des procédures réalisées traversaient une médiane de 23 millimètres. Leur intervalle interquartile allait de 5 à 57 millimètres.
La différence était statistiquement significative, avec une valeur p rapportée de 0,0063. Les trajectoires ne traversant aucun tissu pulmonaire concernaient des nodules sous-pleuraux, situés près de la surface pleurale.
Une trajectoire directe vers une telle lésion peut éviter de traverser le parenchyme pulmonaire normal, le tissu fonctionnel impliqué dans les échanges gazeux. Cela rend une trajectoire courte géométriquement attrayante, mais la géométrie seule ne peut définir la meilleure approche clinique.
L’angle d’entrée moyen de l’IA était de 179 degrés, contre 174 degrés pour les trajectoires utilisées par les cliniciens. Cette différence n’était pas statistiquement significative.
Des moyennes similaires ne signifiaient pas que le modèle reproduisait les décisions humaines. Selon les résultats principaux, seuls huit des 30 cas présentaient une bonne concordance selon la comparaison définie par l’étude.
Les auteurs définissaient une correspondance par des angles d’entrée à moins de dix degrés l’un de l’autre et une trajectoire similaire à travers les plans tissulaires. Ailleurs, ils ont signalé une interprétation encore plus stricte, ne retenant que trois cas concordants, ce qui souligne la sensibilité à la définition choisie.
Cette divergence mérite attention, car les moyennes centrales peuvent masquer des différences importantes au niveau de chaque cas. Deux groupes de trajectoires peuvent présenter des angles moyens similaires tout en divergeant largement pour des patients individuels.
L’IA semblait donc trouver des trajectoires alternatives, plutôt que simplement imiter les procédures réalisées. Certaines alternatives paraissaient plus courtes et demeuraient acceptables aux yeux des évaluateurs. D’autres révélaient des faiblesses que le résultat agrégé pouvait facilement dissimuler.
La comparaison était également structurellement inégale. Les trajectoires manuelles avaient été exécutées avec succès sur des patients, alors que les trajectoires de l’IA n’existaient que sous la forme de lignes tracées sur des images de planification.
Une trajectoire proposée peut paraître raisonnable sur une coupe axiale tout en devenant impraticable lorsqu’elle est évaluée sur des coupes adjacentes. Les procédures réelles doivent tenir compte des mouvements respiratoires, de la position du corps, de l’ancrage de l’aiguille, des contraintes de l’équipement et de l’évolution de l’anatomie.
Les procédures initiales n’ont entraîné aucune complication majeure. Quatre patients ont développé un pneumothorax minime résolu sans intervention, et deux ont présenté une hémoptysie légère et spontanément résolutive.
Ces résultats ne peuvent être attribués à l’IA, car le modèle n’a pas guidé les procédures. Les chercheurs n’ont pas non plus simulé si l’utilisation de ses trajectoires aurait modifié ces complications.
Le résultat sur les trajectoires plus courtes constitue donc une hypothèse utile. Il justifie de tester si la planification automatisée peut révéler des parcours que les cliniciens pourraient négliger, en particulier lorsqu’il existe plusieurs options géométriquement valides.
Il ne permet pas d’affirmer que GPT-4 a rendu les biopsies pulmonaires plus sûres. Établir cette affirmation exige des études prospectives comparant les résultats cliniques dans des conditions contrôlées.
Deux trajectoires rejetées montrent pourquoi la plus courte n’est pas toujours la plus sûre
Les échecs du modèle révèlent un conflit entre l’optimisation d’un indicateur visible et la compréhension du comportement d’une aiguille lors d’une biopsie réelle.
Dans le cas 19, GPT-4 a suggéré une trajectoire traversant 20 millimètres de tissu pulmonaire. La trajectoire manuelle n’en traversait que 5 millimètres.
La recommandation de l’IA parcourait donc une distance quatre fois plus grande à travers le tissu pulmonaire, contrairement à l’objectif d’optimisation fourni dans le prompt. Elle renvoyait également une large plage d’angles d’entrée possibles plutôt qu’un plan précis et clairement privilégié.
Les évaluateurs ont considéré la trajectoire théoriquement réalisable, mais non représentative d’une bonne pratique clinique. Cette distinction illustre l’écart entre éviter les obstacles évidents et produire un plan procédural fiable.
Le cas 27 a révélé un problème différent. La cible était un nodule sous-pleural, ce qui signifie qu’il se situait près de la surface externe du poumon.
La trajectoire proposée par l’IA traversait inutilement 5 millimètres de tissu pulmonaire. Les évaluateurs ont également soulevé des inquiétudes concernant la stabilité de l’aiguille.
Une trajectoire très courte à travers un tissu de soutien peut laisser une aiguille de biopsie coaxiale insuffisamment ancrée. L’aiguille peut alors être plus vulnérable aux mouvements ou au déplacement durant le prélèvement.
Cela crée le compromis central de l’étude. Réduire la distance parcourue dans le tissu pulmonaire normal semble intrinsèquement bénéfique, mais une trajectoire stable peut nécessiter suffisamment d’engagement dans les tissus pour maintenir fermement l’aiguille.
Le modèle a reçu des règles simplifiées plutôt qu’une représentation complète de la pratique procédurale. Il pouvait rechercher un angle satisfaisant ces règles sans comprendre toutes les raisons pour lesquelles un radiologue pourrait choisir une approche moins directe.
Les chercheurs ont reconnu que l’analyse restait bidimensionnelle. Les radiologues humains font normalement défiler plusieurs coupes CT et utilisent des reconstructions multiplanaires afin de comprendre l’anatomie en trois dimensions.
Une seule image axiale ne peut pas représenter entièrement les structures s’étendant au-dessus ou au-dessous de ce plan. Elle ne peut pas non plus montrer comment une ligne apparemment dégagée évolue sur l’ensemble du trajet tridimensionnel de l’aiguille.
Les images étaient annotées manuellement avant d’être transmises à GPT-4. Le modèle n’a pas localisé indépendamment chaque lésion, segmenté les organes ni défini de manière fiable les marges de sécurité autour de l’anatomie critique.
L’étude a également omis une marge minimale spécifiée de cinq millimètres par rapport aux faisceaux neurovasculaires sous-claviers et axillaires. Le positionnement des patients maintenait ces structures à l’écart des trajectoires évaluées, mais les futurs systèmes ne peuvent présumer de la même situation.
Le prompting a introduit une autre source de variabilité. Les chercheurs ont commencé par un prompt standardisé, mais les interactions de suivi n’étaient pas entièrement scénarisées lorsque le modèle omettait un critère.
Deux utilisateurs pourraient donc orienter le même modèle vers des réponses différentes. Un système de planification clinique nécessiterait un processus reproductible produisant des résultats auditables sans conversation improvisée.
Les cas ont été traités dans des sessions distinctes, ce qui a réduit la contamination entre les cas. Toutefois, l’étude n’a pas établi si des exécutions répétées sur la même image renverraient le même angle.
La cohérence est importante lorsqu’une recommandation influence une procédure invasive. Un système qui modifie son plan d’une exécution à l’autre doit disposer d’une méthode pour expliquer, classer et résoudre ces différences.
La version du modèle présente un autre défi. Les services d’IA généraliste évoluent au fil du temps, parfois sans exposer toutes les modifications techniques aux utilisateurs cliniques.
Un résultat obtenu avec une configuration de GPT-4 ne peut pas être automatiquement transposé à un modèle ultérieur. La validation médicale doit être rattachée à une version contrôlée du système, à des entrées définies et à un processus opératoire documenté.
Les systèmes conçus sur mesure replacent le modèle généraliste en perspective
Le résultat de GPT-4 est notable car il reposait sur un modèle généraliste, mais des algorithmes spécialisés offrent déjà des méthodes de planification plus structurées et reproductibles.
Une étude de planification de trajectoire de 2024 a évalué un logiciel conçu spécifiquement pour la biopsie pulmonaire transthoracique. Il associait la détection tridimensionnelle des lésions à l’optimisation bayésienne afin de proposer des trajectoires.
Ce système a été entraîné à partir de 2 147 nodules issus de 219 examens. Les chercheurs ont validé la détection des lésions sur 235 examens supplémentaires contenant 354 lésions.
Le modèle a atteint une aire rapportée sous la courbe caractéristique de fonctionnement du récepteur de 97,4 %. Sa sensibilité moyenne s’élevait à 93,5 %, tandis que sa spécificité moyenne atteignait 93,2 %.
Les chercheurs ont comparé les trajectoires proposées aux voies de biopsie réellement utilisées chez 150 patients. Une correspondance était définie par un écart angulaire inférieur à cinq degrés.
Le système a généré des trajectoires réalisables dans 85,3 % des cas évalués. Selon la définition de l’étude, 82 % correspondaient aux trajectoires réelles, avec un écart angulaire moyen de 2,30 degrés parmi les trajectoires concordantes.
Ce système traitait des tâches que GPT-4 n’a pas réalisées, notamment la segmentation tridimensionnelle et la détection des lésions. Il restait toutefois une évaluation rétrospective, et non une preuve d’une amélioration des résultats pour les patients.
Des travaux antérieurs ont également comparé une planification par IA fondée sur des règles au jugement de spécialistes. Une étude de preuve de concept publiée en 2023 a généré cinq trajectoires candidates pour chacun des 28 patients.
Quatre médecins expérimentés ont évalué 140 trajectoires. L’ordinateur et les médecins ont attribué des notes identiques dans 57,9 % des cas, et les 28 trajectoires jugées optimales par l’algorithme ont toutes été considérées comme sûres.
Des recherches plus récentes ont élargi cette comparaison. L’algorithme de recommandation de trajectoire pour la biopsie guidée par CT, connu sous le nom de TRAX, génère et classe environ 20 000 trajectoires candidates après qu’un médecin a identifié la cible.
Dans une comparaison de TRAX portant sur 53 patients, des radiologues en aveugle ont jugé sûres toutes les trajectoires sélectionnées par l’IA et par les médecins. Les évaluations étaient identiques dans 58 % des comparaisons.
Les évaluateurs ont préféré TRAX dans 23 % des cas et la trajectoire du médecin dans 19 % des cas. La différence n’était pas statistiquement significative, mais les trajectoires de TRAX étaient légèrement plus courtes en moyenne.
TRAX a également sélectionné davantage de trajectoires en dehors du plan axial standard. La moitié de ses trajectoires utilisaient un plan incliné, tandis que 81,1 % des trajectoires des médecins restaient axiales.
Ces études ne se résument pas à une compétition simple avec un seul vainqueur. Leurs données d’entrée, définitions, jeux de données et seuils de correspondance des trajectoires diffèrent.
Un système conçu à cette fin peut intégrer des contraintes anatomiques, quantifier les distances et classer de manière cohérente des milliers de trajectoires. Un modèle de langage multimodal offre davantage de flexibilité, mais dépend plus fortement de la préparation des images, des instructions et de l’interprétation humaine.
Le rôle de GPT-4 pourrait donc davantage s’apparenter à celui d’un assistant de planification qu’à celui d’un moteur de trajectoire. Il pourrait aider les cliniciens à comparer des options, à identifier des approches négligées ou à documenter les raisons d’un choix.
Même ce rôle de soutien exige des garde-fous. L’interface doit distinguer les suggestions du modèle des plans approuvés, afficher l’intégralité du trajet anatomique et conserver une trace de l’examen humain.
La compétition pertinente n’oppose pas l’IA aux radiologues. Elle oppose des suggestions géométriques automatisées au jugement clinique complet nécessaire pour transformer une ligne sur une image en procédure sûre.
La planification de biopsie pulmonaire par GPT-4 nécessite encore une validation prospective
Les prochaines données devront démontrer la répétabilité, les performances tridimensionnelles et un bénéfice pour les patients, plutôt qu’un nouveau pourcentage élevé de faisabilité.
Le premier signal à surveiller est la reproductibilité. Les chercheurs devraient réexécuter des cas identiques lors de sessions contrôlées et mesurer la fréquence à laquelle le modèle sélectionne la même trajectoire.
Ils devraient également standardiser chaque instruction et chaque condition de suivi. Si une correction humaine reste nécessaire, les études doivent enregistrer sa fréquence et l’ampleur de son impact sur la recommandation.
Un système reproductible renforcerait l’argument en faveur de l’utilisation de l’IA générative dans un flux de planification formalisé. De fortes variations entre les exécutions l’affaibliraient, même si les évaluateurs jugeaient plausibles la plupart des résultats individuels.
Le deuxième signal concerne l’analyse tridimensionnelle native. Les futurs systèmes devront accéder aux volumes CT complets plutôt qu’à des images PNG sélectionnées manuellement.
Ce flux de travail devrait segmenter automatiquement la lésion, les poumons, les vaisseaux, les côtes, les scissures, le médiastin et les autres structures pertinentes. Il devrait également calculer des marges de sécurité explicites et afficher l’ensemble de la trajectoire.
Associer un modèle de langage à une segmentation médicale dédiée pourrait résoudre une partie de la préparation artificielle employée dans l’étude actuelle. Cela créerait aussi de nouveaux risques d’intégration nécessitant une validation distincte.
L’analyse tridimensionnelle doit fonctionner avec différents scanners, paramètres de reconstruction, positions des patients et localisations des lésions. Des données multicentriques seraient essentielles, car les performances obtenues dans un centre anticancéreux peuvent ne pas être transposables à d’autres hôpitaux.
Le troisième signal est une comparaison clinique prospective. Une telle étude évaluerait les plans assistés par IA avant les procédures, tout en maintenant la responsabilité de chaque décision finale entre les mains de radiologues qualifiés.
Les chercheurs pourraient comparer le rendement diagnostique, le pneumothorax, les saignements, la durée de la procédure, l’exposition aux rayonnements, le repositionnement de l’aiguille et le temps de récupération. Ils devraient présenter séparément les recommandations infructueuses, plutôt que de laisser les moyennes les masquer.
Les tests prospectifs devraient commencer avec prudence. Un mode parallèle pourrait générer des recommandations sans influencer les soins, permettant aux chercheurs de comparer les plans de l’IA aux décisions réelles dans des conditions réelles.
Des essais ultérieurs pourraient évaluer si les cliniciens utilisant le système élaborent de meilleurs plans ou des plans plus cohérents. Toute évolution vers une exécution robotique directe exigerait des preuves nettement plus solides et une supervision au niveau du dispositif.
L’étude de 30 cas ne fournit aucune réponse sur le rendement diagnostique, car les trajectoires proposées n’ont pas été utilisées. Elle ne peut pas non plus montrer si une trajectoire plus courte aurait réduit les complications mineures observées.
Sa valeur tient à la démonstration qu’un modèle multimodal généraliste peut participer à un exercice de planification étroitement contraint. Cette conclusion justifie de meilleures expériences, pas un déploiement clinique immédiat.
La véritable avancée est une hypothèse de planification testable
Cette étude de faisabilité transforme la planification de trajectoire par IA générative en question de recherche mesurable, tout en laissant fermement la responsabilité clinique aux spécialistes.
GPT-4 a identifié des trajectoires que des experts indépendants ont jugées adéquates dans 28 des 30 cas historiques. Sa trajectoire médiane proposée traversait 18 millimètres de tissu pulmonaire de moins que les trajectoires manuelles réalisées.
Ces chiffres justifient d’étudier la méthode. Ils s’accompagnent toutefois de deux plans rejetés, d’une préparation manuelle des images, d’instructions de suivi non scriptées et d’une vision bidimensionnelle d’une anatomie tridimensionnelle.
L’interprétation la plus utile n’est ni le rejet ni la célébration. Un modèle d’IA généraliste a reconnu suffisamment de structure visuelle et procédurale pour proposer des alternatives plausibles, mais il ne disposait pas du contexte complet nécessaire à une planification fiable.
Pour les radiologues, l’étude ouvre la voie à une aide à la décision qui compare les trajectoires plutôt qu’elle ne remplace le jugement clinique. Pour les équipes d’IA médicale, elle définit le travail d’ingénierie encore nécessaire entre une expérimentation de chatbot et un logiciel validé.
Pour les hôpitaux et les patients, la norme doit rester fondée sur les résultats. L’assistance par IA améliore-t-elle les prélèvements tissulaires, réduit-elle les complications, raccourcit-elle les procédures ou rend-elle la planification experte plus cohérente selon les contextes de soins ?
Les prochaines études devraient répondre à ces questions avec des systèmes contrôlés, des volumes CT complets, des jeux de données externes et une évaluation clinique prospective. D’ici là, la planification de biopsie pulmonaire par GPT-4 reste un second avis intrigant sur une image préparée, et non un navigateur pour une aiguille en situation réelle.



