top of page

La planificación de biopsias pulmonares con GPT-4 encontró trayectorias de aguja más cortas, pero dos no superaron la revisión

hace 48 minutos
12 min de lectura

La planificación de biopsias pulmonares con GPT-4 produjo trayectorias de aguja propuestas aceptables en 28 de 30 casos, pero los dos fallos dejaron al descubierto una brecha de seguridad relevante. El modelo trabajó a partir de imágenes de CT bidimensionales y anotadas, en lugar de controlar una aguja o evaluar a pacientes durante procedimientos en tiempo real.

Investigadores del Memorial Sloan Kettering Cancer Center evaluaron retrospectivamente si GPT-4 podía recomendar ángulos de entrada para biopsias pulmonares guiadas por CT. Radiólogos independientes consideraron que el 93,3 por ciento de las trayectorias propuestas era adecuado para realizar una biopsia.

Las trayectorias de IA atravesaron una mediana de 5 milímetros de tejido pulmonar, frente a los 23 milímetros de las rutas seleccionadas previamente por clínicos experimentados. Sin embargo, más corto no significa automáticamente más seguro. Una trayectoria rechazada atravesó cuatro veces más tejido pulmonar que la ruta manual correspondiente, mientras que otra planteó un posible problema de estabilidad de la aguja.

Esa tensión importa más que el porcentaje del titular. El estudio sugiere que un modelo multimodal de propósito general puede interpretar una imagen médica cuidadosamente preparada y elaborar un plan geométrico plausible. No demuestra que GPT-4 mejore los resultados, reduzca las complicaciones o pueda planificar biopsias sin una amplia preparación y supervisión humanas.

Lo que realmente evaluó el estudio sobre la planificación de biopsias pulmonares con GPT-4

El experimento evaluó ángulos de entrada propuestos sobre imágenes históricas, no procedimientos guiados por IA en pacientes.

El estudio de acceso abierto apareció en CVIR Oncology e incluyó 30 procedimientos consecutivos de biopsia pulmonar. Los investigadores utilizaron imágenes desidentificadas de procedimientos realizados previamente por tres radiólogos intervencionistas.

Cada clínico tenía al menos diez años de experiencia. La cohorte de pacientes incluía 17 hombres y 13 mujeres, con una mediana de edad de 65 años. Los nódulos pulmonares tenían entre 5 y 45 milímetros de diámetro, con una mediana de 21 milímetros.

La muestra incluyó cinco lesiones apicales, siete lesiones subpleurales, tres lesiones paramediastínicas y cuatro lesiones cerca de la base pulmonar. Estas ubicaciones planteaban distintos retos de planificación relacionados con las costillas, los vasos sanguíneos, el tejido pulmonar y la estabilidad de la aguja.

Una biopsia pulmonar guiada por CT requiere que un médico avance una aguja a través de la pared torácica hasta una lesión sospechosa. La trayectoria debe alcanzar tejido adecuado para el diagnóstico y evitar huesos, fisuras pulmonares, el mediastino y los principales vasos sanguíneos.

La planificación también considera cuánto tejido pulmonar normal atraviesa la aguja. Las trayectorias intrapulmonares más largas pueden exponer más tejido, aunque la longitud de la ruta representa solo un elemento del riesgo procedimental.

El estudio no proporcionó a GPT-4 una exploración de CT sin modificar. Un investigador seleccionó una imagen axial, la recortó y amplió, y añadió una cuadrícula radial con GIMP. La imagen se convirtió de su formato médico original a un archivo PNG.

Uno de los autores marcó después el objetivo con un círculo azul y delimitó las estructuras sensibles en rojo. Estas anotaciones proporcionaron al modelo información que un sistema desplegable tendría que identificar automáticamente en el futuro.

Los investigadores suministraron cinco criterios de planificación mediante un prompt estandarizado. La trayectoria solicitada debía alcanzar el objetivo, reducir el recorrido por el tejido pulmonar y evitar huesos, fisuras y el mediastino.

Cada caso comenzó en una sesión de chat nueva. Los investigadores podían seguir introduciendo prompts cuando la primera respuesta no abordaba todas las condiciones. El modelo necesitó una mediana de dos iteraciones, con un rango intercuartílico de una a tres.

El equipo registró la primera respuesta que incorporó todos los parámetros solicitados. Dos radiólogos intervencionistas experimentados, ninguno involucrado en los procedimientos originales, revisaron de forma independiente las trayectorias resultantes sin conocer su origen.

Esta configuración separa la viabilidad del rendimiento clínico. El modelo propuso ángulos después de que expertos humanos eligieran la imagen, marcaran el objetivo, identificaran los riesgos y formularan las reglas. Un radiólogo siguió siendo necesario en cada etapa importante.

Por tanto, el estudio evaluó una pregunta acotada: ¿puede un modelo multimodal de propósito general generar un ángulo de entrada plausible a partir de una imagen preparada? No evaluó segmentación autónoma, planificación tridimensional, navegación en tiempo real ni control robótico de agujas.

Esta distinción impide que un experimento prometedor de planificación se convierta en una afirmación sin respaldo sobre cirugía automatizada.

Las trayectorias más cortas generaron la señal más sólida del estudio

GPT-4 propuso trayectorias mucho más cortas a través del tejido pulmonar, pero el estudio no estableció que esas trayectorias produjeran resultados clínicos más seguros.

Los revisores independientes calificaron como adecuadas para realizar la biopsia 28 de las 30 trayectorias propuestas por el modelo. Ese resultado dio lugar a la cifra de viabilidad del 93,3 por ciento del estudio.

Las trayectorias generadas por IA atravesaron una mediana de 5 milímetros de tejido pulmonar. El rango intercuartílico se extendió de 0 a 25 milímetros.

En comparación, las trayectorias manuales utilizadas en los procedimientos completados atravesaron una mediana de 23 milímetros. Su rango intercuartílico fue de 5 a 57 milímetros.

La diferencia fue estadísticamente significativa, con un valor p reportado de 0,0063. Las trayectorias sin atravesar tejido pulmonar correspondían a nódulos subpleurales, situados junto a la superficie pleural.

Una trayectoria directa hacia una lesión de este tipo puede evitar atravesar parénquima pulmonar normal, el tejido funcional implicado en el intercambio de gases. Eso hace que una ruta corta sea geométricamente atractiva, pero la geometría por sí sola no puede definir el mejor enfoque clínico.

El ángulo medio de entrada de la IA fue de 179 grados, frente a los 174 grados de las trayectorias utilizadas por los clínicos. Esa diferencia no fue estadísticamente significativa.

Promedios similares no significaban que el modelo reprodujera decisiones humanas. Solo ocho de los 30 casos mostraron buena concordancia según la comparación establecida en el estudio, de acuerdo con los resultados principales.

Los autores definieron una coincidencia como ángulos de entrada dentro de diez grados y una trayectoria similar a través de los planos tisulares. En otra parte, informaron una interpretación aún más estricta de coincidencia en tres casos, lo que pone de relieve la sensibilidad a la definición elegida.

Esta discrepancia merece atención porque los promedios centrales pueden ocultar diferencias sustanciales caso por caso. Dos grupos de trayectorias pueden tener ángulos medios similares y, aun así, divergir ampliamente en pacientes individuales.

Por tanto, la IA pareció encontrar trayectorias alternativas, no simplemente imitar los procedimientos completados. Algunas alternativas parecían más cortas y siguieron siendo aceptables para los revisores. Otras revelaron debilidades que el resultado agregado podía ocultar fácilmente.

La comparación también fue estructuralmente desigual. Las trayectorias manuales se habían ejecutado con éxito en pacientes, mientras que las rutas de IA solo existían como líneas dibujadas sobre imágenes de planificación.

Una trayectoria propuesta puede parecer razonable en un corte axial y, sin embargo, resultar impracticable al evaluarse en cortes adyacentes. Los procedimientos reales deben tener en cuenta el movimiento respiratorio, la posición corporal, el anclaje de la aguja, las limitaciones del equipo y los cambios anatómicos.

Los procedimientos originales no produjeron complicaciones graves. Cuatro pacientes desarrollaron neumotórax mínimo que se resolvió sin intervención, y dos experimentaron hemoptisis leve y autolimitada.

Estos resultados no pueden atribuirse a la IA porque el modelo no guió los procedimientos. Los investigadores tampoco simularon si el uso de sus trayectorias habría modificado esas complicaciones.

Por consiguiente, el resultado de las trayectorias más cortas es una hipótesis útil. Respalda evaluar si la planificación automatizada puede revelar rutas que los clínicos podrían pasar por alto, especialmente cuando existen varias opciones geométricamente válidas.

No permite afirmar que GPT-4 hizo más seguras las biopsias pulmonares. Establecer esa afirmación requiere estudios prospectivos que comparen resultados clínicos en condiciones controladas.

Dos trayectorias rechazadas muestran por qué la más corta no siempre es la más segura

Los fallos del modelo revelan un conflicto entre optimizar una métrica visible y comprender cómo se comporta una aguja durante una biopsia real.

En el Caso 19, GPT-4 sugirió una trayectoria que atravesaba 20 milímetros de tejido pulmonar. La ruta manual atravesaba solo 5 milímetros.

Por tanto, la recomendación de IA recorría cuatro veces más distancia a través del tejido pulmonar, contradiciendo el objetivo de optimización indicado en el prompt. También devolvió un amplio rango de posibles ángulos de entrada, en lugar de un plan preciso y claramente preferido.

Los revisores consideraron la trayectoria teóricamente viable, pero no representativa de una buena práctica clínica. Esa distinción refleja la brecha entre evitar obstáculos evidentes y producir un plan procedimental fiable.

El Caso 27 reveló un problema diferente. El objetivo era un nódulo subpleural, lo que significa que estaba cerca de la superficie externa del pulmón.

La trayectoria de IA propuesta atravesaba innecesariamente 5 milímetros de tejido pulmonar. Los revisores también plantearon preocupaciones sobre la estabilidad de la aguja.

Una ruta muy corta a través de tejido de soporte puede dejar una aguja coaxial de biopsia insuficientemente anclada. La aguja puede volverse más vulnerable al movimiento o al desplazamiento durante la toma de muestras.

Esto genera la disyuntiva central del estudio. Reducir la distancia a través de tejido pulmonar normal parece inherentemente beneficioso, pero una trayectoria estable puede requerir suficiente interacción con el tejido para sujetar la aguja de forma segura.

El modelo recibió reglas simplificadas en lugar de una representación completa de la práctica procedimental. Podía buscar un ángulo que cumpliera esas reglas sin comprender todos los motivos por los que un radiólogo podría elegir un enfoque menos directo.

Los investigadores reconocieron que el análisis seguía siendo bidimensional. Los radiólogos humanos normalmente recorren múltiples cortes de CT y utilizan reconstrucciones multiplanares para comprender la anatomía en tres dimensiones.

Una sola imagen axial no puede representar por completo las estructuras que se extienden por encima o por debajo de ese plano. Tampoco puede mostrar cómo una línea aparentemente despejada cambia a lo largo del recorrido tridimensional completo de la aguja.

Las imágenes se anotaron manualmente antes de llegar a GPT-4. El modelo no localizó de forma independiente cada lesión, no segmentó los órganos ni definió de manera fiable márgenes de seguridad alrededor de la anatomía crítica.

El estudio también omitió un margen mínimo especificado de cinco milímetros respecto de los haces neurovasculares subclavio y axilar. La posición de los pacientes mantenía esas estructuras alejadas de las trayectorias evaluadas, pero los sistemas futuros no pueden asumir la misma condición.

El prompting introdujo otra fuente de variabilidad. Los investigadores comenzaron con un prompt estandarizado, pero las interacciones de seguimiento no estaban totalmente guionizadas cuando el modelo omitía un criterio.

Por tanto, dos usuarios podrían orientar al mismo modelo hacia respuestas diferentes. Un sistema de planificación clínica necesitaría un proceso reproducible que genere resultados auditables sin conversaciones improvisadas.

Los casos se procesaron en sesiones separadas, lo que redujo la contaminación entre casos. Sin embargo, el estudio no estableció si ejecuciones repetidas sobre la misma imagen devolverían el mismo ángulo.

La consistencia importa cuando una recomendación afecta a un procedimiento invasivo. Un sistema que cambia su plan entre ejecuciones necesita un método para explicar, clasificar y resolver esas diferencias.

La versión del modelo plantea otro desafío. Los servicios de IA de propósito general cambian con el tiempo, a veces sin exponer a los usuarios clínicos cada modificación técnica.

Un resultado obtenido con una configuración de GPT-4 no puede transferirse automáticamente a un modelo posterior. La validación médica debe vincularse a una versión controlada del sistema, entradas definidas y un proceso operativo documentado.

Los sistemas diseñados específicamente sitúan al modelo general en perspectiva

El resultado de GPT-4 es notable porque utilizó un modelo generalista, pero los algoritmos especializados ya ofrecen métodos de planificación más estructurados y reproducibles.

Un estudio de planificación de trayectorias de 2024 evaluó software desarrollado específicamente para la biopsia pulmonar transtorácica. Combinó la detección tridimensional de lesiones con optimización bayesiana para proponer trayectorias.

Ese sistema se entrenó con 2.147 nódulos de 219 exploraciones. Los investigadores validaron la detección de lesiones con otras 235 exploraciones que contenían 354 lesiones.

El modelo logró un área bajo la curva característica operativa del receptor reportada del 97,4 por ciento. Su sensibilidad media fue del 93,5 por ciento, mientras que la especificidad media alcanzó el 93,2 por ciento.

Los investigadores compararon las trayectorias propuestas con las rutas de biopsia reales de 150 pacientes. Clasificaron una coincidencia como una diferencia angular inferior a cinco grados.

El sistema generó rutas viables en el 85,3 por ciento de los casos evaluados. El ochenta y dos por ciento coincidió con las trayectorias reales según la definición del estudio, con una desviación angular media de 2,30 grados entre las rutas coincidentes.

Ese sistema abordó tareas que GPT-4 no realizó, incluida la segmentación tridimensional y la detección de lesiones. Sin embargo, también se mantuvo como una evaluación retrospectiva, no como una prueba de mejores resultados para los pacientes.

Trabajos anteriores también probaron la planificación de IA basada en reglas frente al criterio de especialistas. Un estudio de prueba de concepto de 2023 generó cinco rutas candidatas para cada uno de 28 pacientes.

Cuatro médicos con experiencia evaluaron 140 trayectorias. La computadora y los médicos otorgaron puntuaciones idénticas en el 57,9 por ciento de los casos, y las 28 mejores trayectorias seleccionadas por el algoritmo se consideraron seguras.

Investigaciones más recientes han ampliado esa comparación. El Algoritmo de Recomendación de Trayectorias para Biopsia Guiada por TC, conocido como TRAX, genera y clasifica unas 20.000 rutas candidatas después de que un médico identifica el objetivo.

En una comparación de TRAX con 53 pacientes, radiólogos cegados calificaron como segura cada ruta seleccionada por la IA y por los médicos. Las valoraciones fueron idénticas en el 58 por ciento de las comparaciones.

Los revisores prefirieron TRAX en el 23 por ciento de los casos y la ruta del médico en el 19 por ciento. La diferencia no fue estadísticamente significativa, pero las rutas de TRAX fueron ligeramente más cortas en promedio.

TRAX también seleccionó más trayectorias fuera del plano axial estándar. La mitad de sus rutas utilizó un plano angulado, mientras que el 81,1 por ciento de las rutas de los médicos se mantuvo en el plano axial.

Estos estudios no producen una competición sencilla con un único ganador. Sus entradas, definiciones, conjuntos de datos y umbrales de coincidencia de rutas difieren.

Un sistema diseñado específicamente puede codificar restricciones anatómicas, cuantificar distancias y clasificar miles de rutas de forma coherente. Un modelo de lenguaje multimodal ofrece mayor flexibilidad, pero depende en mayor medida de la preparación de imágenes, las instrucciones y la interpretación humana.

Por tanto, el papel de GPT-4 podría estar más cerca del de un asistente de planificación que del de un motor de trayectorias. Podría ayudar a los clínicos a comparar opciones, identificar enfoques pasados por alto o documentar los motivos de una selección.

Incluso esa función de apoyo requiere salvaguardas. La interfaz debe distinguir las sugerencias del modelo de los planes aprobados, mostrar la ruta anatómica completa y conservar un registro de la revisión humana.

La competencia significativa no es entre la IA y los radiólogos. Es entre las sugerencias geométricas automatizadas y el juicio clínico integral necesario para convertir una línea en una imagen en un procedimiento seguro.

La planificación de biopsias pulmonares con GPT-4 aún necesita validación prospectiva

La próxima evidencia debe demostrar repetibilidad, rendimiento tridimensional y beneficio para los pacientes, en lugar de otro porcentaje elevado de viabilidad.

La primera señal que se debe observar es la reproducibilidad. Los investigadores deberían volver a ejecutar casos idénticos en sesiones controladas y medir con qué frecuencia el modelo selecciona la misma ruta.

También deberían estandarizar cada instrucción y condición de seguimiento. Si sigue siendo necesaria la corrección humana, los estudios deben registrar con qué frecuencia ocurre y cuánto modifica la recomendación.

Un sistema reproducible reforzaría el argumento a favor de utilizar IA generativa dentro de un flujo de trabajo formal de planificación. Una gran variación entre ejecuciones lo debilitaría, incluso si los revisores consideraran plausibles la mayoría de los resultados individuales.

La segunda señal es el análisis tridimensional nativo. Los sistemas futuros necesitan acceso a volúmenes completos de TC, en lugar de imágenes PNG seleccionadas manualmente.

Ese flujo de trabajo debería segmentar automáticamente la lesión, los pulmones, los vasos, las costillas, las fisuras, el mediastino y otras estructuras relevantes. También debería calcular márgenes de seguridad explícitos y mostrar la ruta completa.

Combinar un modelo de lenguaje con segmentación médica especializada podría abordar parte de la preparación artificial del estudio actual. También crearía nuevos riesgos de integración que requieren validación independiente.

El análisis tridimensional debe manejar distintos escáneres, configuraciones de reconstrucción, posiciones de los pacientes y ubicaciones de las lesiones. Los datos multicéntricos serían esenciales porque el rendimiento en un centro oncológico puede no trasladarse a otros hospitales.

La tercera señal es una comparación clínica prospectiva. Un estudio de este tipo evaluaría planes asistidos por IA antes de los procedimientos, manteniendo a radiólogos cualificados como responsables de cada decisión final.

Los investigadores podrían comparar el rendimiento diagnóstico, el neumotórax, el sangrado, la duración del procedimiento, la exposición a radiación, el reposicionamiento de la aguja y el tiempo de recuperación. Deberían informar por separado las recomendaciones fallidas, en lugar de dejar que los promedios las oculten.

Las pruebas prospectivas deberían comenzar con cautela. Un modo en la sombra podría generar recomendaciones sin influir en la atención, permitiendo a los investigadores comparar los planes de IA con las decisiones reales en condiciones clínicas activas.

Ensayos posteriores podrían evaluar si los clínicos que utilizan el sistema elaboran planes mejores o más consistentes. Cualquier avance hacia la ejecución robótica directa requeriría evidencia sustancialmente más sólida y supervisión a nivel de dispositivo.

El estudio de 30 casos no ofrece respuesta sobre el rendimiento diagnóstico porque las rutas propuestas no se utilizaron. Tampoco puede mostrar si una ruta más corta habría reducido las complicaciones menores observadas.

Su valor reside en establecer que un modelo multimodal generalista puede participar en un ejercicio de planificación estrechamente restringido. Ese hallazgo justifica mejores experimentos, no un despliegue clínico inmediato.

El verdadero avance es una hipótesis de planificación comprobable

Este estudio de viabilidad convierte la planificación de trayectorias con IA generativa en una cuestión de investigación medible, mientras mantiene la responsabilidad clínica firmemente en manos de los especialistas.

GPT-4 identificó rutas que expertos independientes consideraron adecuadas en 28 de 30 casos históricos. Su ruta propuesta mediana atravesó 18 milímetros menos de tejido pulmonar que las rutas manuales completadas.

Estas cifras hacen que valga la pena investigar el método. También coexisten con dos planes rechazados, preparación manual de imágenes, instrucciones de seguimiento no guionizadas y una vista bidimensional de una anatomía tridimensional.

La interpretación más útil no es ni el rechazo ni la celebración. Un modelo de IA de propósito general reconoció suficiente estructura visual y procedimental como para sugerir alternativas plausibles, pero carecía del contexto completo necesario para una planificación fiable.

Para los radiólogos, el estudio apunta hacia un apoyo a la toma de decisiones que compare trayectorias en lugar de sustituir el juicio clínico. Para los equipos de IA médica, define el trabajo de ingeniería que aún falta entre un experimento con chatbot y software validado.

Para los hospitales y los pacientes, el estándar debe seguir basándose en los resultados. ¿La asistencia de IA mejora la toma de muestras de tejido, reduce las complicaciones, acorta los procedimientos o hace que la planificación experta sea más consistente en distintos entornos asistenciales?

Los próximos estudios deberían responder a esas preguntas con sistemas controlados, volúmenes completos de TC, conjuntos de datos externos y evaluación clínica prospectiva. Hasta entonces, la planificación de biopsias pulmonares con GPT-4 sigue siendo una intrigante segunda opinión sobre una imagen preparada, no un navegador para una aguja en tiempo real.

 
 

Empieza gratis

Un asistente de IA local-first con gestión del conocimiento personal

Para ofrecer una mejor experiencia con la IA,

actualmente remio solo es compatible con Windows 10+ (x64) y M-Chip Macs.

Tu aliado de IA para el trabajo
Haz más con remio

Planifica. Crea. Entrega.
Todo en un solo lugar.

bottom of page