top of page

Planejamento de Biópsia Pulmonar com GPT-4 Encontrou Trajetos de Agulha Mais Curtos, mas Duas Propostas Não Passaram na Revisão

há 16 minutos
12 min de leitura

O planejamento de biópsia pulmonar com GPT-4 produziu trajetos de agulha considerados aceitáveis em 28 de 30 casos, mas as duas falhas expuseram uma lacuna relevante de segurança. O modelo trabalhou com imagens de TC bidimensionais e anotadas, em vez de controlar uma agulha ou avaliar pacientes durante procedimentos ao vivo.

Pesquisadores do Memorial Sloan Kettering Cancer Center testaram retrospectivamente se o GPT-4 poderia recomendar ângulos de entrada para biópsias pulmonares guiadas por TC. Radiologistas independentes avaliaram que 93,3% dos trajetos propostos eram adequados para realizar uma biópsia.

As rotas da IA atravessaram uma mediana de 5 milímetros de tecido pulmonar, em comparação com 23 milímetros nas rotas previamente escolhidas por clínicos experientes. No entanto, mais curto não significa automaticamente mais seguro. Uma rota rejeitada atravessava quatro vezes mais tecido pulmonar do que a rota manual correspondente, enquanto outra criava um possível problema de estabilidade da agulha.

Essa tensão importa mais do que o percentual de destaque. O estudo sugere que um modelo multimodal de propósito geral pode interpretar uma imagem médica cuidadosamente preparada e produzir um plano geométrico plausível. Ele não demonstra que o GPT-4 melhora os desfechos, reduz complicações ou consegue planejar biópsias sem ampla preparação e supervisão humanas.

O Que o Estudo sobre Planejamento de Biópsia Pulmonar com GPT-4 Realmente Testou

O experimento avaliou ângulos de entrada propostos em imagens históricas, não procedimentos guiados por IA em pacientes.

O estudo de acesso aberto foi publicado na CVIR Oncology e envolveu 30 procedimentos consecutivos de biópsia pulmonar. Os pesquisadores usaram imagens desidentificadas de procedimentos já realizados por três radiologistas intervencionistas.

Cada clínico tinha pelo menos dez anos de experiência. A coorte de pacientes incluía 17 homens e 13 mulheres, com idade mediana de 65 anos. Os nódulos pulmonares variavam de 5 a 45 milímetros de diâmetro, com diâmetro mediano de 21 milímetros.

A amostra incluiu cinco lesões apicais, sete lesões subpleurais, três lesões paramediastinais e quatro lesões próximas à base pulmonar. Essas localizações apresentavam diferentes desafios de planejamento envolvendo costelas, vasos, tecido pulmonar e estabilidade da agulha.

Uma biópsia pulmonar guiada por TC exige que um médico avance uma agulha através da parede torácica até uma lesão suspeita. A rota deve alcançar tecido adequado para diagnóstico, evitando ossos, fissuras pulmonares, o mediastino e grandes vasos sanguíneos.

O planejamento também considera quanto tecido pulmonar normal a agulha atravessa. Trajetos intrapulmonares mais longos podem expor mais tecido, embora o comprimento da rota represente apenas um elemento do risco do procedimento.

O estudo não forneceu ao GPT-4 um exame de TC sem modificações. Um pesquisador selecionou uma imagem axial, recortou-a e ampliou-a, além de adicionar uma grade radial usando o GIMP. A imagem foi convertida de seu formato médico original para um arquivo PNG.

Um dos autores então marcou o alvo com um círculo azul e delineou estruturas sensíveis em vermelho. Essas anotações forneceram ao modelo informações que um sistema implementável eventualmente precisaria identificar automaticamente.

Os pesquisadores forneceram cinco critérios de planejamento por meio de um prompt padronizado. O trajeto solicitado precisava alcançar o alvo, reduzir o percurso pelo tecido pulmonar e evitar ossos, fissuras e o mediastino.

Cada caso começou em uma nova sessão de chat. Os pesquisadores podiam continuar o prompt quando a primeira resposta não atendia a todas as condições. O modelo exigiu uma mediana de duas iterações, com intervalo interquartil de uma a três.

A equipe registrou a primeira resposta que incorporava todos os parâmetros solicitados. Dois radiologistas intervencionistas experientes, nenhum deles envolvido nos procedimentos originais, revisaram independentemente os trajetos resultantes sem saber sua origem.

Essa configuração separa viabilidade de desempenho clínico. O modelo propôs ângulos depois que especialistas humanos escolheram a imagem, marcaram o alvo, identificaram riscos e formularam as regras. Um radiologista continuou sendo necessário em cada etapa importante.

Portanto, o estudo testou uma questão restrita: um modelo multimodal de propósito geral consegue gerar um ângulo de entrada plausível a partir de uma imagem preparada? Ele não testou segmentação autônoma, planejamento tridimensional, navegação ao vivo ou controle robótico de agulha.

Essa distinção impede que um experimento promissor de planejamento se transforme em uma alegação sem respaldo sobre cirurgia automatizada.

As Rotas Mais Curtas Produziram o Sinal Mais Forte do Estudo

O GPT-4 propôs trajetos muito mais curtos pelo tecido pulmonar, mas o estudo não estabeleceu que esses trajetos geraram desfechos clínicos mais seguros.

Revisores independentes classificaram 28 das 30 rotas propostas pelo modelo como adequadas para realizar a biópsia. Esse resultado gerou o índice de viabilidade de 93,3% do estudo.

Os trajetos gerados pela IA atravessaram uma mediana de 5 milímetros de tecido pulmonar. O intervalo interquartil se estendeu de 0 a 25 milímetros.

Em comparação, os trajetos manuais usados nos procedimentos concluídos atravessaram uma mediana de 23 milímetros. Seu intervalo interquartil foi de 5 a 57 milímetros.

A diferença foi estatisticamente significativa, com valor de p relatado de 0,0063. Os trajetos sem travessia de tecido pulmonar envolveram nódulos subpleurais, localizados junto à superfície pleural.

Um trajeto direto até uma lesão desse tipo pode evitar a travessia do parênquima pulmonar normal, o tecido funcional envolvido nas trocas gasosas. Isso torna uma rota curta geometricamente atraente, mas a geometria por si só não pode definir a melhor abordagem clínica.

O ângulo médio de entrada da IA foi de 179 graus, em comparação com 174 graus nas rotas usadas pelos clínicos. Essa diferença não foi estatisticamente significativa.

Médias semelhantes não significavam que o modelo reproduziu decisões humanas. Apenas oito dos 30 casos apresentaram boa concordância segundo a comparação estabelecida pelo estudo, de acordo com os resultados principais.

Os autores definiram uma correspondência como ângulos de entrada com diferença de até dez graus e um trajeto semelhante pelos planos de tecido. Em outra parte, relataram uma interpretação ainda mais rigorosa de correspondência em três casos, destacando a sensibilidade à definição escolhida.

Essa discrepância merece atenção porque médias centrais podem ocultar diferenças substanciais em nível de caso. Dois grupos de trajetos podem ter ângulos médios semelhantes, mas divergir amplamente entre pacientes individuais.

Assim, a IA pareceu encontrar rotas alternativas, e não apenas imitar os procedimentos concluídos. Algumas alternativas pareciam mais curtas e continuaram aceitáveis para os revisores. Outras expuseram fragilidades que o resultado agregado poderia facilmente esconder.

A comparação também era estruturalmente desigual. As rotas manuais haviam sido executadas com sucesso em pacientes, enquanto as rotas da IA existiam apenas como linhas desenhadas sobre imagens de planejamento.

Uma rota proposta pode parecer razoável em um corte axial, mas tornar-se impraticável quando avaliada em cortes adjacentes. Procedimentos reais devem considerar movimento respiratório, posição do corpo, fixação da agulha, limitações do equipamento e anatomia em mudança.

Os procedimentos originais não produziram complicações graves. Quatro pacientes desenvolveram pneumotórax mínimo que se resolveu sem intervenção, e dois tiveram hemoptise leve e autolimitada.

Esses desfechos não podem ser atribuídos à IA porque o modelo não guiou os procedimentos. Os pesquisadores também não simularam se o uso de suas rotas teria alterado essas complicações.

O resultado de trajetos mais curtos é, portanto, uma hipótese útil. Ele apoia testar se o planejamento automatizado pode revelar rotas que os clínicos poderiam deixar de considerar, especialmente quando existem várias opções geometricamente válidas.

Ele não sustenta a afirmação de que o GPT-4 tornou as biópsias pulmonares mais seguras. Estabelecer essa alegação exige estudos prospectivos que comparem desfechos clínicos sob condições controladas.

Dois Trajetos Rejeitados Mostram Por Que o Mais Curto Nem Sempre É o Mais Seguro

As falhas do modelo revelam um conflito entre otimizar uma métrica visível e entender como uma agulha se comporta durante uma biópsia real.

No Caso 19, o GPT-4 sugeriu um trajeto que atravessava 20 milímetros de tecido pulmonar. A rota manual atravessava apenas 5 milímetros.

A recomendação da IA, portanto, percorreu quatro vezes mais tecido pulmonar, contrariando o objetivo de otimização fornecido no prompt. Ela também retornou uma ampla faixa de possíveis ângulos de entrada, em vez de um plano preciso e claramente preferencial.

Os revisores consideraram a rota teoricamente viável, mas não representativa de boa prática clínica. Essa distinção capta a lacuna entre evitar obstáculos óbvios e produzir um plano de procedimento confiável.

O Caso 27 expôs um problema diferente. O alvo era um nódulo subpleural, o que significa que ele estava próximo à superfície externa do pulmão.

A rota proposta pela IA atravessou desnecessariamente 5 milímetros de tecido pulmonar. Os revisores também levantaram preocupações sobre a estabilidade da agulha.

Um trajeto muito curto por tecido de sustentação pode deixar uma agulha coaxial de biópsia insuficientemente ancorada. A agulha pode se tornar mais vulnerável a movimentos ou deslocamentos durante a coleta.

Isso cria a principal contrapartida do estudo. Reduzir a distância através do tecido pulmonar normal parece inerentemente benéfico, mas uma rota estável pode exigir engajamento suficiente no tecido para manter a agulha firmemente presa.

O modelo recebeu regras simplificadas, em vez de uma representação completa da prática procedimental. Ele podia buscar um ângulo que atendesse a essas regras sem compreender todos os motivos pelos quais um radiologista poderia escolher uma abordagem menos direta.

Os pesquisadores reconheceram que a análise permaneceu bidimensional. Radiologistas humanos normalmente percorrem múltiplos cortes de TC e usam reconstruções multiplanares para compreender a anatomia em três dimensões.

Uma única imagem axial não consegue representar plenamente estruturas que se estendem acima ou abaixo desse plano. Ela também não consegue mostrar como uma linha aparentemente livre muda ao longo de todo o trajeto tridimensional da agulha.

As imagens foram anotadas manualmente antes de chegarem ao GPT-4. O modelo não localizou independentemente cada lesão, não segmentou os órgãos nem definiu com confiabilidade margens de segurança em torno de anatomias críticas.

O estudo também omitiu uma margem mínima especificada de cinco milímetros em relação aos feixes neurovasculares subclávio e axilar. O posicionamento dos pacientes manteve essas estruturas afastadas das rotas avaliadas, mas sistemas futuros não podem presumir a mesma condição.

O uso de prompts introduziu outra fonte de variabilidade. Os pesquisadores começaram com um prompt padronizado, mas as interações de acompanhamento não foram totalmente roteirizadas quando o modelo deixava de atender a um critério.

Assim, dois usuários poderiam conduzir o mesmo modelo a respostas diferentes. Um sistema de planejamento clínico precisaria de um processo reprodutível que produzisse resultados auditáveis sem conversa improvisada.

Os casos foram processados em sessões separadas, o que reduziu a contaminação entre casos. No entanto, o estudo não estabeleceu se execuções repetidas na mesma imagem retornariam o mesmo ângulo.

A consistência importa quando uma recomendação afeta um procedimento invasivo. Um sistema que altera seu plano entre execuções precisa de um método para explicar, classificar e resolver essas diferenças.

A versão do modelo apresenta outro desafio. Serviços de IA de propósito geral mudam ao longo do tempo, por vezes sem expor aos usuários clínicos todas as modificações técnicas.

Um resultado obtido em uma configuração do GPT-4 não pode ser transferido automaticamente para um modelo posterior. A validação médica deve estar vinculada a uma versão controlada do sistema, a entradas definidas e a um processo operacional documentado.

Sistemas Desenvolvidos para Esse Fim Colocam o Modelo Geral em Perspectiva

O resultado do GPT-4 é notável por utilizar um modelo geral, mas algoritmos especializados já oferecem métodos de planejamento mais estruturados e reproduzíveis.

Um estudo de planejamento de trajetórias de 2024 avaliou um software desenvolvido especificamente para biópsia pulmonar transtorácica. Ele combinava detecção tridimensional de lesões com otimização bayesiana para propor trajetórias.

Esse sistema foi treinado com 2.147 nódulos de 219 exames. Os pesquisadores validaram a detecção de lesões com outros 235 exames contendo 354 lesões.

O modelo alcançou uma área sob a curva característica de operação do receptor reportada de 97,4%. Sua sensibilidade média foi de 93,5%, enquanto a especificidade média chegou a 93,2%.

Os pesquisadores compararam as trajetórias propostas com as rotas de biópsia efetivamente usadas em 150 pacientes. Eles classificaram uma correspondência como uma diferença angular inferior a cinco graus.

O sistema gerou rotas viáveis em 85,3% dos casos avaliados. Oitenta e dois por cento corresponderam aos caminhos reais segundo a definição do estudo, com desvio angular médio de 2,30 graus entre as rotas correspondentes.

Esse sistema abordou tarefas que o GPT-4 não realizou, incluindo segmentação tridimensional e detecção de lesões. No entanto, ele também permaneceu uma avaliação retrospectiva, e não uma demonstração de melhores desfechos para os pacientes.

Trabalhos anteriores também testaram o planejamento de IA baseado em regras em comparação com a avaliação de especialistas. Um estudo de prova de conceito de 2023 gerou cinco rotas candidatas para cada um dos 28 pacientes.

Quatro médicos experientes avaliaram 140 trajetórias. O computador e os médicos atribuíram pontuações idênticas em 57,9% dos casos, e todos os 28 melhores caminhos selecionados pelo algoritmo foram considerados seguros.

Pesquisas mais recentes ampliaram essa comparação. O Trajectory Recommendation Algorithm for CT-guided Biopsy, conhecido como TRAX, gera e classifica cerca de 20.000 rotas candidatas depois que um médico identifica o alvo.

Em uma comparação do TRAX com 53 pacientes, radiologistas cegados avaliaram todas as rotas selecionadas pela IA e pelos médicos como seguras. As avaliações foram idênticas em 58% das comparações.

Os avaliadores preferiram o TRAX em 23% dos casos e a rota do médico em 19%. A diferença não foi estatisticamente significativa, mas as rotas do TRAX foram ligeiramente mais curtas, em média.

O TRAX também selecionou mais trajetórias fora do plano axial padrão. Metade de suas rotas usou um plano angulado, enquanto 81,1% das rotas dos médicos permaneceram axiais.

Esses estudos não produzem uma disputa simples com um único vencedor. Seus dados de entrada, definições, conjuntos de dados e limites de correspondência de rotas diferem.

Um sistema criado para esse fim pode codificar restrições anatômicas, quantificar distâncias e classificar milhares de rotas de forma consistente. Um modelo de linguagem multimodal oferece maior flexibilidade, mas depende mais da preparação das imagens, dos prompts e da interpretação humana.

O papel do GPT-4 pode, portanto, estar mais próximo de um assistente de planejamento do que de um mecanismo de trajetórias. Ele poderia ajudar clínicos a comparar opções, identificar abordagens ignoradas ou documentar os motivos de uma escolha.

Mesmo esse papel de apoio exige salvaguardas. A interface precisa distinguir sugestões do modelo de planos aprovados, exibir a rota anatômica completa e preservar um registro da revisão humana.

A competição relevante não é entre IA e radiologistas. É entre sugestões geométricas automatizadas e o julgamento clínico completo necessário para transformar uma linha em uma imagem em um procedimento seguro.

O planejamento de biópsia pulmonar com GPT-4 ainda precisa de validação prospectiva

As próximas evidências precisam demonstrar repetibilidade, desempenho tridimensional e benefício para o paciente, em vez de apenas mais uma alta porcentagem de viabilidade.

O primeiro sinal a observar é a reprodutibilidade. Os pesquisadores devem repetir casos idênticos em sessões controladas e medir com que frequência o modelo seleciona a mesma rota.

Eles também devem padronizar todos os prompts e as condições de acompanhamento. Se a correção humana continuar necessária, os estudos precisam registrar com que frequência ela ocorre e quanto altera a recomendação.

Um sistema reproduzível fortaleceria o argumento para usar IA generativa em um fluxo de trabalho formal de planejamento. Uma grande variação entre execuções enfraqueceria esse argumento, mesmo que os avaliadores considerassem plausível a maioria dos resultados individuais.

O segundo sinal é a análise tridimensional nativa. Sistemas futuros precisam acessar volumes completos de TC, em vez de imagens PNG selecionadas manualmente.

Esse fluxo de trabalho deve segmentar automaticamente a lesão, os pulmões, vasos, costelas, fissuras, mediastino e outras estruturas relevantes. Também deve calcular margens de segurança explícitas e exibir toda a rota.

Combinar um modelo de linguagem com segmentação médica dedicada poderia resolver parte da preparação artificial do estudo atual. Isso também criaria novos riscos de integração que exigiriam validação separada.

A análise tridimensional precisa lidar com diferentes scanners, configurações de reconstrução, posições dos pacientes e localizações das lesões. Dados multicêntricos seriam essenciais, pois o desempenho em um centro oncológico pode não se transferir para outros hospitais.

O terceiro sinal é uma comparação clínica prospectiva. Esse estudo avaliaria planos assistidos por IA antes dos procedimentos, mantendo radiologistas qualificados responsáveis por cada decisão final.

Os pesquisadores poderiam comparar rendimento diagnóstico, pneumotórax, sangramento, duração do procedimento, exposição à radiação, reposicionamento da agulha e tempo de recuperação. Eles devem relatar separadamente as recomendações malsucedidas, em vez de permitir que as médias as ocultem.

Os testes prospectivos devem começar com cautela. Um modo sombra poderia gerar recomendações sem influenciar o atendimento, permitindo que os investigadores comparem planos de IA com decisões reais em condições ao vivo.

Posteriormente, ensaios poderiam avaliar se clínicos que usam o sistema elaboram planos melhores ou mais consistentes. Qualquer avanço em direção à execução robótica direta exigiria evidências substancialmente mais fortes e supervisão no nível do dispositivo.

O estudo de 30 casos não oferece resposta sobre o rendimento diagnóstico porque os caminhos propostos não foram usados. Ele também não pode demonstrar se uma rota mais curta teria reduzido as complicações menores observadas.

Seu valor está em estabelecer que um modelo multimodal geral pode participar de um exercício de planejamento com restrições rigorosas. Essa descoberta justifica experimentos melhores, e não implantação clínica imediata.

O verdadeiro avanço é uma hipótese de planejamento testável

Este estudo de viabilidade transforma o planejamento de trajetórias com IA generativa em uma questão de pesquisa mensurável, mantendo a responsabilidade clínica firmemente com os especialistas.

O GPT-4 identificou rotas que especialistas independentes consideraram adequadas em 28 dos 30 casos históricos. Sua rota mediana proposta atravessou 18 milímetros a menos de tecido pulmonar do que as rotas manuais concluídas.

Esses números tornam o método digno de investigação. Eles também coexistem com dois planos rejeitados, preparação manual de imagens, prompts de acompanhamento não roteirizados e uma visão bidimensional de uma anatomia tridimensional.

A interpretação mais útil não é nem rejeição nem celebração. Um modelo de IA de uso geral reconheceu estrutura visual e procedural suficiente para sugerir alternativas plausíveis, mas não dispunha do contexto completo necessário para um planejamento confiável.

Para os radiologistas, o estudo aponta para um suporte à decisão que compare trajetórias em vez de substituir o julgamento clínico. Para equipes de IA médica, ele define o trabalho de engenharia que ainda falta entre um experimento de chatbot e um software validado.

Para hospitais e pacientes, o padrão deve continuar sendo baseado em resultados. A assistência de IA melhora a coleta de tecido, reduz complicações, encurta procedimentos ou torna o planejamento especializado mais consistente em diferentes contextos de atendimento?

Os próximos estudos devem responder a essas perguntas com sistemas controlados, volumes completos de TC, conjuntos de dados externos e avaliação clínica prospectiva. Até lá, o planejamento de biópsia pulmonar com GPT-4 permanece uma segunda opinião intrigante sobre uma imagem preparada, e não um navegador para uma agulha em tempo real.

 
 

Comece grátis

Um assistente de IA local-first com gestão de conhecimento pessoal

Para oferecer uma experiência de IA melhor,

atualmente, o remio é compatível apenas com Windows 10+ (x64) e M-Chip Macs.

Seu parceiro de IA no trabalho
Faça mais com o remio

Planeje. Crie. Entregue.
Tudo em um só lugar.

bottom of page