A IA na Saúde Pode Seguir Instruções e Ainda Assim Causar Danos
O Google News trouxe à tona um alerta contundente sobre IA na saúde: um sistema pode seguir perfeitamente suas instruções e ainda contribuir para um desfecho clínico errado.
O argumento, publicado sob o título “Sua IA Fez Exatamente o Que Foi Mandada Fazer. Esse é o Problema”, desvia a atenção das preocupações mais conhecidas sobre alucinações. Seu foco está na estrutura operacional em torno de um sistema de IA. Uma previsão ou recomendação correta se torna perigosa quando ninguém é responsável pela decisão, registra uma substituição da recomendação ou monitora o que acontece depois.
Essa distinção importa porque os hospitais estão indo além de experimentos isolados. Modelos preditivos agora fazem parte de prontuários eletrônicos, fluxos de trabalho clínicos, sistemas de agendamento e processos de alta. O conflito central já não é simplesmente humanos versus máquinas imprecisas. É a rápida implantação de IA versus o trabalho mais lento de definir autoridade, responsabilização e uso aceitável.
O Que a Manchete do Google News Realmente Mudou
O alerta redefine o sucesso da IA como um risco operacional quando um hospital mede o resultado, mas negligencia a decisão que o cerca.
O artigo destacado pelo Google News começa com um hipotético sistema de suporte à decisão clínica que recomenda uma alta antecipada. O algoritmo segue sua lógica programada, mas o paciente retorna em 48 horas. Nenhum indivíduo necessariamente ignora um alerta ou viola uma regra escrita.
A falha está no que a organização nunca especificou. A equipe não dispõe de um processo documentado para contestar a recomendação. Ninguém recebeu autoridade claramente atribuída para quando o julgamento clínico entra em conflito com um resultado algorítmico. A organização também não tem um registro confiável que mostre por que a decisão final foi tomada.
Esse exemplo é ilustrativo, não um caso documentado de paciente. Ele não deve ser tratado como evidência de que um hospital específico prejudicou um paciente. Seu valor vem de expor uma lacuna plausível entre desempenho técnico e responsabilidade clínica.
Um modelo preditivo estima um resultado definido com base nos dados disponíveis. Ele não decide se esse resultado representa o objetivo completo do hospital. Uma pontuação de risco de readmissão, por exemplo, não consegue equilibrar de forma independente a capacidade de leitos, a estabilidade do paciente, o suporte em casa, o acesso ao acompanhamento e as consequências de uma alta equivocada.
Essa lacuna é fácil de não perceber porque as equipes de software naturalmente testam se um sistema executa sua tarefa atribuída. Elas medem precisão, sensibilidade, especificidade, tempo de processamento ou outra métrica técnica. Essas medidas importam, mas não determinam quem deve agir com base no resultado.
Portanto, um hospital pode implantar um modelo preciso em um fluxo de trabalho inseguro. Também pode implantar um modelo limitado com segurança quando os clínicos entendem suas limitações e mantêm controle significativo.
A mesma distinção se aplica à IA generativa. Um sistema pode criar um resumo fluente que corresponde ao prontuário fornecido, mas omitir o único fato de que um clínico precisava. Pode produzir uma mensagem cortês ao paciente que segue um modelo, mas expressa mais certeza do que as evidências sustentam.
Nem sempre essas são falhas do modelo no sentido estrito. São falhas em traduzir a intenção organizacional em regras, permissões, etapas de revisão e resultados mensuráveis.
É por isso que a manchete encontrou público. Ela oferece aos conselhos hospitalares e líderes de tecnologia uma pergunta mais exigente do que “A IA funciona?” Eles precisam perguntar o que “funcionar” significa depois que o resultado entra em um processo clínico em operação.
O resultado relevante não é se o modelo concluiu uma tarefa. É se todo o sistema humano e técnico produziu um atendimento seguro, eficaz e responsável.
A Adoção de IA na Saúde Está Superando a Governança
Os hospitais enfrentam pressão porque a adoção de IA se tornou comum, enquanto a supervisão madura continua desigual.
Uma análise do Office of the National Coordinator for Health Information Technology constatou que 71 por cento dos hospitais de cuidados intensivos não federais usavam IA preditiva integrada a prontuários eletrônicos em 2024. Esse número subiu de 66 por cento em 2023, segundo os dados hospitalares sobre IA do governo.
A definição incluía sistemas estatísticos e de aprendizado de máquina que classificam pacientes ou geram pontuações de risco. Os exemplos incluem detecção precoce de doenças, recomendações de tratamento, previsões de faltas em consultas e risco de readmissão.
O crescimento importa porque a integração muda o que está em jogo. Um modelo fora do fluxo de trabalho clínico pode ser avaliado como uma ferramenta separada. Um modelo incorporado a um prontuário eletrônico passa a fazer parte de como os funcionários identificam riscos, priorizam o trabalho e documentam decisões.
A integração também pode criar viés de automação, a tendência de favorecer a recomendação de uma máquina mesmo quando há evidências contraditórias. Os clínicos podem hesitar em se afastar de uma pontuação que parece objetiva, especialmente quando a carga de trabalho é alta ou as políticas locais são pouco claras.
O problema não é que os clínicos parem de pensar. O sistema ao redor pode tornar a discordância difícil. Uma interface pode enfatizar o resultado da IA enquanto oculta a incerteza. Um hospital pode medir a adesão aos alertas, mas nunca examinar se os funcionários se sentiram capazes de contestá-los.
Uma perspectiva setorial de 2026 da Premier citou o mesmo número de adoção de 71 por cento e relatou que 80 por cento dos sistemas de saúde não possuíam padrões internos de governança para futuras adoções de IA. A perspectiva para a saúde apresenta esses números como uma lacuna de implementação cada vez maior.
As duas estatísticas medem populações diferentes e não devem ser combinadas em uma única estimativa precisa. Juntas, porém, descrevem a pressão enfrentada pelos líderes hospitalares. O uso de IA é disseminado, mas as estruturas formais para selecionar, monitorar e aposentar sistemas não amadureceram no mesmo ritmo.
Essa pressão alcança vários grupos.
Os conselhos hospitalares precisam supervisionar riscos estratégicos e clínicos sem tratar todas as ferramentas de IA como idênticas. Executivos precisam decidir quais decisões podem ser delegadas e quais exigem aprovação. Clínicos precisam entender quando um resultado é apenas consultivo, quando ele desencadeia uma ação e como registrar uma discordância.
As equipes de tecnologia precisam controlar acesso a dados, atualizações de modelos, integrações e registros de auditoria. As equipes de conformidade e jurídica precisam interpretar obrigações sobrepostas de privacidade, dispositivos médicos, discriminação e responsabilidade profissional. Os fornecedores precisam explicar o que seus sistemas fazem após a implantação, não apenas como eles se saíram durante a validação.
Os pacientes enfrentam as consequências das lacunas entre esses grupos. Eles talvez nunca saibam que um algoritmo influenciou uma alta, pontuação de prioridade, mensagem ou encaminhamento. Mesmo quando há divulgação, ela pode não explicar quem continua responsável.
A resposta necessária é organizacional, não apenas técnica. Os hospitais precisam de responsáveis nomeados para cada caso de uso, rotas de escalonamento por escrito e monitoramento pós-implantação vinculado aos resultados dos pacientes e dos fluxos de trabalho.
Esse trabalho é mais lento do que ativar um novo recurso. Ele exige acordo entre pessoas com responsabilidades e tolerâncias a risco diferentes. Ainda assim, evitar esse trabalho efetivamente deixa a interface de software definir a autoridade por padrão.
O Verdadeiro Oponente É a Implantação Sem Autoridade
O conflito principal não é IA versus clínicos; é influência automatizada versus autoridade humana responsável.
A supervisão humana costuma ser descrita como uma resposta universal ao risco da IA. A expressão parece tranquilizadora, mas permanece vaga até que uma organização especifique quem age, quando ocorre a revisão e quais poderes o revisor detém.
Um clínico que pode tecnicamente ignorar um alerta ainda pode não ter autoridade prática. O hospital pode acompanhar a aceitação de alertas como medida de desempenho. A interface pode exigir várias etapas para substituir a recomendação. O clínico também pode não ter tempo para reconstruir as entradas do modelo.
Uma supervisão significativa exige mais do que colocar uma pessoa perto do processo. O revisor precisa de acesso às evidências relevantes, tempo suficiente para avaliá-las e uma rota estabelecida para interromper ou alterar a ação.
A autoridade também deve corresponder à consequência. Uma ferramenta de redação que prepara uma nota interna apresenta riscos diferentes de um software que altera uma prescrição de medicamento ou envia uma mensagem diretamente a um paciente. O processo de aprovação deve refletir essa diferença.
Os hospitais podem começar separando quatro funções que frequentemente se confundem.
O fornecedor desenvolve ou fornece o sistema. Um responsável técnico mantém a integração e os controles de acesso. Um responsável clínico determina o uso apropriado no atendimento. Um executivo ou órgão de governança aceita o risco organizacional restante.
Uma pessoa pode ocupar mais de uma função em uma organização menor. As responsabilidades ainda precisam de definições separadas. Caso contrário, cada grupo pode presumir que outra parte avaliou o mesmo risco.
A aquisição é um ponto especialmente fraco. Um fornecedor pode documentar o desempenho do modelo em relação a um conjunto de dados de validação. Essa evidência não estabelece que os usuários, a população de pacientes, a interface ou o processo de acompanhamento do hospital produzirão o mesmo resultado.
A validação local deve testar o caso de uso real. Um modelo desenvolvido para prever um resultado não deve se tornar silenciosamente um substituto para uma decisão mais ampla. O hospital também precisa determinar se dados ausentes, atrasos no fluxo de trabalho ou diferenças populacionais alteram o desempenho.
O sistema implantado então exige revisão contínua. As distribuições de dados mudam, as práticas clínicas se transformam e atualizações de software alteram o comportamento. Um lançamento seguro não garante um segundo ano seguro.
Essa visão de ciclo de vida se reflete no trabalho da Food and Drug Administration sobre dispositivos médicos habilitados por IA. As orientações sobre software de dispositivos da agência incluem documentos sobre gestão do ciclo de vida, cibersegurança, controle de mudanças e suporte à decisão clínica.
Nem toda ferramenta hospitalar de IA é um dispositivo médico regulamentado pela FDA. Sistemas administrativos, ferramentas generativas de uso geral e algumas funções de suporte clínico podem estar fora de uma via específica para dispositivos. Isso torna a governança interna mais importante, não menos.
A autorização regulatória também responde a uma questão mais restrita do que a governança de implantação local. A FDA afirma que sua lista pública identifica dispositivos habilitados por IA que atenderam aos requisitos pré-comercialização aplicáveis. Ela também alerta que a lista não é abrangente.
Um hospital ainda precisa decidir quem pode usar um dispositivo autorizado, como os resultados entram no atendimento e quais mudanças exigem nova avaliação. Os reguladores podem definir limites, mas não podem escrever o procedimento operacional de cada hospital.
O artigo destacado pelo Google News, portanto, desafia um modelo mental comum. O julgamento humano não é um recurso de reserva ativado apenas após uma falha óbvia de software. Ele faz parte da estrutura de controle que rege até mesmo resultados tecnicamente corretos.
Resultados Precisos Ainda Podem Otimizar o Objetivo Errado
Um sistema de IA pode satisfazer seu objetivo medido enquanto prejudica o resultado que a organização realmente valoriza.
Este é um problema de especificação, o que significa que a meta formal não representa completamente o objetivo humano. Ele aparece sempre que uma organização substitui um indicador fácil de medir por um resultado complexo.
Um hospital pode otimizar o momento da alta porque o tempo de internação é mensurável. Seu verdadeiro objetivo é uma recuperação segura, com cuidados adequados e uso responsável de recursos. Essas metas se sobrepõem, mas não são idênticas.
Um modelo de agendamento pode reduzir faltas ao priorizar pacientes com maior probabilidade prevista de comparecimento. Isso pode melhorar um indicador operacional, ao mesmo tempo em que dificulta o acesso de pacientes que enfrentam limitações de transporte, deficiência, cuidados a familiares ou trabalho.
Um assistente de documentação pode minimizar o tempo que os clínicos passam redigindo notas. Se ele produzir textos mais longos que exigem verificação cuidadosa, a aparente economia de tempo pode apenas ser deslocada, em vez de desaparecer. Ele também pode introduzir erros copiados em um prontuário que sistemas posteriores tratam como fatos.
Um gerador de mensagens para pacientes pode otimizar respostas rápidas. O objetivo real do hospital inclui precisão, tranquilização adequada, privacidade e um caminho claro para atendimento profissional. A velocidade de resposta representa apenas uma parte desse resultado.
A solução não é rejeitar metas mensuráveis. As organizações precisam de métricas para avaliar sistemas. Elas devem combinar medidas técnicas com resultados operacionais e clínicos que revelem se o indicador indireto continua alinhado ao objetivo.
Isso significa monitorar tanto o processo quanto as consequências.
As medidas de processo podem mostrar com que frequência os clínicos aceitam, rejeitam ou ignoram uma saída. Elas podem revelar atrasos, atrito nas substituições e padrões incomuns de uso. As medidas de resultado podem testar se a segurança do paciente, a qualidade, o acesso ou a carga de trabalho mudaram após a implantação.
A comparação também deve levar em conta o processo anterior. Sistemas exclusivamente humanos contêm erros, vieses e inconsistências. A governança de IA não deve presumir que a prática existente seja automaticamente segura ou justa.
Uma avaliação responsável pergunta se o sistema combinado tem desempenho melhor do que a alternativa relevante. Ela examina benefícios e danos entre grupos de pacientes. Também registra a incerteza, em vez de reduzir a decisão a uma única taxa de sucesso.
Pesquisadores independentes têm defendido que a IA na saúde precisa de governança em todas as etapas: aquisição, implantação, monitoramento e desativação. Uma análise de 2025 na npj Digital Medicine alertou que grandes modelos de linguagem podem introduzir uso opaco de dados, problemas de responsabilização e validação insuficiente dos resultados para pacientes. Sua análise sobre IA na saúde defendeu transparência e controles em torno do uso no mundo real.
A preocupação vai além das alucinações. Um modelo pode produzir texto factualmente plausível enquanto oculta de onde vieram as informações. Ele também pode se comportar de maneira diferente entre contextos ou prompts de usuários sem gerar um erro convencional de software.
Sistemas generativos adicionam outra complicação, pois os usuários podem reutilizá-los rapidamente para outras finalidades. Uma ferramenta aprovada para redigir material interno pode passar a influenciar a comunicação com pacientes ou o raciocínio clínico. A tecnologia não necessariamente mudou, mas o risco mudou.
Por isso, os hospitais precisam de limites de casos de uso que acompanhem os dados e as ações. Um rótulo genérico como “assistente de IA” diz pouco sobre o risco. Os líderes precisam saber quais informações o sistema recebe, o que ele produz, quem vê a saída e se ele pode acionar uma ação externa.
Esse princípio também se aplica ao trabalho cotidiano com conhecimento. Equipes que usam uma base de conhecimento de IA precisam de contexto claro das fontes e práticas de revisão quando respostas geradas informam decisões.
A saúde eleva as consequências, mas o mecanismo é familiar. Um sistema de IA otimiza a tarefa que consegue observar. Os humanos continuam responsáveis por decidir se essa tarefa captura o que a organização realmente precisa.
A Governança Precisa Resistir ao Contato com o Trabalho Clínico
Um documento de governança tem pouco valor se seus controles não permanecerem utilizáveis durante um turno agitado, uma decisão urgente e uma falha inesperada do sistema.
Comitês formais de revisão oferecem um ponto de partida. Eles podem classificar sistemas propostos, avaliar evidências, estabelecer condições e atribuir responsáveis. Em seguida, suas decisões precisam se tornar visíveis dentro do fluxo de trabalho.
Um clínico não deveria precisar localizar um documento de política distante para entender um alerta. A interface deve identificar a finalidade da saída, suas limitações importantes e a resposta exigida. Também deve permitir discordância sem criar atrito desarrazoado.
O design de substituição merece atenção especial. Uma substituição completamente irrestrita pode transformar uma salvaguarda obrigatória em uma sugestão opcional. Uma substituição onerosa pode levar os clínicos à aceitação automática.
O equilíbrio adequado depende do risco. Recomendações de baixo impacto podem exigir controles leves. Ações de alto impacto devem exigir evidências mais robustas, aprovação e documentação.
A auditabilidade é igualmente importante. Um registro de auditoria documenta quais dados, versão do modelo, usuário e ação moldaram uma decisão. Sem esse histórico, investigadores podem ter dificuldade para determinar se o dano veio do modelo, da integração, dos dados ou da política operacional.
O registro deve capturar contexto suficiente para reconstruir a decisão sem coletar dados sensíveis desnecessários. Mais registros não são automaticamente melhores. Retenção excessiva pode criar exposição à privacidade e à segurança.
Os hospitais também precisam de uma forma de receber feedback da linha de frente. Os clínicos frequentemente percebem saídas confusas ou conflitos no fluxo de trabalho antes que métricas agregadas mudem. Um canal de comunicação deve distinguir reclamações de usabilidade de eventos de segurança, ao mesmo tempo em que conecta ambos aos responsáveis pelo sistema.
O feedback não pode desaparecer em uma central de ajuda genérica. As organizações devem definir limites para investigação, restrição, reversão e desativação. Também devem informar aos usuários o que aconteceu depois que uma preocupação foi enviada.
O treinamento deve se concentrar no sistema real, e não apenas em alfabetização genérica sobre IA. Os usuários precisam conhecer a finalidade aprovada, os modos de falha esperados e o caminho de escalonamento. Também precisam de exemplos que mostrem quando a confiança no sistema se torna inadequada.
Os controles técnicos devem apoiar essas expectativas. O acesso deve seguir o princípio do menor privilégio, que concede apenas as permissões necessárias para uma tarefa. Sistemas que redigem conteúdo não devem automaticamente receber autoridade para enviar, excluir, solicitar ou modificar registros.
Essa distinção se torna mais importante à medida que fornecedores adicionam recursos de agentes. Um agente de IA pode planejar etapas e usar ferramentas de software para perseguir um objetivo. Quando ele pode executar ações, uma conclusão plausível, porém equivocada, pode gerar consequências operacionais imediatas.
As permissões de ação devem, portanto, ser separadas da capacidade de conversação. Os hospitais podem exigir confirmação para etapas sensíveis, limitar o tamanho das transações, testar em modo somente leitura e manter um processo confiável de reversão.
O National Institute of Standards and Technology organiza a gestão de riscos de IA em torno de governança, mapeamento, medição e gestão. Seu framework de risco de IA é voluntário, mas oferece um vocabulário útil para conectar decisões de liderança à avaliação técnica.
Os frameworks ainda exigem interpretação local. Um pequeno hospital rural não pode criar o mesmo escritório de supervisão de um sistema nacional de saúde. Ainda assim, pode manter um inventário, atribuir responsáveis, classificar riscos e definir limites de aprovação.
O ponto cético é que a governança pode se tornar cerimonial. Comitês podem aprovar políticas sem recursos para monitoramento. Fornecedores podem fornecer documentação que não reflete o uso local. Funcionários podem recorrer a ferramentas não autorizadas quando os sistemas aprovados criam atrito excessivo.
Isso às vezes é chamado de shadow AI, ou seja, uso de IA que ocorre fora da aprovação ou da visibilidade organizacional. Bloquear todas as ferramentas não aprovadas pode ser irrealista, especialmente quando serviços de consumo são fáceis de acessar.
Os hospitais precisam de opções aprovadas e utilizáveis, regras claras para dados e fiscalização confiável. Também precisam entender por que os funcionários buscam alternativas. Uma política que ignora a pressão do fluxo de trabalho pode empurrar comportamentos arriscados para a clandestinidade.
Nenhum modelo de governança pode eliminar a incerteza da medicina. O julgamento humano continua imperfeito, e controles excessivos podem atrasar tecnologias benéficas. O objetivo não é risco zero.
A meta é um risco explícito e revisável. Um hospital deve ser capaz de explicar por que implantou um sistema, quem o controla, como o desempenho é medido e quais evidências o levariam a interrompê-lo.
Três Sinais para Observar Após o Debate do Google News
A próxima fase será definida pelo monitoramento no mundo real, pela autoridade aplicável e por evidências de que a IA melhora resultados além de seu benchmark técnico.
O primeiro sinal é se os hospitais publicam ou divulgam medidas de desempenho após a implantação. A precisão do modelo antes do lançamento fornece informações limitadas sobre o uso diário. Compradores devem buscar monitoramento que inclua substituições, desempenho por subgrupos, efeitos no fluxo de trabalho e resultados para pacientes.
A FDA já enfatizou a necessidade de avaliar dispositivos habilitados por IA após a implantação. Sua iniciativa sobre desempenho no mundo real solicitou métodos capazes de avaliar segurança, eficácia e confiabilidade contínuas.
Se os sistemas de saúde começarem a reportar essas medidas de forma consistente, o argumento de governança do artigo ganhará apoio. Isso mostraria que compradores e reguladores tratam cada vez mais a implantação como o início da avaliação, e não como sua conclusão.
Se a divulgação continuar limitada a benchmarks pré-comercialização e alegações de fornecedores, a incerteza persistirá. Os hospitais poderão saber que um modelo teve bom desempenho em testes sem saber como ele altera decisões em seu próprio ambiente.
O segundo sinal é se a autoridade de aprovação e substituição se torna visível dentro dos produtos. Os fornecedores descrevem salvaguardas com frequência crescente, mas os compradores devem examinar controles concretos.
Os administradores podem restringir o sistema a tarefas aprovadas? Os clínicos conseguem ver evidências relevantes e incerteza? Uma ação de alto risco exige confirmação? O hospital consegue reconstruir qual versão do modelo influenciou uma decisão?
Controles visíveis reforçariam a tese de que o mercado está passando de princípios éticos amplos para responsabilização operacional. Promessas genéricas sobre IA responsável a enfraqueceriam, especialmente quando produtos ganham acesso a prontuários, mensagens, solicitações ou sistemas de agendamento.
O terceiro sinal é se os sistemas de saúde avaliam resultados em vez de celebrar o uso. Números de adoção revelam alcance, não valor. Um hospital pode aumentar o número de funcionários que usam IA sem melhorar o atendimento, o acesso ou a carga de trabalho.
Os líderes devem observar avaliações controladas que comparem fluxos de trabalho apoiados por IA com alternativas confiáveis. Evidências úteis identificarão populações de pacientes, condições operacionais, limitações e mudanças ao longo do tempo.
Evidências de melhores resultados não eliminariam a necessidade de governança. Elas mostrariam que controles e integração clínica podem converter a capacidade do modelo em benefício mensurável.
Evidências de resultados neutros ou prejudiciais exigiriam uma resposta diferente. Os hospitais poderiam restringir casos de uso, reformular interfaces, retreinar usuários ou desativar sistemas que atendem a benchmarks técnicos, mas falham operacionalmente.
A manchete do Google News capturou a questão em uma frase memorável, mas a pergunta duradoura é institucional. Quem decide o que realmente se pede à IA que realize e quem pode intervir quando esse objetivo se revela incompleto?
Os líderes hospitalares devem mapear um fluxo de trabalho de IA em operação, da entrada de dados à ação final. Devem identificar o responsável, o ponto de aprovação, o caminho de substituição, o registro de auditoria, a métrica de resultado e a condição de desligamento.
Se algum desses elementos estiver ausente, a precisão do modelo não é a questão mais urgente. A organização ainda não definiu o que sucesso significa.



