DARPA colocou IA em um F-16 padrão. O verdadeiro teste é a confiança em escala de combate
- Ethan Carter

- há 3 horas
- 15 min de leitura
A DARPA e a Força Aérea dos EUA realizaram voos com um F-16 controlado por IA, mas a aeronave não estava sem tripulação nem operava sem supervisão humana. Um piloto de segurança permaneceu na cabine, pronto para retomar o controle. O marco relevante foi outro: um agente de IA controlou um caça padrão convertido com um sistema portátil de autonomia.
Essa distinção leva o programa além de uma aeronave de pesquisa isolada. O F-16 modificado pertence ao programa Viper Experimentation and Next-generation Operations Model, mais conhecido como VENOM. Seu kit de autonomia conecta agentes de IA aos controles e sistemas de missão do caça sem substituir o software central da aeronave.
O voo também altera a pressão competitiva em torno da autonomia militar. A DARPA agora precisa demonstrar que algoritmos testados em simulação podem permanecer previsíveis durante missões complexas com múltiplas aeronaves. Ao mesmo tempo, a Força Aérea precisa de evidências de que esses agentes podem apoiar seus planos de Collaborative Combat Aircraft sem sobrecarregar pilotos ou enfraquecer o controle humano.
O que a DARPA realmente voou em Eglin
A principal conquista não foi uma cabine vazia. Foi uma ponte reutilizável entre IA experimental e uma plataforma de caça operacional.
O anúncio de voo da DARPA foi publicado em 16 de julho de 2026. Ele descreveu testes em voo na Base Aérea de Eglin, na Flórida. Um agente de IA controlou autonomamente o voo de um F-16 modificado como plataforma de testes aerotransportada.
A Força Aérea começou a voar a aeronave modificada em junho. Esses voos iniciais verificaram se o jato se comportava com segurança após receber hardware, software e instrumentação adicionais. A equipe então avançou para testes de controle autônomo em julho, segundo a atualização de voo do VENOM do serviço.
Um piloto humano permaneceu na cabine durante todos os testes. Esse piloto monitorava a IA e podia intervir caso a aeronave apresentasse comportamento fora do esperado. Esse arranjo é chamado de controle humano sobre o circuito, o que significa que a máquina atua enquanto uma pessoa supervisiona e mantém autoridade para intervir.
Isso é diferente do controle humano no circuito. Neste último modelo, uma pessoa precisa aprovar ou executar ações específicas antes que o sistema prossiga. A distinção importa porque futuras aeronaves de combate precisarão tomar algumas decisões mais rapidamente do que um piloto consegue direcionar manualmente cada movimento.
A DARPA não divulgou publicamente uma lista detalhada de manobras, um quadro de desempenho ou uma descrição completa dos cenários de missão de julho. Seu anúncio afirma que o agente controlou o voo, enquanto trabalhos futuros testarão múltiplos agentes em cenários de voo real operacionalmente relevantes. Portanto, as evidências disponíveis não sustentam descrever esse voo como uma missão de combate sem supervisão.
O F-16 recebeu um VENOM Autonomy Kit, ou VAK. A DARPA afirma que o kit faz interface com os controles de voo e sistemas de missão, mantendo inalterado o software central do caça. Um interruptor na cabine permite que o piloto alterne entre o controle tradicional e o controle por IA.
Manter o software central intacto tem valor estratégico. Reescrever o sistema de controle de voo de um caça para cada experimento de autonomia atrasaria os testes e introduziria riscos adicionais de certificação. Uma interface separada permite que pesquisadores alterem modelos de IA com mais frequência, preservando a aeronave subjacente.
A arquitetura também cria uma fronteira de segurança mais clara. A IA não recebe simplesmente acesso irrestrito a todos os sistemas a bordo do jato. Engenheiros podem instrumentar a interface, observar comandos, definir limites e comparar o comportamento pretendido com a resposta real da aeronave.
Isso transforma a aeronave em um laboratório voador, e não em uma arma autônoma prototípica. Pesquisadores podem carregar um agente, coletar dados de voo, analisar falhas e revisar o modelo antes de outra missão. O processo se assemelha ao desenvolvimento iterativo de software, mas cada erro ocorre dentro de um sistema físico crítico para a segurança.
O voo importa porque a autonomia aérea não pode ser validada apenas por simulação. Simuladores podem gerar grandes quantidades de encontros, incluindo situações raras ou perigosas. Eles não conseguem reproduzir todas as imperfeições de sensores, falhas de comunicação, condições climáticas, variações de manutenção ou respostas inesperadas de pilotos.
Um F-16 real obriga o agente a interagir com essas restrições físicas. Também fornece às equipes de teste evidências sobre tempo de resposta, qualidade de controle, integração de sensores e supervisão humana. Esses detalhes determinarão se a tecnologia pode sair de um ambiente de pesquisa controlado.
O teste com o F-16 é um teste de escalabilidade
A DARPA já demonstrou que a IA pode pilotar um caça durante um combate aéreo controlado. O VENOM questiona se essa capacidade pode se tornar uma infraestrutura repetível.
A referência histórica imediata é o X-62A VISTA, um F-16 modificado de forma única e operado pela Air Force Test Pilot School. No programa Air Combat Evolution da DARPA, agentes de IA pilotaram o X-62A contra um F-16 pilotado por um humano em cenários de combate dentro do alcance visual.
A DARPA anunciou esses combates aéreos autônomos em abril de 2024. Os testes de voo haviam começado em 2023 na Base Aérea de Edwards, na Califórnia. Pilotos de segurança estavam presentes, e o programa ajustava seus algoritmos entre os eventos de teste.
Esses voos responderam a uma importante questão técnica. Um agente de IA podia comandar um caça de alto desempenho durante manobras dinâmicas de combate aéreo, operando dentro dos controles de teste. No entanto, o X-62A continuava sendo uma aeronave especializada com uma missão de pesquisa específica.
O VENOM mira um gargalo diferente. Os Estados Unidos não precisam de um único jato capaz de sediar uma demonstração impressionante. Precisam de aeronaves instrumentadas em quantidade suficiente, capacidade de testes, interfaces de software e pessoal treinado para avaliar muitos agentes concorrentes.
A palavra "padrão" exige cuidado aqui. Um F-16 VENOM não é idêntico a um caça operacional comum após a modificação. Ele transporta equipamentos e instrumentação especializados. O ponto significativo é que o pacote de autonomia foi adicionado a uma plataforma convencional de frota sem substituir seu software central.
Essa abordagem pode ampliar o volume de testes no mundo real. Mais missões podem expor agentes a mais condições, incluindo incerteza de sensores e interrupções de comunicação. Múltiplas aeronaves também podem testar cooperação, atribuição de funções e objetivos conflitantes que combates um contra um não revelam.
O programa Artificial Intelligence Reinforcements da DARPA, ou AIR, usará a frota VENOM nesta próxima fase. O AIR pretende levar agentes de combate da simulação para cenários de voo real cada vez mais complexos. Sua direção declarada inclui operações além do alcance visual e com múltiplas aeronaves.
O combate além do alcance visual ocorre quando aeronaves atacam alvos fora do contato visual direto. Os pilotos precisam confiar em sensores, enlaces de dados, processos de identificação, informações de guerra eletrônica e regras de engajamento. Isso cria um problema de autonomia mais difícil do que manter um adversário centralizado em um combate de curta distância.
Um combate aéreo recompensa controle rápido e manobras táticas. Operações além do alcance visual exigem gerenciamento de informações sob incerteza. O agente precisa raciocinar a partir de dados incompletos ou possivelmente enganosos, enquanto coordena outras aeronaves e permanece dentro das restrições da missão.
Testes com múltiplas aeronaves acrescentam outra camada. Os agentes precisam dividir tarefas, evitar duplicar ações, preservar a segurança da formação e responder quando outra aeronave perde as comunicações. Seu comportamento também precisa continuar compreensível para um comandante humano da missão.
É por isso que a interface importa tanto quanto o algoritmo. Um agente forte que funciona apenas dentro de uma aeronave de laboratório tem valor operacional limitado. Um processo comum de testes pode comparar agentes sob condições semelhantes e transferir comportamentos bem-sucedidos entre plataformas.
O programa, portanto, representa uma mudança de provar capacidade bruta para construir um sistema de avaliação. A DARPA tenta encurtar o ciclo entre simulação, voo real, análise de falhas e revisão de modelos. Cada etapa precisa preservar evidências suficientes para que humanos entendam por que o agente agiu.
Esse objetivo de escalabilidade também explica por que o piloto de segurança não é uma nota de rodapé. A supervisão humana permite que as equipes explorem algoritmos mais agressivos sem tratar cada comando inesperado como um evento de perda da aeronave. O piloto fornece um caminho controlado para intervenção enquanto o programa coleta evidências.
No entanto, a supervisão pode esconder fragilidades se os avaliadores medirem apenas a conclusão da missão. Um agente que exige correções humanas frequentes não é operacionalmente autônomo. Divulgações futuras deveriam separar intervenções, ativações de limites de segurança, falhas de software e conclusão bem-sucedida de tarefas autônomas.
Por que F-16s controlados por IA importam para a Força Aérea
A Força Aérea não está tentando principalmente substituir pilotos por F-16s autônomos. Ela está construindo as evidências necessárias para que pilotos comandem grupos de aeronaves não tripuladas.
A DARPA descreve o VENOM como uma base para futuras operações de forças conjuntas, incluindo Collaborative Combat Aircraft. CCA é o esforço da Força Aérea para colocar em operação aeronaves não tripuladas que possam atuar ao lado de caças tripulados e executar funções de missão designadas.
A relação é indireta, mas importante. O serviço não precisa transformar cada F-16 em uma aeronave de combate autônoma. Precisa de uma plataforma segura e bem compreendida, na qual agentes possam ser testados antes que uma autonomia semelhante chegue a sistemas não tripulados construídos especificamente para esse fim.
Um F-16 oferece características de voo conhecidas, práticas de manutenção estabelecidas e espaço para um piloto de segurança. Essa combinação o torna útil para experimentação. Uma nova aeronave não tripulada não teria a mesma opção imediata de recuperação humana se sua autonomia se comportasse de maneira inesperada.
A Força Aérea também vem testando separadamente uma estrutura de software pertencente ao governo em plataformas de fornecedores de CCA. Sua abordagem de arquitetura aberta foi projetada para permitir que softwares de autonomia operem em diferentes aeronaves sem vincular o serviço a um único fornecedor.
O VENOM apoia a mesma ideia mais ampla. Aeronaves, agentes de autonomia e software de missão devem evoluir em velocidades diferentes. Uma interface modular pode permitir que engenheiros atualizem um agente sem redesenhar toda a célula da aeronave.
Essa separação pressiona tanto empreiteiras tradicionais de defesa quanto empresas mais novas de autonomia. Fabricantes de aeronaves não podem mais supor que a inteligência de missão permanecerá permanentemente vinculada a uma única aeronave. Desenvolvedores de software precisam provar que seus agentes funcionam fora de simulações controladas e demonstrações específicas de fornecedores.
Ela também pressiona o operador humano. O papel futuro imaginado pela DARPA não é simplesmente o de um piloto voando uma aeronave enquanto drones seguem rotas fixas. Uma pessoa orquestraria várias plataformas autônomas que respondem a ameaças em constante mudança.
Os objetivos do programa ACE da DARPA descrevem a confiança como um pré-requisito para esse arranjo. O programa começou com combate de curta distância porque o ambiente produz consequências rápidas e visíveis. O objetivo maior é a colaboração entre humanos e máquinas em engajamentos mais complexos.
A confiança não pode significar acreditar que a IA estará sempre correta. Nenhum piloto humano atende a esse padrão. A confiança operacional exige saber quando um agente é confiável, onde ele falha e com que rapidez uma pessoa pode reconhecer e corrigir uma decisão perigosa.
A interface apresentada ao piloto se tornará crítica. Um comandante não pode revisar saídas brutas de modelos enquanto gerencia uma missão contestada. O sistema precisa comunicar intenção, confiança, limitações e pedidos de intervenção sem criar uma carga cognitiva excessiva.
Considere uma futura missão de escolta. Uma aeronave não tripulada pode avançar para coletar dados de sensores enquanto outra transporta armas ou equipamentos de guerra eletrônica. O piloto humano precisa atribuir objetivos e restrições, e não especificar manualmente cada curva.
Se as comunicações enfraquecerem, os agentes precisam saber quais tarefas podem continuar. Também precisam saber quando retornar, manter posição ou transferir responsabilidade. Esses comportamentos exigem validação antes que as aeronaves operem próximas a forças amigas ou em espaço aéreo civil.
A Força Aérea também precisa de evidências de que agentes de diferentes fornecedores podem cooperar. Uma arquitetura aberta resolve apenas parte desse problema. Dois sistemas podem compartilhar uma interface técnica e, ainda assim, interpretar prioridades, confiança ou dados de ameaças de maneira diferente.
Testes ao vivo com múltiplas aeronaves podem revelar essas incompatibilidades. Eles podem mostrar se os agentes competem pelo mesmo alvo, emitem recomendações incompatíveis ou se comportam de forma imprevisível após perderem informações compartilhadas. Essas falhas são difíceis de detectar em demonstrações isoladas.
É nesse ponto que VENOM se torna mais do que uma história sobre o F-16. A aeronave oferece um ambiente controlado para testar as relações entre softwares que moldarão futuras operações aéreas. Seu valor depende de quão bem essas lições serão transferidas para plataformas não tripuladas.
O Problema Difícil É a Confiança em Condições de Combate
Um voo bem-sucedido prova que o caminho de controle funciona. Não estabelece que a IA tomará decisões legais, taticamente sólidas e previsíveis durante uma guerra.
Autoridades da DARPA reconhecem que desempenho e confiabilidade ainda não foram resolvidos sob o que chamam de névoa e fricção da guerra moderna. Essa cautela é central para a história. O combate real introduz engano, sensores danificados, comunicações incompletas e adversários que manipulam ativamente as entradas de um agente.
Um sistema de IA pode ter bom desempenho em cenários representados em seu treinamento e ainda falhar quando as condições mudam. Um adversário pode usar iscas, interferência eletrônica, formações incomuns ou comportamento deliberadamente ambíguo. O problema resultante não é uma questão comum de confiabilidade de software.
A autonomia em combate precisa lidar com mudança de distribuição, isto é, quando o ambiente operacional difere dos dados usados durante o desenvolvimento. Os engenheiros podem saber que ocorreu uma mudança sem saber qual decisão falhará. Por isso, os testes devem medir o comportamento fora das condições esperadas.
Os dados dos sensores também chegam com incerteza. Rastreios de radar podem desaparecer, informações de identificação podem entrar em conflito e mensagens de rede podem chegar atrasadas. Um agente que trata todas as entradas como igualmente confiáveis poderia tomar decisões seguras a partir de um quadro corrompido.
O programa também precisa testar a resiliência cibernética. Um kit de autonomia cria novas conexões de software e hardware dentro de um caça. Cada conexão precisa de proteção contra comandos não autorizados, atualizações comprometidas, dados maliciosos e vulnerabilidades na cadeia de suprimentos.
A intervenção humana continua sendo outra variável não resolvida. Um piloto de segurança pode acionar um interruptor durante um voo de teste, mas um comandante operacional pode supervisionar várias aeronaves ao mesmo tempo. O tempo necessário para perceber um problema pode exceder o tempo disponível para evitá-lo.
Também há o risco de viés de automação. As pessoas frequentemente dão peso excessivo às recomendações de máquinas quando um sistema parece preciso. Um piloto sob pressão pode aprovar um plano gerado por IA sem compreender plenamente as premissas por trás dele.
O problema oposto é igualmente sério. Se os agentes gerarem alertas demais, mudarem planos sem explicações claras ou exigirem correções repetidas, os pilotos podem deixar de confiar neles. Uma aeronave que demanda monitoramento constante pode aumentar a carga de trabalho em vez de reduzi-la.
Portanto, os testes militares precisam de mais do que um histórico de vitórias e derrotas. Os avaliadores devem medir frequência de intervenção, taxa de comandos inseguros, conclusão de missão, qualidade das explicações, recuperação após perda de comunicação e desempenho em cenários inéditos.
As informações públicas ainda não fornecem esses resultados para VENOM. A DARPA não divulgou quantas missões autônomas ocorreram, por quanto tempo a IA manteve o controle ou se pilotos de segurança intervieram. Também não identificou os agentes testados durante os voos de julho.
Essa divulgação limitada é compreensível para um programa militar. Detalhes táticos podem revelar capacidades ou fraquezas. Ainda assim, ela impede observadores externos de distinguir um grande avanço em autonomia de um marco bem-sucedido de integração.
O Departamento de Defesa enfrenta um desafio mais amplo de governança à medida que os programas de IA se multiplicam. Uma avaliação do GAO identificou anteriormente lacunas nas estratégias de IA de todo o departamento, nas descrições de recursos, nos inventários e nas orientações de colaboração. Essas conclusões não avaliaram VENOM especificamente, mas mostram por que o progresso técnico e a supervisão institucional devem avançar juntos.
A política de armamentos acrescenta outro limite. O controle autônomo de voo não equivale automaticamente à seleção autônoma de alvos ou ao lançamento de armas. Os anúncios públicos se concentram em pilotagem, agentes táticos e futuras operações em equipe, não em autoridade letal independente.
Redatores e formuladores de políticas devem preservar essa distinção. Um agente pode controlar velocidade, rumo, altitude e posicionamento tático enquanto um ser humano mantém as decisões sobre armamentos. Configurações futuras poderiam atribuir mais autoridade, mas o anúncio de julho não estabelece que isso tenha ocorrido.
O caminho mais crível é uma expansão gradual. Os engenheiros podem começar com comportamentos de voo restritos, introduzir entradas incertas de sensores, adicionar aeronaves cooperantes e então testar decisões no nível da missão. Cada etapa deve ter limites definidos e condições de falha mensuráveis.
Exercícios de red team serão essenciais. Equipes independentes devem tentar confundir os agentes, interromper comunicações, manipular entradas de sensores e provocar conflitos entre objetivos de missão. O objetivo é encontrar comportamentos frágeis antes que um adversário o faça.
O programa também precisa evitar confundir a presença de um piloto com segurança completa. Uma pessoa só pode intervir quando o sistema comunica seu estado e deixa tempo suficiente para agir. Algumas falhas podem se desenrolar mais rapidamente do que a capacidade humana de reconhecê-las.
A confiança, portanto, não é um sentimento criado por demonstrações repetidas e bem-sucedidas. É um julgamento respaldado por evidências sobre os limites de desempenho. VENOM só se torna operacionalmente significativo quando esses limites permanecem claros sob pressão.
O Que a DARPA e a Força Aérea Precisam Mostrar em Seguida
Três sinais determinarão se VENOM se tornará uma infraestrutura de combate útil: métricas transparentes de testes, voos bem-sucedidos com múltiplas aeronaves e transferência para plataformas CCA.
O primeiro sinal é uma estrutura de avaliação mensurável. A DARPA deve mostrar como o programa compara agentes entre missões, mesmo que detalhes táticos sensíveis permaneçam classificados. Contagens de intervenções, falhas de software, ativações de limites de controle e desempenho de recuperação forneceriam uma visão mais clara.
Essas métricas precisam distinguir a integração da aeronave do raciocínio autônomo. Uma interface limpa de controle de voo é necessária, mas diz pouco sobre decisões de missão. Boletins de avaliação separados revelariam se as falhas vieram da aeronave, do kit de autonomia, do processamento de sensores ou do agente.
Evidências de cenários inéditos fortaleceriam o argumento do programa. Os agentes devem enfrentar condições ocultadas dos desenvolvedores, incluindo degradação de sensores e comportamento inesperado de aeronaves. Um desempenho consistente nesses casos indicaria que o software faz mais do que repetir estratégias conhecidas.
O segundo sinal é a transição planejada para testes ao vivo com múltiplas aeronaves. Uma aeronave autônoma pode responder a um oponente humano ou seguir uma missão definida. Vários agentes precisam coordenar-se, dividir tarefas, gerenciar informações compartilhadas e se recuperar quando um participante falha.
Os testes com múltiplas aeronaves também exporão a interface homem-máquina. Um piloto deve ser capaz de comandar a equipe por meio de objetivos e restrições sem monitorar cada ação de controle. Se a carga de trabalho aumentar acentuadamente com cada aeronave adicional, o conceito operacional se enfraquece.
Os observadores devem acompanhar como o programa lida com comunicações degradadas. Companheiros autônomos não podem depender de conexões ininterruptas durante operações contestadas. Seu comportamento de contingência deve ser previsível para o comandante humano e compatível com o restante da formação.
Um evento bem-sucedido com múltiplas aeronaves reforçaria a afirmação da DARPA de que VENOM apoia uma autonomia de combate escalável. Uma demonstração que exija condições rigidamente roteirizadas ou repetida intervenção de pilotos limitaria essa afirmação.
O terceiro sinal é a transferência de F-16 modificados para Collaborative Combat Aircraft. A portabilidade de software é uma promessa central da autonomia modular. Essa promessa será testada quando um agente desenvolvido por meio de VENOM operar em uma aeronave com sensores, limites de desempenho e equipamentos de missão diferentes.
A transferência não será automática. Um F-16 tem características de voo e sistemas de cabine que diferem de uma plataforma CCA não tripulada. Os engenheiros precisam separar o comportamento tático geral das premissas vinculadas à aeronave de teste.
A arquitetura de propriedade do governo da Força Aérea pode ajudar a conduzir essa transição. Interfaces comuns podem reduzir o trabalho necessário para integrar software de diferentes fornecedores. Elas não podem garantir que um agente se comporte corretamente após ser transferido para uma nova célula de aeronave.
Portanto, um teste de transferência crível deve examinar tanto a compatibilidade técnica quanto o desempenho de missão. Carregar o software é apenas o primeiro passo. O agente deve manter um comportamento seguro enquanto se adapta a diferentes restrições de velocidade, alcance, sensoriamento e carga útil.
A resposta competitiva da indústria também será importante. Empresas de estruturas aeronáuticas buscarão provar que suas plataformas oferecem suporte a múltiplos pacotes de autonomia. Fornecedores de IA enfatizarão resultados de simulação, mas evidências de voos reais se tornarão o parâmetro de comparação mais valioso.
As decisões de aquisição revelarão se o governo acredita em seus próprios dados de teste. Se agentes VENOM bem-sucedidos entrarem em experimentos de CCA por meio de interfaces compartilhadas, o programa terá influenciado mais do que a pesquisa. Ele terá mudado a forma como a autonomia chega a uma aeronave operacional.
Também há sinais que enfraqueceriam o argumento. Longos intervalos entre marcos de voo podem indicar problemas de integração ou segurança. A dependência contínua de um único agente especializado levantaria dúvidas sobre a prometida linha de testes.
A ausência de dados divulgados sobre intervenções deixaria outra lacuna. Programas classificados não podem publicar todos os resultados, mas medidas agregadas de segurança e confiabilidade ainda podem mostrar se a tecnologia está amadurecendo. Sem elas, as alegações públicas continuarão difíceis de avaliar.
Os desenvolvedores devem se importar porque VENOM testa ideias conhecidas de sistemas de agentes civis sob condições excepcionalmente rigorosas. Portabilidade de modelos, observabilidade, substituição humana, testes adversariais e autoridade limitada são problemas de design de software que vão muito além da aviação militar.
Compradores empresariais devem observar a mesma lição. Uma demonstração bem-sucedida não equivale a uma implantação confiável. As organizações precisam de interfaces que restrinjam a autoridade dos agentes, registros que reconstruam decisões e avaliações que reflitam condições operacionais reais.
Profissionais do conhecimento e usuários de IA também devem resistir à manchete simplista de que uma IA pilotou um caça. A história mais relevante diz respeito ao sistema ao redor. Supervisão humana, controles modulares, instrumentação de testes e validação em etapas tornaram o voo possível.
A DARPA ultrapassou um marco significativo de engenharia ao conectar um agente de IA a uma aeronave modificada da frota. O próximo marco é mais difícil. A agência precisa demonstrar que múltiplos agentes podem continuar úteis, compreensíveis e controláveis quando o ambiente deixa de colaborar.
Acompanhe o próximo voo com múltiplas aeronaves, as primeiras métricas públicas de desempenho e a primeira transferência confiável para um teste de CCA. Esses eventos revelarão se o F-16 controlado por IA está se tornando uma infraestrutura militar escalável ou permanecendo uma plataforma de pesquisa impressionante.


