O Plano do Detector de Mentiras com IA do Pentágono Coloca a Automação à Frente da Precisão Comprovada
O plano de detector de mentiras com IA do Pentágono busca US$ 30,3 milhões ao longo de cinco anos para modernizar uma tecnologia cuja base científica continua fortemente contestada. Chamado de Polygraph+ ou Polygraph Next, o programa combinaria sensoriamento fisiológico sem contato com inteligência artificial, aprendizado de máquina e pontuação automatizada.
A Defense Counterintelligence and Security Agency, ou DCSA, quer iniciar o esforço com US$ 6,421 milhões no ano fiscal de 2027. Seu pedido orçamentário descreve testes de campo, estudos de validação independentes, avaliações de protótipos, armazenamento centralizado de dados e ferramentas de apoio à decisão.
Isso parece um programa de engenharia, mas seu problema mais difícil não é de engenharia. Um sensor pode medir mudanças fisiológicas com mais precisão sem estabelecer que essas mudanças indiquem engano.
A tensão em torno do Polygraph Next é, portanto, maior do que uma atualização rotineira de equipamentos. O Pentágono quer automatizar e ampliar avaliações de credibilidade antes de resolver o que essas avaliações podem inferir de forma confiável.
A comparação histórica é importante. Uma avaliação de referência das National Academies concluiu que polígrafos convencionais têm desempenho melhor que o acaso em algumas investigações específicas, mas permanecem longe da perfeição. A análise chegou a uma conclusão muito mais severa sobre a triagem de funcionários, na qual pessoas inocentes podem superar em grande número as ameaças reais à segurança.
O novo sistema promete maior consistência, velocidade e rastreabilidade. No entanto, os documentos orçamentários públicos não apresentam uma meta de precisão, taxa aceitável de falsos positivos, protocolo de validação publicado ou limite para implantação.
Essas informações ausentes determinarão se o Polygraph Next se tornará um instrumento de pesquisa melhor ou uma forma mais rápida de produzir conclusões questionáveis.
O Que o Programa de Detector de Mentiras com IA do Pentágono Construiria
O Polygraph Next é uma proposta de pesquisa financiada, não um detector concluído com precisão demonstrada.
O orçamento do Polygraph Next do Pentágono situa o projeto no portfólio de pesquisa, desenvolvimento, testes e avaliação da DCSA. Os documentos datam o pedido de abril de 2026.
O cronograma proposto lista US$ 6,421 milhões para o ano fiscal de 2027. Os valores previstos incluem então US$ 6,449 milhões em 2028, US$ 6,158 milhões em 2029, US$ 5,660 milhões em 2030 e US$ 5,654 milhões em 2031.
Juntos, esses valores anuais somam US$ 30,342 milhões. Os documentos classificam o custo para conclusão e o custo total do programa como “continuing”, o que significa que o pedido de cinco anos não representa necessariamente um teto final.
Não há gastos de anos anteriores para o projeto na tabela do orçamento de pesquisa. Isso faz do ano fiscal de 2027 o ponto de partida proposto para este programa específico.
A DCSA apresenta Polygraph+ e Polygraph Next como nomes alternativos para o mesmo esforço de modernização. Seu objetivo declarado é melhorar a precisão, a confiabilidade, a usabilidade e a rastreabilidade nas avaliações federais de credibilidade.
O programa tem vários componentes planejados. Um deles é a pontuação automatizada, na qual algoritmos avaliariam sinais e ajudariam a produzir uma avaliação. Outro é o sensoriamento à distância, que significa medir atividade fisiológica sem conectar sensores convencionais diretamente a uma pessoa.
A agência também propõe armazenamento e análises centralizados. Esse componente reuniria dados de exames para avaliação, comparação e possível desenvolvimento de modelos.
A DCSA afirma que realizará estudos de validação independentes, testes de campo e avaliações de protótipos. Também identifica o Applied Research Laboratory for Intelligence and Security e o Oak Ridge National Laboratory como parceiros de pesquisa.
Esses detalhes estabelecem uma trajetória de desenvolvimento, mas revelam pouco sobre o modelo operacional final. Os documentos não explicam quais sinais fisiológicos um sistema implantado utilizaria.
Também não especificam se a IA recomendaria pontuações, classificaria exames, sinalizaria anomalias ou influenciaria diretamente decisões sobre pessoal. Essas funções envolvem riscos muito diferentes.
Um algoritmo que ajuda a identificar sensores com ruído não equivale a outro que rotula uma pessoa como enganosa. Da mesma forma, um auxílio à decisão revisado por um examinador treinado difere de um sistema de triagem amplamente automatizado.
O escopo imediato do programa é a triagem de pessoal federal e a detecção de ameaças internas. Esses contextos envolvem funcionários, candidatos, militares e contratados que podem precisar de acesso a informações sensíveis.
Esse contexto aumenta o risco. Um resultado incorreto pode atrasar uma autorização, redirecionar uma investigação, prejudicar uma carreira ou elevar a suspeita sobre uma pessoa inocente.
O pedido também não é o mesmo que uma dotação orçamentária. O Congresso ainda controla se o dinheiro proposto ficará disponível e pode alterar o valor, as condições ou as exigências de prestação de contas.
Por enquanto, o Polygraph Next é mais bem entendido como um plano governamental de pesquisa e aquisição. Ele tem ambições, orçamento proposto e parceiros institucionais, mas nenhum desempenho demonstrado publicamente.
Por Que a Triagem de Pessoal Está Sob Pressão Agora
O programa responde a uma carga operacional real, mesmo que sua solução proposta permaneça cientificamente indefinida.
A DCSA ocupa uma posição central no sistema federal de triagem. Ela conduz investigações de antecedentes e apoia decisões sobre acesso a informações classificadas em grande parte do governo.
Seu National Center for Credibility Assessment estabelece padrões de treinamento e assessora autoridades de defesa e inteligência sobre a política de polígrafo. A missão de avaliação de credibilidade do centro também inclui apoio técnico, pesquisa, testes, supervisão de programas e auditorias.
Esse papel institucional dá à DCSA uma razão clara para modernizar suas ferramentas. Exames convencionais exigem pessoal treinado, condições controladas, preparação de sensores, entrevistas e interpretação.
Essas exigências limitam a capacidade de processamento. Elas também podem criar diferenças entre examinadores, locais, equipamentos e condições de teste.
Sensores sem contato prometem uma configuração mais simples. A pontuação automatizada promete análises mais consistentes. Dados centralizados prometem auditoria e rastreabilidade mais robustas.
Cada objetivo tem valor operacional. Nenhum, contudo, estabelece que o sistema possa distinguir com precisão o engano da ansiedade, do medo, da confusão, da raiva ou da variação fisiológica comum.
O sistema mais amplo de triagem já enfrenta pressão de tecnologias envelhecidas e modernização atrasada. A DCSA está desenvolvendo a plataforma National Background Investigation Services para substituir sistemas antigos e apoiar reformas em todo o governo.
Uma revisão de triagem de pessoal de 2026 concluiu que a DCSA conduz cerca de dois milhões de investigações de antecedentes por ano. Também constatou que a agência ainda não dispunha de um cronograma confiável para concluir seu principal programa tecnológico.
A mesma revisão informou que os alertas de triagem contínua subiram de aproximadamente 30.000 por trimestre no ano fiscal de 2023 para mais de 100.000 durante o terceiro trimestre do ano fiscal de 2025. A triagem contínua usa verificações automatizadas de registros para identificar acontecimentos que exigem análise.
Esse aumento ilustra o desafio central. A automação pode coletar e sinalizar mais informações, mas também cria trabalho quando os sistemas produzem grandes volumes de alertas.
O Polygraph Next entra nesse ambiente como outro possível filtro. Se melhorar a qualidade dos sinais e reduzir a pontuação inconsistente, poderá ajudar investigadores a concentrar sua atenção.
Se suas classificações forem mal calibradas, poderá produzir o efeito oposto. Poderá gerar alertas adicionais, reforçar suspeitas frágeis e ampliar a carga de trabalho dos revisores humanos.
A pressão, portanto, recai sobre a DCSA, os candidatos a autorizações e as agências que buscam pessoal qualificado. A DCSA precisa de processos mais rápidos, enquanto os candidatos precisam de decisões precisas e explicáveis.
Os empregadores também precisam de prazos previsíveis para autorizações. Empresas contratadas de defesa não podem designar alguns funcionários para trabalho classificado até que o governo conclua a triagem exigida.
Autoridades de segurança enfrentam o risco oposto. Avançar rápido demais pode deixar agências vulneráveis a espionagem, divulgações não autorizadas, coerção ou outras ameaças internas.
É por isso que um detector mais rápido parece atraente. Ele aparenta oferecer eficiência sem reduzir o escrutínio.
No entanto, a velocidade só ajuda quando a classificação subjacente é confiável. Processar mais rapidamente sinais fisiológicos ambíguos não produz automaticamente uma segurança melhor.
O Polygraph Next deve, portanto, satisfazer dois padrões. Deve reduzir o atrito operacional e demonstrar que seus resultados melhoram as decisões em condições realistas.
O segundo padrão é mais difícil. Ele exige evidências sobre erros entre diferentes pessoas, ambientes, formatos de perguntas, condições médicas e níveis de estresse.
Sem essas evidências, o Pentágono corre o risco de tratar capacidade de processamento como precisão. Essas não são medidas intercambiáveis.
Como o Polygraph Next Usa IA Sem Resolver o Problema de Inferência
A IA pode padronizar a pontuação de sinais fisiológicos, mas não pode fazer com que esses sinais representem mentiras de forma exclusiva.
Um polígrafo convencional registra mudanças como respiração, atividade cardiovascular e condutância da pele. Examinadores comparam respostas entre perguntas e interpretam se diferenças específicas sugerem engano.
O Polygraph Next propõe adicionar IA e pontuação por aprendizado de máquina a esse processo. O aprendizado de máquina identifica padrões estatísticos em exemplos e aplica esses padrões a novos dados.
Essa abordagem pode reduzir parte da variação entre examinadores. Um algoritmo pode aplicar a mesma regra matemática a milhares de segmentos de sinais.
Ele também pode combinar mais variáveis do que uma pessoa consegue avaliar facilmente. Tempo, formato do sinal, duração da resposta e correlações entre sensores poderiam influenciar uma pontuação.
O sensoriamento à distância altera o método de coleta. Em vez de depender inteiramente de equipamentos conectados, um sistema poderia obter algumas medições fisiológicas à distância.
O orçamento não identifica o pacote final de sensores. Portanto, qualquer descrição específica além do monitoramento fisiológico sem contato seria prematura.
Ainda assim, a arquitetura cria uma cadeia clara de inferência. Primeiro, os sensores medem uma resposta física. Em seguida, o software extrai características dessa resposta.
Um modelo então converte essas características em uma pontuação ou recomendação. Por fim, um examinador ou autoridade interpreta esse resultado em um contexto de segurança.
Erros podem surgir em cada etapa. Um sensor pode captar ruído, um modelo pode aprender correlações pouco confiáveis e um tomador de decisão pode atribuir peso excessivo ao resultado.
A maior dificuldade está entre a resposta medida e o estado mental alegado. Aumento de excitação pode acompanhar o engano, mas também pode acompanhar o medo de não ser acreditado.
Um candidato sincero pode reagir intensamente a uma acusação. Uma pessoa enganosa pode permanecer calma ou usar uma contramedida que altera o padrão registrado.
A revisão científica sobre polígrafo das National Academies examinou esse problema antes de o aprendizado de máquina moderno se tornar comum. Seu alerta científico central continua válido.
As respostas fisiológicas não correspondem exclusivamente ao engano. Isso significa que um classificador aprimorado pode se tornar mais consistente sem se tornar mais válido.
Considere um modelo treinado com exames anteriores. Os rótulos históricos podem vir de avaliações de examinadores, confissões, desfechos de casos ou instruções de laboratório.
Cada fonte de rótulos tem fragilidades. As avaliações de examinadores podem reproduzir as premissas do método, enquanto confissões podem não estar disponíveis ou ser incompletas.
Experimentos de laboratório fornecem uma verdade de referência mais clara porque os pesquisadores sabem quem recebeu instruções para mentir. No entanto, uma mentira simulada raramente envolve as consequências de um exame real para autorização de segurança.
Os modelos também podem aprender atalhos. Eles podem associar movimento, estilo de fala, condições de saúde, características demográficas ou ambientes de teste aos rótulos nos dados de treinamento.
Um alto desempenho dentro de um único conjunto de dados não resolveria essa preocupação. O sistema precisa funcionar com novos indivíduos, novos locais, novos examinadores e taxas de base realistas.
As taxas de base descrevem quão comum é a condição-alvo dentro da população testada. Na triagem de pessoal, infratores graves de segurança são presumivelmente raros.
Essa raridade torna os falsos positivos especialmente importantes. Mesmo um teste que pareça preciso em experimentos equilibrados pode sinalizar muitas pessoas inocentes em uma força de trabalho de baixa prevalência.
Uma camada de pontuação por IA não pode escapar dessa matemática. Se algo, a automação torna a calibração ainda mais importante porque pode aplicar o mesmo limiar em maior escala.
A explicabilidade apresenta outro desafio. Investigadores precisam saber se uma pontuação reflete uma resposta significativa, baixa qualidade do sinal, uma condição física incomum ou uma limitação do modelo.
Uma pontuação genérica de confiança não fornece essa resposta. Alta confiança do modelo pode coexistir com uma classificação equivocada feita com confiança.
O papel mais defensável para a IA seria limitado e testável. Ela poderia melhorar o controle de qualidade, detectar medições corrompidas ou comparar a consistência das pontuações com a de examinadores treinados.
Um sistema comercializado como detector de mentiras por IA faz uma alegação muito mais ampla. Ele implica uma conexão confiável entre fisiologia observável e engano que os pesquisadores não estabeleceram.
A Principal Troca É Entre Consistência e Validade
Polygraph Next pode tornar as avaliações mais uniformes enquanto faz uma inferência não comprovada parecer mais autoritativa.
O argumento prático mais forte da DCSA diz respeito à padronização. Programas federais se beneficiam quando os procedimentos produzem registros comparáveis entre examinadores e locais.
A pontuação automatizada pode documentar quais medições influenciaram um resultado. Sistemas centralizados podem preservar registros e apoiar auditorias posteriores.
Esses recursos podem reduzir variações arbitrárias. Eles também podem revelar padrões de aplicação inconsistente que processos mais antigos não conseguiram captar.
No entanto, consistência não é precisão. Uma régua com a escala errada pode produzir erros idênticos todas as vezes.
Essa distinção importa porque pontuações geradas por computador frequentemente carregam uma aparência de objetividade. Autoridades podem se curvar a um resultado numérico mesmo quando seu significado científico permanece incerto.
O rótulo “IA” pode amplificar esse efeito. Usuários podem presumir que um sistema encontrou um sinal sutil de engano quando, na verdade, ele aprendeu correlações específicas de seus dados de treinamento.
Os documentos públicos do Pentágono afirmam que o projeto incluirá validação independente. Esse é um compromisso importante, mas independência exige mais do que designar uma equipe separada.
Os avaliadores precisam ter acesso aos métodos, conjuntos de dados, definições de erro e condições de teste. Eles também devem poder publicar conclusões desfavoráveis sem pressão do programa.
A validação deve separar exames de incidentes específicos de triagens amplas. As duas aplicações envolvem populações, perguntas, incentivos e trocas estatísticas diferentes.
As National Academies concluíram que os polígrafo podem discriminar acima do acaso em alguns incidentes específicos. Também constataram que as evidências são mais fracas para triagem e alertaram contra depender de polígrafo para decisões de segurança de funcionários.
Essa diferença deve moldar o Polygraph Next desde o início. Um único número de precisão em manchete ocultaria as aplicações em que os erros mais importam.
O sistema também precisa de limites decisórios claros. Uma pontuação de pesquisa não deve se tornar discretamente a base para uma ação adversa antes que suas limitações sejam compreendidas.
A política federal historicamente tratou os resultados de polígrafo como uma parte de um processo mais amplo. Investigadores podem usar exames para orientar entrevistas ou identificar questões que exigem análise adicional.
O Polygraph Next poderia borrar esse limite se resultados automatizados fluírem diretamente para outros sistemas de avaliação. Análises centralizadas podem tornar uma pontuação portátil e persistente.
A portabilidade aumenta a eficiência, mas também aumenta as consequências de um erro. Um resultado questionável pode acompanhar um candidato entre revisões, atribuições ou agências.
Os documentos orçamentários mencionam a rastreabilidade como benefício. A rastreabilidade adequada deve mostrar quem usou uma pontuação, como ela afetou uma decisão e se evidências posteriores a corroboraram.
Ela também deve permitir que autoridades corrijam registros. Caso contrário, dados centralizados podem preservar erros de forma mais eficaz do que preservam a responsabilização.
A privacidade é outra parte dessa troca. Dados fisiológicos podem revelar informações além da pergunta feita por um examinador.
Os documentos não descrevem publicamente períodos de retenção, regras de acesso, permissões de treinamento de modelos ou limites para uso secundário. Essas políticas merecem escrutínio antes que grandes conjuntos de dados se acumulem.
A cibersegurança também importa. Um repositório centralizado de avaliações de credibilidade conteria informações pessoais e de segurança nacional sensíveis.
A DCSA já administra sistemas que contêm dados extensos de investigações de antecedentes. Adicionar registros fisiológicos e resultados de modelos aprofundaria a sensibilidade desse ambiente.
O governo também deve considerar comportamentos adversariais. Pessoas com fortes incentivos podem estudar métodos de teste e tentar manipular suas respostas.
A DCSA identifica explicitamente contramedidas como um problema da tecnologia atual. Ainda assim, o aprendizado de máquina não as derrota automaticamente.
Um modelo treinado com contramedidas conhecidas pode detectar padrões familiares. Adversários podem responder desenvolvendo técnicas fora da distribuição de treinamento.
Isso cria uma corrida armamentista entre detecção e evasão. Portanto, alegações de maior resiliência precisam ser testadas contra participantes adaptativos, não apenas voluntários cooperativos.
A principal troca do programa agora está clara. A automação pode tornar o processo mais rápido, consistente e fácil de auditar.
Ao mesmo tempo, ela pode ampliar falsos positivos, ocultar premissas incertas e dar a julgamentos contestados uma aparência numérica. A governança da tecnologia precisa avançar junto com seus sensores e modelos.
O Que a Validação Independente Precisa Comprovar
O teste decisivo não é se o Polygraph Next reconhece padrões de laboratório, mas se ele melhora decisões reais sem prejudicar pessoas inocentes.
O Pentágono deve começar definindo o uso pretendido. Um modelo criado para garantia de qualidade exige evidências diferentes de um usado para recomendar uma conclusão de engano.
A documentação pública deve identificar se os resultados são consultivos ou determinantes. Ela também deve explicar se autoridades podem anulá-los e como essas anulações são revisadas.
Em seguida vem a verdade de referência. Pesquisadores precisam de um método confiável para saber quais participantes foram enganosos e quais foram sinceros.
Instruções de laboratório fornecem rótulos conhecidos, mas realismo limitado. Casos de campo fornecem realismo, mas frequentemente não têm rótulos certos.
Um programa de validação sério deve reconhecer essa tensão. Ele deve relatar os resultados separadamente, em vez de misturar conjuntos de dados diferentes em uma métrica favorável.
A avaliação deve incluir sensibilidade e especificidade. A sensibilidade mede com que frequência o sistema detecta casos-alvo, enquanto a especificidade mede com que frequência ele libera corretamente casos não-alvo.
Esses valores devem aparecer com taxas de falsos positivos, taxas de falsos negativos e resultados inconclusivos. Remover casos inconclusivos pode fazer o desempenho parecer melhor do que a experiência dos usuários.
Os resultados também devem ser reportados sob prevalência realista. Fazer triagem de uma força de trabalho geral com autorização de segurança difere matematicamente de avaliar suspeitos em uma investigação focada.
Suponha que um modelo seja testado com números iguais de indivíduos enganosos e sinceros. Sua precisão reportada pode parecer impressionante porque a amostra é artificialmente equilibrada.
Na triagem real, o engano grave pode ser muito mais raro. Mesmo uma taxa modesta de falsos positivos pode então produzir muito mais sinalizações inocentes do que detecções válidas.
Os avaliadores devem testar diferentes grupos demográficos e condições de saúde. As linhas de base fisiológicas podem variar com idade, medicação, deficiência, estresse, sono e inúmeros outros fatores.
O ponto não é exigir fisiologia idêntica. É determinar se os erros do sistema recaem de forma desigual sobre determinados grupos.
A detecção remota exige testes separados para iluminação, distância, movimento, vestimenta, características da pele, posicionamento da câmera e interferência ambiental. Um modelo pode falhar quando as condições de coleta mudam.
Testes em nível de local são essenciais. Resultados de um único laboratório controlado não devem autorizar uma implantação nacional.
O programa também deve testar contramedidas em condições adversariais. Os participantes precisam de incentivos e preparação que se aproximem melhor de tentativas reais de derrotar o sistema.
Os fatores humanos merecem igual atenção. Examinadores podem se tornar menos vigilantes quando o software apresenta uma pontuação confiante.
Pesquisadores chamam isso de viés de automação, a tendência de favorecer a recomendação de uma máquina mesmo quando há evidências contraditórias. O treinamento, por si só, nem sempre o elimina.
Um estudo adequado deve comparar decisões com e sem assistência algorítmica. Esse desenho pode mostrar se o sistema melhora o desempenho humano ou apenas altera a confiança.
Ele também deve medir resultados posteriores. Um sistema útil precisa melhorar investigações, reduzir acompanhamentos desnecessários ou apoiar decisões sólidas de autorização de segurança.
Exames mais rápidos não comprovam sucesso se criarem mais recursos, entrevistas repetidas, atrasos de pessoal ou becos sem saída investigativos.
Relatórios transparentes fortaleceriam a confiança. No mínimo, a DCSA deve divulgar protocolos de teste, descrições das populações, métricas de avaliação, limitações conhecidas e regras de governança.
Programas de segurança nacional não podem publicar todos os detalhes operacionais. No entanto, o sigilo não deve impedir que especialistas independentes avaliem a validade básica de uma tecnologia que afeta decisões sobre pessoal.
A replicação externa proporcionaria a salvaguarda mais forte. Um modelo deve resistir a testes feitos por pesquisadores que não o desenvolveram e não têm interesse na aquisição.
Essa exigência é especialmente importante para sistemas proprietários. Fornecedores podem proteger o código-fonte enquanto ainda apoiam avaliações controladas de terceiros.
O governo também deve definir previamente limiares de falha. Sem eles, as agências podem interpretar resultados mistos posteriormente e continuar o desenvolvimento apesar de evidências fracas.
Um limiar poderia especificar taxas máximas de falsos positivos em determinados casos de uso. Ele também poderia proibir ações adversas baseadas exclusivamente em um resultado automatizado.
O histórico justifica essa cautela. As National Academies alertaram que um refinamento adicional das técnicas convencionais provavelmente produziria apenas melhorias modestas de precisão.
O Polygraph Next merece um teste empírico justo. Ele não merece a presunção de que sensores mais novos e aprendizado de máquina já resolveram a ciência subjacente.
Três Sinais Mostrarão Para Onde o Polygraph Next Está Indo
A linguagem de financiamento, o desenho da validação e o escopo da aquisição revelarão se isso permanece pesquisa ou avança rumo ao julgamento operacional.
O primeiro sinal é a resposta do Congresso para o ano fiscal de 2027. Os legisladores podem fornecer os US$ 6,421 milhões solicitados, reduzi-los, rejeitá-los ou impor condições de relatório.
O financiamento integral sem exigências de avaliação daria à DCSA ampla margem para estruturar o programa internamente. Já o financiamento vinculado a uma análise independente colocaria a validação científica mais perto do centro do projeto.
Uma dotação orçamentária tardia também teria impacto. Ela poderia comprimir o cronograma de testes ou adiar marcos para exercícios fiscais posteriores.
O segundo sinal é a publicação de um protocolo de validação. Os leitores devem procurar desfechos definidos, populações realistas, premissas sobre taxas-base e resultados separados para triagem e investigações específicas.
Um protocolo focado principalmente na classificação em laboratório enfraqueceria a confiança em uma implantação ampla. A validação em campo, com divulgação transparente de erros, reforçaria o argumento a favor do programa.
A definição de “precisão” será especialmente reveladora. Qualquer resultado que exclua exames inconclusivos ou combine casos de uso não relacionados merece análise cuidadosa.
O terceiro sinal é o escopo dos primeiros contratos e protótipos. Avisos de contratação podem mostrar quais sensores, plataformas de análise e funções decisórias a DCSA pretende adquirir.
Um contrato restrito à pesquisa de medições manteria o projeto em uma fase exploratória. Um sistema concebido para alimentar pontuações em processos operacionais de verificação elevaria a urgência das questões de governança.
A linguagem dos contratos também poderia esclarecer a propriedade dos dados. O governo precisa ter o direito de auditar modelos, preservar registros de avaliação e investigar falhas de desempenho.
Esses sinais devem aparecer antes que alguém trate o Polygraph Next como um detector de mentiras por IA operacional do Pentágono. O registro atual sustenta apenas uma conclusão mais limitada.
O Pentágono identificou problemas reais em métodos de avaliação lentos, variáveis e envelhecidos. Propôs sensores e algoritmos modernos como caminho para aprimorá-los.
O que não demonstrou é que a IA possa inferir de forma confiável a decepção a partir da atividade fisiológica. Essa alegação precisa ser testada, e não incorporada ao nome do programa.
Pesquisadores, funcionários federais, contratados e defensores das liberdades civis devem acompanhar o padrão de evidência, não a sofisticação dos equipamentos. Medições melhores só importam quando sustentam conclusões válidas.
À medida que chegarem as primeiras decisões de financiamento, uma pergunta deve orientar o debate: o Polygraph Next testará se a IA melhora as avaliações de credibilidade ou presumirá essa melhora ao construir o sistema em torno dela?



