top of page

El plan del Pentágono para un detector de mentiras con IA antepone la automatización a la precisión demostrada

hace 2 horas
16 min de lectura

El plan del Pentágono para un detector de mentiras con IA busca 30,3 millones de dólares durante cinco años para modernizar una tecnología cuya base científica sigue siendo objeto de una intensa controversia. Denominado Polygraph+ o Polygraph Next, el programa combinaría detección fisiológica sin contacto con inteligencia artificial, aprendizaje automático y puntuación automatizada.

La Defense Counterintelligence and Security Agency, o DCSA, quiere iniciar la iniciativa con 6,421 millones de dólares en el ejercicio fiscal 2027. Su solicitud presupuestaria describe pruebas de campo, estudios de validación independientes, evaluaciones de prototipos, almacenamiento centralizado de datos y herramientas de apoyo a la decisión.

Eso parece un programa de ingeniería, pero su problema más difícil no es de ingeniería. Un sensor puede medir cambios fisiológicos con mayor precisión sin demostrar que esos cambios indiquen engaño.

Por tanto, la tensión en torno a Polygraph Next va más allá de una actualización rutinaria de equipos. El Pentágono quiere automatizar y ampliar las evaluaciones de credibilidad antes de resolver qué pueden inferir esas evaluaciones de forma fiable.

La comparación histórica importa. Una revisión histórica de las National Academies concluyó que los polígrafos convencionales funcionan mejor que el azar en algunas investigaciones específicas, pero siguen estando lejos de ser perfectos. Llegó a una conclusión mucho más dura sobre la evaluación de empleados, donde las personas inocentes pueden superar ampliamente en número a las amenazas reales para la seguridad.

El nuevo sistema promete mayor consistencia, velocidad y trazabilidad. Sin embargo, los documentos presupuestarios públicos no incluyen un objetivo de precisión, una tasa aceptable de falsos positivos, un protocolo de validación publicado ni un umbral de despliegue.

Esa información ausente determinará si Polygraph Next se convierte en un mejor instrumento de investigación o en una forma más rápida de producir conclusiones cuestionables.

Qué construiría el programa del Pentágono para un detector de mentiras con IA

Polygraph Next es una propuesta de investigación financiada, no un detector terminado con precisión demostrada.

El presupuesto de Polygraph Next del Pentágono sitúa el proyecto dentro de la cartera de investigación, desarrollo, pruebas y evaluación de DCSA. Los documentos datan la solicitud en abril de 2026.

El calendario propuesto contempla 6,421 millones de dólares para el ejercicio fiscal 2027. Los importes previstos incluyen después 6,449 millones en 2028, 6,158 millones en 2029, 5,660 millones en 2030 y 5,654 millones en 2031.

En conjunto, esas cifras anuales suman 30,342 millones de dólares. Los documentos clasifican el coste de finalización y el coste total del programa como “continuing”, lo que significa que la solicitud de cinco años no representa necesariamente un límite final.

No figura gasto de años anteriores para el proyecto en la tabla presupuestaria de investigación. Eso convierte al ejercicio fiscal 2027 en el punto de partida propuesto para este programa específico.

DCSA presenta Polygraph+ y Polygraph Next como nombres alternativos para la misma iniciativa de modernización. Su objetivo declarado es mejorar la precisión, la fiabilidad, la facilidad de uso y la trazabilidad en las evaluaciones federales de credibilidad.

El programa cuenta con varios componentes previstos. Uno es la puntuación automatizada, mediante la cual los algoritmos evaluarían señales y ayudarían a elaborar una valoración. Otro es la detección a distancia, que implica medir actividad fisiológica sin conectar sensores convencionales directamente a una persona.

La agencia también propone almacenamiento y análisis centralizados. Ese componente reuniría datos de los exámenes para su evaluación, comparación y posible desarrollo de modelos.

DCSA afirma que realizará estudios de validación independientes, pruebas de campo y evaluaciones de prototipos. También identifica al Applied Research Laboratory for Intelligence and Security y al Oak Ridge National Laboratory como socios de investigación.

Estos detalles establecen una vía de desarrollo, pero revelan poco sobre el modelo operativo final. Los documentos no explican qué señales fisiológicas utilizaría un sistema desplegado.

Tampoco especifican si la IA recomendaría puntuaciones, clasificaría exámenes, señalaría anomalías o influiría directamente en decisiones de personal. Esas funciones conllevan riesgos muy distintos.

Un algoritmo que ayuda a identificar sensores con ruido no equivale a otro que etiqueta a una persona como engañosa. Del mismo modo, una herramienta de apoyo a la decisión revisada por un examinador capacitado difiere de un sistema de evaluación ampliamente automatizado.

El alcance inmediato del programa es la evaluación de personal federal y la detección de amenazas internas. Estos entornos incluyen empleados, solicitantes, personal militar y contratistas que pueden necesitar acceso a información sensible.

Ese contexto eleva lo que está en juego. Un resultado erróneo puede retrasar una autorización, redirigir una investigación, perjudicar una carrera o aumentar las sospechas sobre una persona inocente.

La solicitud tampoco equivale a una asignación presupuestaria. El Congreso sigue controlando si los fondos propuestos estarán disponibles y puede modificar el importe, las condiciones o los requisitos de información.

Por ahora, Polygraph Next se entiende mejor como un plan gubernamental de investigación y adquisición. Tiene ambiciones, un presupuesto propuesto y socios institucionales, pero ningún rendimiento demostrado públicamente.

Por qué la evaluación de personal está bajo presión ahora

El programa aborda una carga operativa real, aunque su solución propuesta sigue siendo científicamente incierta.

DCSA ocupa una posición central en el sistema federal de evaluación de personal. Realiza investigaciones de antecedentes y respalda decisiones sobre el acceso a información clasificada en gran parte del gobierno.

Su National Center for Credibility Assessment establece estándares de formación y asesora a funcionarios de defensa e inteligencia sobre la política de polígrafos. La misión de evaluación de credibilidad del centro también incluye apoyo técnico, investigación, pruebas, supervisión de programas y auditorías.

Ese papel institucional da a DCSA una razón clara para modernizar sus herramientas. Los exámenes convencionales requieren personal capacitado, condiciones controladas, preparación de sensores, entrevistas e interpretación.

Esos requisitos limitan la capacidad de procesamiento. También pueden generar diferencias entre examinadores, ubicaciones, equipos y condiciones de prueba.

Los sensores sin contacto prometen una configuración más sencilla. La puntuación automatizada promete análisis más uniformes. Los datos centralizados prometen auditorías y trazabilidad más sólidas.

Cada objetivo tiene valor operativo. Sin embargo, ninguno demuestra que el sistema pueda distinguir con precisión el engaño de la ansiedad, el miedo, la confusión, la ira o la variación fisiológica normal.

El sistema más amplio de evaluación ya afronta presión por tecnología obsoleta y una modernización retrasada. DCSA está desarrollando la plataforma National Background Investigation Services para sustituir sistemas antiguos y respaldar reformas en todo el gobierno.

Una revisión de evaluación de personal de 2026 concluyó que DCSA realiza alrededor de dos millones de investigaciones de antecedentes cada año. También determinó que la agencia seguía sin contar con un calendario fiable para completar su principal programa tecnológico.

La misma revisión informó de que las alertas de evaluación continua pasaron de aproximadamente 30.000 por trimestre en el ejercicio fiscal 2023 a más de 100.000 durante el tercer trimestre del ejercicio fiscal 2025. La evaluación continua utiliza comprobaciones automatizadas de registros para identificar novedades que requieren revisión.

Ese aumento ilustra el desafío central. La automatización puede recopilar y señalar más información, pero también genera trabajo cuando los sistemas producen grandes cantidades de alertas.

Polygraph Next entra en este entorno como otro posible filtro. Si mejora la calidad de las señales y reduce las puntuaciones inconsistentes, podría ayudar a los investigadores a concentrar su atención.

Si sus clasificaciones están mal calibradas, puede provocar lo contrario. Podría generar alertas adicionales, reforzar sospechas débiles y ampliar la carga de trabajo de los revisores humanos.

Por tanto, la presión recae sobre DCSA, los solicitantes de autorizaciones y las agencias que buscan personal cualificado. DCSA necesita procesos más rápidos, mientras que los solicitantes necesitan decisiones precisas y explicables.

Los empleadores también necesitan plazos previsibles para las autorizaciones. Los contratistas de defensa no pueden asignar a algunos empleados a trabajos clasificados hasta que el gobierno complete la evaluación requerida.

Los funcionarios de seguridad afrontan el riesgo opuesto. Avanzar demasiado rápido puede dejar a las agencias vulnerables al espionaje, las divulgaciones no autorizadas, la coerción u otras amenazas internas.

Por eso un detector más rápido resulta atractivo. Parece ofrecer eficiencia sin reducir el escrutinio.

Sin embargo, la velocidad solo ayuda cuando la clasificación subyacente es fiable. Procesar con mayor rapidez señales fisiológicas ambiguas no produce automáticamente una mejor seguridad.

Por tanto, Polygraph Next debe satisfacer dos estándares. Debe reducir la fricción operativa y demostrar que sus resultados mejoran las decisiones en condiciones realistas.

El segundo estándar es más difícil. Requiere evidencia sobre errores entre diferentes personas, entornos, formatos de preguntas, condiciones médicas y niveles de estrés.

Sin esa evidencia, el Pentágono corre el riesgo de tratar la capacidad de procesamiento como si fuera precisión. No son medidas intercambiables.

Cómo Polygraph Next utiliza IA sin resolver el problema de la inferencia

La IA puede estandarizar la puntuación de señales fisiológicas, pero no puede hacer que esas señales representen de forma exclusiva las mentiras.

Un polígrafo convencional registra cambios como la respiración, la actividad cardiovascular y la conductancia de la piel. Los examinadores comparan respuestas entre preguntas e interpretan si determinadas diferencias sugieren engaño.

Polygraph Next propone añadir puntuación mediante IA y aprendizaje automático a este proceso. El aprendizaje automático identifica patrones estadísticos en ejemplos y aplica esos patrones a datos nuevos.

Ese enfoque podría reducir parte de la variación entre examinadores. Un algoritmo puede aplicar la misma regla matemática a miles de segmentos de señales.

También puede combinar más variables de las que una persona puede evaluar fácilmente. La sincronización, la forma de la señal, la duración de la respuesta y las correlaciones entre sensores podrían influir en una puntuación.

La detección a distancia cambia el método de recopilación. En lugar de depender por completo de equipos conectados, un sistema podría obtener algunas mediciones fisiológicas desde la distancia.

El presupuesto no identifica el paquete final de sensores. Por tanto, cualquier descripción específica más allá de la monitorización fisiológica sin contacto sería prematura.

Aun así, la arquitectura crea una cadena clara de inferencia. Primero, los sensores miden una respuesta física. Después, el software extrae características de esa respuesta.

Luego, un modelo convierte esas características en una puntuación o recomendación. Por último, un examinador o funcionario interpreta ese resultado en un contexto de seguridad.

Los errores pueden introducirse en cada etapa. Un sensor puede captar ruido, un modelo puede aprender correlaciones poco fiables y un responsable de la decisión puede otorgar un peso excesivo al resultado.

La mayor dificultad se encuentra entre la respuesta medida y el estado mental que se afirma. Una mayor activación puede acompañar al engaño, pero también puede acompañar al miedo a que no se crea a alguien.

Un solicitante veraz puede reaccionar con fuerza ante una acusación. Una persona engañosa puede mantenerse tranquila o utilizar una contramedida que altere el patrón registrado.

La revisión científica sobre el polígrafo de las National Academies examinó este problema antes de que el aprendizaje automático moderno se generalizara. Su advertencia científica central sigue siendo aplicable.

Las respuestas fisiológicas no se corresponden exclusivamente con el engaño. Eso significa que un clasificador mejorado puede volverse más consistente sin volverse más válido.

Consideremos un modelo entrenado con exámenes anteriores. Las etiquetas históricas pueden provenir de juicios de examinadores, confesiones, resultados de casos o instrucciones de laboratorio.

Cada fuente de etiquetas tiene debilidades. Los juicios de los examinadores pueden reproducir los supuestos del método, mientras que las confesiones pueden no estar disponibles o ser incompletas.

Los experimentos de laboratorio proporcionan una verdad de referencia más clara porque los investigadores saben quién recibió instrucciones de mentir. Sin embargo, una mentira simulada rara vez conlleva las consecuencias de un examen real para la habilitación de seguridad.

Los modelos también pueden aprender atajos. Pueden asociar el movimiento, el estilo de habla, las condiciones de salud, las características demográficas o los entornos de prueba con las etiquetas de los datos de entrenamiento.

Un alto rendimiento dentro de un conjunto de datos no resolvería esa preocupación. El sistema debe funcionar con nuevos sujetos, nuevos lugares, nuevos examinadores y tasas base realistas.

Las tasas base describen cuán común es la condición objetivo dentro de la población evaluada. En la selección de personal, se supone que los infractores graves de seguridad son poco frecuentes.

Esa rareza hace que los falsos positivos sean especialmente importantes. Incluso una prueba que parece precisa en experimentos equilibrados puede señalar a muchas personas inocentes en una plantilla laboral con baja prevalencia.

Una capa de puntuación basada en IA no puede escapar de esas matemáticas. En todo caso, la automatización hace que la calibración sea más importante porque puede aplicar el mismo umbral a mayor escala.

La explicabilidad plantea otro desafío. Los investigadores necesitan saber si una puntuación refleja una respuesta significativa, mala calidad de señal, una condición física inusual o una limitación del modelo.

Una puntuación de confianza genérica no proporciona esa respuesta. Una alta confianza del modelo puede coexistir con una clasificación errónea realizada con seguridad.

El papel más defendible de la IA sería limitado y comprobable. Podría mejorar el control de calidad, detectar mediciones corruptas o comparar la consistencia de las puntuaciones con la de examinadores capacitados.

Un sistema comercializado como detector de mentiras con IA hace una afirmación mucho más amplia. Implica una conexión fiable entre la fisiología observable y el engaño que los investigadores no han establecido.

La disyuntiva central es la consistencia frente a la validez

Polygraph Next puede hacer que las evaluaciones sean más uniformes mientras hace que una inferencia no demostrada parezca más autoritativa.

El argumento práctico más sólido de DCSA se refiere a la estandarización. Los programas federales se benefician cuando los procedimientos producen registros comparables entre examinadores y ubicaciones.

La puntuación automatizada puede documentar qué mediciones influyeron en un resultado. Los sistemas centralizados pueden conservar registros y respaldar auditorías posteriores.

Estas características pueden reducir la variación arbitraria. También podrían revelar patrones de administración inconsistente que los procesos anteriores no lograron detectar.

Sin embargo, la consistencia no es exactitud. Una regla con una escala incorrecta puede producir errores idénticos cada vez.

Esta distinción importa porque las puntuaciones generadas por computadora suelen transmitir una apariencia de objetividad. Los funcionarios pueden deferir a un resultado numérico incluso cuando su significado científico siga siendo incierto.

La etiqueta «IA» puede amplificar ese efecto. Los usuarios pueden suponer que un sistema detectó una señal sutil de engaño cuando en realidad aprendió correlaciones específicas de sus datos de entrenamiento.

Los documentos públicos del Pentágono dicen que el proyecto incluirá validación independiente. Es un compromiso importante, pero la independencia exige más que asignar un equipo separado.

Los evaluadores necesitan acceso a métodos, conjuntos de datos, definiciones de error y condiciones de prueba. También deben poder publicar hallazgos desfavorables sin presión del programa.

La validación debe separar los exámenes de incidentes específicos de la selección general. Ambas aplicaciones involucran poblaciones, preguntas, incentivos y disyuntivas estadísticas diferentes.

Las Academias Nacionales concluyeron que los polígrafos pueden discriminar por encima del azar en algunos incidentes específicos. También determinaron que la evidencia es más débil para la selección y advirtieron contra depender de los polígrafos para decisiones de seguridad de empleados.

Esa diferencia debería dar forma a Polygraph Next desde el inicio. Una única cifra de precisión en los titulares ocultaría las aplicaciones donde los errores importan más.

El sistema también necesita límites claros de decisión. Una puntuación de investigación no debería convertirse silenciosamente en una base para una acción adversa antes de que se comprendan sus limitaciones.

Históricamente, la política federal ha tratado los resultados del polígrafo como una parte de un proceso más amplio. Los investigadores pueden utilizar los exámenes para orientar entrevistas o identificar asuntos que requieren revisión adicional.

Polygraph Next podría desdibujar ese límite si los resultados automatizados fluyen directamente hacia otros sistemas de verificación. La analítica centralizada puede hacer que una puntuación sea transferible y persistente.

La transferibilidad aumenta la eficiencia, pero también aumenta las consecuencias del error. Un resultado cuestionable puede acompañar a un solicitante a través de revisiones, asignaciones o agencias.

Los documentos presupuestarios mencionan la trazabilidad como un beneficio. Una trazabilidad adecuada debería mostrar quién utilizó una puntuación, cómo afectó a una decisión y si las pruebas posteriores la respaldaron.

También debería permitir a los funcionarios corregir registros. De lo contrario, los datos centralizados pueden preservar los errores con mayor eficacia de la que preservan la rendición de cuentas.

La privacidad es otra parte de esta disyuntiva. Los datos fisiológicos pueden revelar información más allá de la pregunta que formuló un examinador.

Los documentos no describen públicamente los períodos de conservación, las reglas de acceso, los permisos para entrenar modelos ni los límites al uso secundario. Esas políticas merecen escrutinio antes de que se acumulen grandes conjuntos de datos.

La ciberseguridad también importa. Un repositorio centralizado de evaluaciones de credibilidad contendría información personal y de seguridad nacional sensible.

DCSA ya gestiona sistemas que contienen amplios datos de investigaciones de antecedentes. Añadir registros fisiológicos y resultados de modelos profundizaría la sensibilidad de ese entorno.

El gobierno también debe considerar el comportamiento adversarial. Los sujetos con fuertes incentivos pueden estudiar los métodos de prueba e intentar manipular sus respuestas.

DCSA identifica explícitamente las contramedidas como un problema de la tecnología actual. Sin embargo, el aprendizaje automático no las derrota automáticamente.

Un modelo entrenado con contramedidas conocidas puede detectar patrones familiares. Los adversarios pueden responder desarrollando técnicas fuera de la distribución de entrenamiento.

Esto crea una carrera armamentista entre detección y evasión. Por tanto, las afirmaciones de una mayor resiliencia deben probarse frente a participantes adaptativos, no solo voluntarios cooperativos.

La disyuntiva central del programa ahora está clara. La automatización puede hacer el proceso más rápido, consistente y fácil de auditar.

Al mismo tiempo, puede ampliar los falsos positivos, ocultar supuestos inciertos y dar a juicios controvertidos una apariencia numérica. La gobernanza de la tecnología debe avanzar junto con sus sensores y modelos.

Lo que debe demostrar la validación independiente

La prueba decisiva no es si Polygraph Next reconoce patrones de laboratorio, sino si mejora las decisiones reales sin perjudicar a personas inocentes.

El Pentágono debería comenzar definiendo el uso previsto. Un modelo diseñado para el aseguramiento de la calidad necesita pruebas distintas de uno utilizado para recomendar una conclusión de engaño.

La documentación pública debería identificar si los resultados son consultivos o determinantes. También debería explicar si los funcionarios pueden anularlos y cómo se revisan esas anulaciones.

A continuación viene la verdad de referencia. Los investigadores necesitan un método creíble para saber qué participantes fueron engañosos y cuáles dijeron la verdad.

Las instrucciones de laboratorio proporcionan etiquetas conocidas, pero realismo limitado. Los casos de campo aportan realismo, pero a menudo carecen de etiquetas seguras.

Un programa de validación serio debe reconocer esa tensión. Debe informar los resultados por separado en lugar de combinar conjuntos de datos distintos en una sola métrica favorable.

La evaluación debe incluir sensibilidad y especificidad. La sensibilidad mide con qué frecuencia el sistema detecta los casos objetivo, mientras que la especificidad mide con qué frecuencia descarta correctamente los casos no objetivo.

Esos valores deberían aparecer junto con tasas de falsos positivos, falsos negativos y resultados no concluyentes. Eliminar los casos no concluyentes puede hacer que el rendimiento parezca mejor de lo que experimentan los usuarios.

Los resultados también deberían comunicarse bajo una prevalencia realista. Examinar a una plantilla general con habilitación de seguridad es matemáticamente distinto de evaluar sospechosos en una investigación focalizada.

Supongamos que un modelo se prueba con cantidades iguales de sujetos engañosos y veraces. Su precisión declarada puede parecer impresionante porque la muestra está equilibrada artificialmente.

En la selección real, el engaño grave puede ser mucho más raro. Incluso una tasa modesta de falsos positivos puede producir entonces muchas más alertas de inocentes que detecciones válidas.

Los evaluadores deben probar diferentes grupos demográficos y condiciones de salud. Las líneas de base fisiológicas pueden variar con la edad, la medicación, la discapacidad, el estrés, el sueño y muchos otros factores.

El objetivo no es exigir una fisiología idéntica. Es determinar si los errores del sistema recaen de forma desigual sobre distintos grupos.

La detección remota requiere pruebas separadas para iluminación, distancia, movimiento, ropa, características de la piel, colocación de la cámara e interferencia ambiental. Un modelo puede fallar cuando cambian las condiciones de recopilación.

Las pruebas a nivel de sitio son esenciales. Los resultados de un laboratorio controlado no deberían autorizar un despliegue nacional.

El programa también debería probar contramedidas en condiciones adversariales. Los participantes necesitan incentivos y preparación que se aproximen mejor a intentos reales de derrotar al sistema.

Los factores humanos merecen la misma atención. Los examinadores pueden volverse menos vigilantes cuando el software presenta una puntuación confiada.

Los investigadores llaman a esto sesgo de automatización: la tendencia a favorecer la recomendación de una máquina incluso cuando existen pruebas contradictorias. La capacitación por sí sola no siempre lo elimina.

Un estudio adecuado debería comparar decisiones con y sin asistencia algorítmica. Ese diseño puede mostrar si el sistema mejora el rendimiento humano o simplemente cambia la confianza.

También debería medir los resultados posteriores. Un sistema útil debe mejorar las investigaciones, reducir el seguimiento innecesario o respaldar decisiones sólidas sobre habilitaciones de seguridad.

Los exámenes más rápidos no demuestran éxito si generan más apelaciones, entrevistas repetidas, retrasos de personal o callejones sin salida en las investigaciones.

La presentación transparente de informes reforzaría la confianza. Como mínimo, DCSA debería publicar protocolos de prueba, descripciones de la población, métricas de evaluación, limitaciones conocidas y normas de gobernanza.

Los programas de seguridad nacional no pueden publicar todos los detalles operativos. Sin embargo, el secreto no debería impedir que expertos independientes evalúen la validez básica de una tecnología que afecta las decisiones sobre personal.

La replicación externa proporcionaría la salvaguarda más sólida. Un modelo debería superar pruebas realizadas por investigadores que no lo construyeron y no tienen interés en la contratación.

Ese requisito es especialmente importante para los sistemas propietarios. Los proveedores pueden proteger el código fuente y, al mismo tiempo, respaldar evaluaciones controladas de terceros.

El gobierno también debería predefinir umbrales de fracaso. Sin ellos, las agencias pueden interpretar resultados mixtos después de los hechos y continuar el desarrollo pese a pruebas débiles.

Un umbral podría especificar tasas máximas de falsos positivos en casos de uso concretos. También podría prohibir acciones adversas basadas únicamente en un resultado automatizado.

El historial justifica esa cautela. Las Academias Nacionales advirtieron que un mayor refinamiento de las técnicas convencionales probablemente produciría solo mejoras modestas de precisión.

Polygraph Next merece una prueba empírica justa. No merece que se asuma que los sensores más nuevos y el aprendizaje automático ya han resuelto la ciencia subyacente.

Tres señales mostrarán hacia dónde se dirige Polygraph Next

El lenguaje de financiación, el diseño de validación y el alcance de la contratación revelarán si esto sigue siendo investigación o avanza hacia el juicio operativo.

La primera señal es la respuesta del Congreso para el año fiscal 2027. Los legisladores pueden proporcionar los $6.421 millones solicitados, reducirlos, rechazarlos o imponer condiciones de presentación de informes.

Una financiación completa sin requisitos de evaluación daría a DCSA un amplio margen para configurar el programa internamente. Una financiación vinculada a una revisión independiente situaría la validación científica más cerca del centro.

Una asignación presupuestaria retrasada también tendría importancia. Podría comprimir el calendario de pruebas o trasladar hitos a ejercicios fiscales posteriores.

La segunda señal es la publicación de un protocolo de validación. Los lectores deberían buscar criterios de evaluación definidos, poblaciones realistas, supuestos sobre tasas base y resultados separados para los controles de selección y las investigaciones específicas.

Un protocolo centrado principalmente en la clasificación de laboratorio reduciría la confianza en un despliegue amplio. La validación en campo con informes transparentes de errores reforzaría la justificación del programa.

La definición de «precisión» será especialmente reveladora. Cualquier resultado que excluya exámenes no concluyentes o combine casos de uso no relacionados merece un escrutinio minucioso.

La tercera señal es el alcance de los primeros contratos y prototipos. Los avisos de contratación podrían mostrar qué sensores, plataformas analíticas y funciones de decisión quiere adquirir DCSA.

Un contrato limitado a la investigación de mediciones mantendría el proyecto en un marco exploratorio. Un sistema diseñado para incorporar puntuaciones a los procesos operativos de verificación elevaría la urgencia de las cuestiones de gobernanza.

El lenguaje contractual también podría aclarar la propiedad de los datos. El gobierno necesita derechos para auditar modelos, conservar registros de evaluación e investigar fallos de rendimiento.

Estas señales deberían aparecer antes de que alguien trate a Polygraph Next como un detector de mentiras con IA operativo del Pentágono. El registro actual solo respalda una conclusión más limitada.

El Pentágono ha identificado problemas reales en métodos de evaluación lentos, variables y anticuados. Ha propuesto sensores y algoritmos modernos como vía de mejora.

Lo que no ha demostrado es que la IA pueda inferir de forma fiable el engaño a partir de la actividad fisiológica. Esa afirmación debe someterse a prueba, no incorporarse al nombre del programa.

Investigadores, empleados federales, contratistas y defensores de las libertades civiles deberían vigilar el estándar de evidencia, no la sofisticación del equipo. Las mejores mediciones solo importan cuando respaldan conclusiones válidas.

A medida que lleguen las primeras decisiones de financiación, una pregunta debería guiar el debate: ¿Polygraph Next pondrá a prueba si la IA mejora las evaluaciones de credibilidad, o asumirá esa mejora mientras construye el sistema en torno a ella?

 
 

Empieza gratis

Un asistente de IA local-first con gestión del conocimiento personal

Para ofrecer una mejor experiencia con la IA,

actualmente remio solo es compatible con Windows 10+ (x64) y M-Chip Macs.

Tu aliado de IA para el trabajo
Haz más con remio

Planifica. Crea. Entrega.
Todo en un solo lugar.

bottom of page