top of page

Le projet de détecteur de mensonges par IA du Pentagone privilégie l’automatisation à une précision démontrée

il y a 2 heures
17 min de lecture

Le projet de détecteur de mensonges par IA du Pentagone sollicite 30,3 millions de dollars sur cinq ans afin de moderniser une technologie dont les fondements scientifiques restent vivement contestés. Baptisé Polygraph+ ou Polygraph Next, le programme combinerait la détection physiologique sans contact avec l’intelligence artificielle, l’apprentissage automatique et l’évaluation automatisée.

La Defense Counterintelligence and Security Agency, ou DCSA, souhaite lancer l’effort avec 6,421 millions de dollars pour l’exercice 2027. Sa demande budgétaire décrit des essais sur le terrain, des études de validation indépendantes, des évaluations de prototypes, un stockage centralisé des données et des outils d’aide à la décision.

Cela ressemble à un programme d’ingénierie, mais son problème le plus difficile n’est pas l’ingénierie. Un capteur peut mesurer plus précisément les changements physiologiques sans pour autant établir que ces changements indiquent une tromperie.

L’enjeu autour de Polygraph Next dépasse donc une simple mise à niveau d’équipement. Le Pentagone souhaite automatiser et étendre les évaluations de crédibilité avant d’avoir résolu ce que ces évaluations peuvent déduire de manière fiable.

La comparaison historique importe. Une étude marquante des National Academies a conclu que les polygraphes conventionnels donnent de meilleurs résultats que le hasard dans certaines enquêtes précises, tout en restant loin d’être parfaits. Elle est arrivée à une conclusion bien plus sévère concernant le contrôle des employés, où les personnes innocentes peuvent être bien plus nombreuses que les véritables menaces pour la sécurité.

Le nouveau système promet une meilleure cohérence, davantage de rapidité et de traçabilité. Toutefois, les documents budgétaires publics ne précisent ni objectif de précision, ni taux acceptable de faux positifs, ni protocole de validation publié, ni seuil de déploiement.

Ces informations manquantes détermineront si Polygraph Next devient un meilleur instrument de recherche ou un moyen plus rapide de produire des conclusions contestables.

Ce que construirait le programme de détecteur de mensonges par IA du Pentagone

Polygraph Next est une proposition de recherche financée, et non un détecteur achevé dont la précision a été démontrée.

Le budget Polygraph Next du Pentagone inscrit le projet dans le portefeuille de recherche, développement, essais et évaluation de la DCSA. Les documents datent la demande d’avril 2026.

Le calendrier proposé prévoit 6,421 millions de dollars pour l’exercice 2027. Les montants prévus comprennent ensuite 6,449 millions de dollars en 2028, 6,158 millions en 2029, 5,660 millions en 2030 et 5,654 millions en 2031.

Ensemble, ces montants annuels totalisent 30,342 millions de dollars. Les documents qualifient le coût d’achèvement et le coût total du programme de « continuing », ce qui signifie que la demande sur cinq ans ne constitue pas nécessairement un plafond définitif.

Aucune dépense d’exercice antérieur n’apparaît pour le projet dans le tableau du budget de recherche. L’exercice 2027 constituerait donc le point de départ proposé pour ce programme précis.

La DCSA présente Polygraph+ et Polygraph Next comme des noms alternatifs pour le même effort de modernisation. Son objectif déclaré est d’améliorer la précision, la fiabilité, l’utilisabilité et la traçabilité des évaluations fédérales de crédibilité.

Le programme comporte plusieurs composantes prévues. L’une d’elles est l’évaluation automatisée, dans laquelle des algorithmes évalueraient les signaux et contribueraient à produire une évaluation. Une autre est la détection à distance, c’est-à-dire la mesure de l’activité physiologique sans fixer directement des capteurs conventionnels sur un sujet.

L’agence propose également un stockage et des analyses centralisés. Cette composante rassemblerait les données issues des examens à des fins d’évaluation, de comparaison et de développement potentiel de modèles.

La DCSA indique qu’elle mènera des études de validation indépendantes, des essais sur le terrain et des évaluations de prototypes. Elle cite également l’Applied Research Laboratory for Intelligence and Security et l’Oak Ridge National Laboratory comme partenaires de recherche.

Ces éléments définissent une trajectoire de développement, mais révèlent peu de choses sur le modèle opérationnel final. Les documents n’expliquent pas quels signaux physiologiques utiliserait un système déployé.

Ils ne précisent pas non plus si l’IA recommanderait des scores, classifierait les examens, signalerait des anomalies ou influerait directement sur les décisions relatives au personnel. Ces rôles comportent des risques très différents.

Un algorithme qui aide à identifier des capteurs produisant du bruit n’équivaut pas à un algorithme qui qualifie une personne de trompeuse. De même, un outil d’aide à la décision examiné par un évaluateur formé diffère d’un système de contrôle largement automatisé.

Le périmètre immédiat du programme concerne la vérification fédérale des antécédents du personnel et la détection des menaces internes. Ces contextes impliquent des employés, des candidats, des militaires et des sous-traitants susceptibles d’avoir besoin d’accéder à des informations sensibles.

Ce contexte augmente les enjeux. Un résultat erroné peut retarder une habilitation, réorienter une enquête, nuire à une carrière ou accroître les soupçons envers une personne innocente.

La demande n’est pas non plus équivalente à une appropriation budgétaire. Le Congrès conserve le contrôle sur la disponibilité des fonds proposés et peut modifier le montant, les conditions ou les exigences de rapport.

Pour l’instant, Polygraph Next doit surtout être compris comme un plan gouvernemental de recherche et d’acquisition. Il comporte des ambitions, un budget proposé et des partenaires institutionnels, mais aucune performance publiquement démontrée.

Pourquoi la vérification du personnel est aujourd’hui sous pression

Le programme répond à une véritable contrainte opérationnelle, même si la solution proposée reste scientifiquement incertaine.

La DCSA occupe une position centrale dans le système fédéral de vérification des antécédents. Elle mène des enquêtes de sécurité et soutient les décisions d’accès aux informations classifiées dans une grande partie de l’administration.

Son National Center for Credibility Assessment établit des normes de formation et conseille les responsables de la défense et du renseignement sur la politique relative au polygraphe. La mission d’évaluation de crédibilité du centre comprend également un soutien technique, la recherche, les essais, la supervision des programmes et les audits.

Ce rôle institutionnel donne à la DCSA une raison claire de moderniser ses outils. Les examens conventionnels exigent du personnel formé, des conditions contrôlées, la préparation des capteurs, des entretiens et une interprétation.

Ces exigences limitent le débit. Elles peuvent également créer des différences entre les évaluateurs, les sites, les équipements et les conditions d’essai.

Les capteurs sans contact promettent une mise en place plus simple. L’évaluation automatisée promet une analyse plus cohérente. Les données centralisées promettent des audits et une traçabilité renforcés.

Chaque objectif présente une valeur opérationnelle. Aucun, toutefois, n’établit que le système peut distinguer avec précision la tromperie de l’anxiété, de la peur, de la confusion, de la colère ou de variations physiologiques ordinaires.

Le système de vérification au sens large subit déjà la pression de technologies vieillissantes et d’une modernisation retardée. La DCSA développe la plateforme National Background Investigation Services afin de remplacer des systèmes plus anciens et de soutenir des réformes à l’échelle de l’administration.

Une évaluation de la vérification du personnel publiée en 2026 a constaté que la DCSA réalise environ deux millions d’enquêtes de sécurité chaque année. Elle a également conclu que l’agence ne disposait toujours pas d’un calendrier fiable pour achever son principal programme technologique.

Cette même évaluation indique que les alertes de vérification continue sont passées d’environ 30 000 par trimestre au cours de l’exercice 2023 à plus de 100 000 durant le troisième trimestre de l’exercice 2025. La vérification continue utilise des contrôles automatisés des dossiers afin d’identifier des évolutions nécessitant un examen.

Cette hausse illustre le défi central. L’automatisation peut recueillir et signaler davantage d’informations, mais elle crée aussi du travail lorsque les systèmes produisent un grand nombre d’alertes.

Polygraph Next arrive dans cet environnement comme un autre filtre potentiel. S’il améliore la qualité des signaux et réduit l’incohérence des évaluations, il pourrait aider les enquêteurs à concentrer leur attention.

Si ses classifications sont mal calibrées, il peut produire l’effet inverse. Il pourrait générer des alertes supplémentaires, renforcer des soupçons fragiles et alourdir la charge de travail des examinateurs humains.

La pression pèse donc sur la DCSA, les demandeurs d’habilitation et les agences à la recherche de personnel qualifié. La DCSA a besoin de processus plus rapides, tandis que les candidats ont besoin de décisions précises et explicables.

Les employeurs ont également besoin de délais d’habilitation prévisibles. Les sous-traitants de la défense ne peuvent pas affecter certains employés à des travaux classifiés tant que l’administration n’a pas achevé les vérifications requises.

Les responsables de la sécurité font face au risque inverse. Aller trop vite peut exposer les agences à l’espionnage, aux divulgations non autorisées, à la coercition ou à d’autres menaces internes.

C’est pourquoi un détecteur plus rapide semble attrayant. Il paraît offrir davantage d’efficacité sans réduire le niveau de contrôle.

Pourtant, la rapidité n’aide que lorsque la classification sous-jacente est digne de confiance. Le traitement plus rapide de signaux physiologiques ambigus ne produit pas automatiquement une meilleure sécurité.

Polygraph Next doit donc satisfaire deux exigences. Il doit réduire les frictions opérationnelles et démontrer que ses résultats améliorent les décisions dans des conditions réalistes.

La seconde exigence est plus difficile. Elle requiert des preuves sur les erreurs commises selon les personnes, les environnements, les formats de questions, les conditions médicales et les niveaux de stress.

Sans ces preuves, le Pentagone risque de confondre débit et précision. Ces mesures ne sont pas interchangeables.

Comment Polygraph Next utilise l’IA sans résoudre le problème de l’inférence

L’IA peut standardiser l’évaluation des signaux physiologiques, mais elle ne peut pas faire de ces signaux des représentations uniques du mensonge.

Un polygraphe conventionnel enregistre des changements tels que la respiration, l’activité cardiovasculaire et la conductance cutanée. Les évaluateurs comparent les réponses aux différentes questions et interprètent si certaines différences suggèrent une tromperie.

Polygraph Next propose d’ajouter à ce processus l’IA et une évaluation fondée sur l’apprentissage automatique. L’apprentissage automatique identifie des motifs statistiques dans des exemples et applique ces motifs à de nouvelles données.

Cette approche pourrait réduire certaines variations d’un évaluateur à l’autre. Un algorithme peut appliquer la même règle mathématique à des milliers de segments de signal.

Il peut également combiner davantage de variables qu’une personne ne peut facilement évaluer. Le moment de la réponse, la forme du signal, la durée de la réponse et les corrélations entre capteurs pourraient tous influencer un score.

La détection à distance modifie la méthode de collecte. Au lieu de dépendre entièrement d’équipements fixés au sujet, un système pourrait obtenir certaines mesures physiologiques à distance.

Le budget n’identifie pas l’ensemble final de capteurs. Toute description précise allant au-delà de la surveillance physiologique sans contact serait donc prématurée.

L’architecture crée néanmoins une chaîne d’inférence claire. Les capteurs mesurent d’abord une réponse physique. Le logiciel extrait des caractéristiques de cette réponse.

Un modèle convertit ensuite ces caractéristiques en score ou en recommandation. Enfin, un évaluateur ou un responsable interprète ce résultat dans un contexte de sécurité.

Des erreurs peuvent survenir à chaque étape. Un capteur peut enregistrer du bruit, un modèle peut apprendre des corrélations peu fiables et un décideur peut accorder un poids excessif au résultat.

La plus grande difficulté se situe entre la réponse mesurée et l’état mental revendiqué. Une activation physiologique accrue peut accompagner la tromperie, mais aussi la peur de ne pas être cru.

Un candidat sincère peut réagir fortement à une accusation. Une personne trompeuse peut rester calme ou employer une contre-mesure qui modifie le schéma enregistré.

L’étude scientifique sur le polygraphe des National Academies a examiné ce problème avant que l’apprentissage automatique moderne ne se généralise. Son avertissement scientifique central reste valable.

Les réponses physiologiques ne correspondent pas exclusivement à la tromperie. Cela signifie qu’un classificateur amélioré peut devenir plus cohérent sans devenir plus valide.

Considérez un modèle entraîné sur des examens antérieurs. Les étiquettes historiques peuvent provenir de jugements d’examinateurs, d’aveux, de l’issue d’affaires ou d’instructions données en laboratoire.

Chaque source d’étiquettes présente des faiblesses. Les jugements d’examinateurs peuvent reproduire les hypothèses de la méthode, tandis que les aveux peuvent être indisponibles ou incomplets.

Les expériences en laboratoire offrent une vérité de terrain plus claire, car les chercheurs savent qui a reçu l’instruction de mentir. Cependant, un mensonge simulé entraîne rarement les conséquences d’un véritable examen d’habilitation.

Les modèles peuvent aussi apprendre des raccourcis. Ils peuvent associer le mouvement, la façon de parler, l’état de santé, des caractéristiques démographiques ou les environnements de test aux étiquettes présentes dans les données d’entraînement.

De bonnes performances au sein d’un seul jeu de données ne suffiraient pas à dissiper cette inquiétude. Le système doit fonctionner avec de nouveaux sujets, sur de nouveaux sites, avec de nouveaux examinateurs et selon des taux de base réalistes.

Les taux de base décrivent la fréquence de la condition ciblée au sein de la population testée. Dans le cadre du contrôle du personnel, les personnes commettant de graves violations de la sécurité sont vraisemblablement rares.

Cette rareté rend les faux positifs particulièrement importants. Même un test qui paraît précis dans des expériences équilibrées peut signaler de nombreuses personnes innocentes dans une main-d’œuvre où la prévalence est faible.

Une couche de notation par IA ne peut échapper à ces calculs. L’automatisation rend au contraire l’étalonnage plus important, car elle peut appliquer le même seuil à plus grande échelle.

L’explicabilité pose un autre défi. Les enquêteurs doivent savoir si un score reflète une réponse significative, une mauvaise qualité de signal, un état physique inhabituel ou une limite du modèle.

Un score de confiance générique ne fournit pas cette réponse. Une forte confiance du modèle peut coexister avec une classification erronée formulée avec assurance.

Le rôle le plus défendable de l’IA serait limité et vérifiable. Elle pourrait améliorer le contrôle qualité, détecter des mesures corrompues ou comparer la cohérence de la notation avec celle d’examinateurs formés.

Un système présenté comme un détecteur de mensonges par IA avance une affirmation bien plus large. Il implique un lien fiable entre une physiologie observable et la tromperie que les chercheurs n’ont pas établi.

Le compromis central oppose cohérence et validité

Polygraph Next peut rendre les évaluations plus uniformes tout en donnant une apparence plus autoritaire à une inférence non prouvée.

L’argument pratique le plus solide de la DCSA concerne la normalisation. Les programmes fédéraux bénéficient de procédures produisant des dossiers comparables d’un examinateur et d’un lieu à l’autre.

La notation automatisée peut documenter les mesures ayant influencé un résultat. Les systèmes centralisés peuvent conserver les dossiers et faciliter les audits ultérieurs.

Ces fonctionnalités peuvent réduire les variations arbitraires. Elles pourraient également révéler des schémas d’administration incohérente que les anciens processus ne parvenaient pas à détecter.

Cependant, la cohérence n’est pas l’exactitude. Une règle graduée selon une mauvaise échelle peut produire les mêmes erreurs à chaque fois.

Cette distinction importe parce que les scores générés par ordinateur revêtent souvent une apparence d’objectivité. Les responsables peuvent s’en remettre à un résultat chiffré alors même que sa signification scientifique demeure incertaine.

L’étiquette « IA » peut amplifier cet effet. Les utilisateurs peuvent supposer qu’un système a détecté un subtil signal de tromperie alors qu’il a en réalité appris des corrélations propres à ses données d’entraînement.

Les documents publics du Pentagone indiquent que le projet comprendra une validation indépendante. C’est un engagement important, mais l’indépendance exige davantage que l’affectation d’une équipe distincte.

Les évaluateurs doivent avoir accès aux méthodes, aux jeux de données, aux définitions d’erreur et aux conditions de test. Ils doivent aussi pouvoir publier des résultats défavorables sans subir la pression du programme.

La validation devrait distinguer les examens liés à un incident précis du contrôle à grande échelle. Ces deux applications impliquent des populations, des questions, des incitations et des compromis statistiques différents.

Les National Academies ont conclu que les polygraphes peuvent distinguer les cas mieux que le hasard dans certains incidents précis. Elles ont également jugé les preuves plus faibles pour le contrôle et mis en garde contre l’utilisation des polygraphes pour les décisions de sécurité concernant les employés.

Cette différence devrait façonner Polygraph Next dès le départ. Un unique chiffre d’exactitude mis en avant masquerait les applications où les erreurs comptent le plus.

Le système a également besoin de limites décisionnelles claires. Un score de recherche ne devrait pas devenir discrètement le fondement d’une mesure défavorable avant que ses limites ne soient comprises.

La politique fédérale a historiquement traité les résultats de polygraphe comme un élément d’un processus plus large. Les enquêteurs peuvent utiliser les examens pour orienter les entretiens ou identifier des questions nécessitant un examen approfondi.

Polygraph Next pourrait brouiller cette frontière si les résultats automatisés alimentent directement d’autres systèmes de vérification. L’analyse centralisée peut rendre un score portable et durable.

La portabilité accroît l’efficacité, mais elle accroît aussi les conséquences des erreurs. Un résultat douteux peut suivre un candidat d’un examen à l’autre, d’une affectation à l’autre ou d’une agence à l’autre.

Les documents budgétaires mentionnent la traçabilité comme un avantage. Une traçabilité adéquate devrait montrer qui a utilisé un score, comment il a influencé une décision et si des éléments ultérieurs l’ont confirmé.

Elle devrait aussi permettre aux responsables de corriger les dossiers. Sinon, des données centralisées peuvent conserver les erreurs plus efficacement qu’elles ne préservent la responsabilité.

La vie privée constitue un autre volet de ce compromis. Les données physiologiques peuvent révéler des informations allant au-delà de la question posée par un examinateur.

Les documents ne décrivent pas publiquement les périodes de conservation, les règles d’accès, les autorisations d’entraînement des modèles ou les limites d’utilisation secondaire. Ces politiques méritent un examen attentif avant l’accumulation de grands jeux de données.

La cybersécurité compte également. Un dépôt centralisé d’évaluations de crédibilité contiendrait des informations personnelles et de sécurité nationale sensibles.

La DCSA gère déjà des systèmes contenant d’importantes données d’enquêtes d’antécédents. Ajouter des dossiers physiologiques et des résultats de modèles accroîtrait encore la sensibilité de cet environnement.

Le gouvernement doit aussi prendre en compte les comportements adverses. Les sujets fortement incités à le faire peuvent étudier les méthodes de test et tenter de manipuler leurs réponses.

La DCSA identifie explicitement les contre-mesures comme un problème pour la technologie actuelle. Pourtant, l’apprentissage automatique ne les neutralise pas automatiquement.

Un modèle entraîné sur des contre-mesures connues peut détecter des schémas familiers. Les adversaires peuvent réagir en développant des techniques hors de la distribution d’entraînement.

Cela crée une course aux armements entre détection et contournement. Les affirmations d’une meilleure résilience doivent donc être testées avec des participants capables de s’adapter, et non seulement avec des volontaires coopératifs.

Le compromis fondamental du programme est désormais clair. L’automatisation peut rendre le processus plus rapide, plus cohérent et plus facile à auditer.

Dans le même temps, elle peut étendre les faux positifs, dissimuler des hypothèses incertaines et donner aux jugements contestés un vernis numérique. La gouvernance de cette technologie doit progresser au même rythme que ses capteurs et ses modèles.

Ce que la validation indépendante doit démontrer

Le test décisif n’est pas de savoir si Polygraph Next reconnaît des schémas de laboratoire, mais s’il améliore les décisions réelles sans nuire aux personnes innocentes.

Le Pentagone devrait commencer par définir l’usage prévu. Un modèle conçu pour l’assurance qualité nécessite des preuves différentes de celles d’un modèle utilisé pour recommander une conclusion de tromperie.

La documentation publique devrait préciser si les résultats sont consultatifs ou déterminants. Elle devrait aussi expliquer si les responsables peuvent les outrepasser et comment ces dérogations sont examinées.

Vient ensuite la vérité de terrain. Les chercheurs ont besoin d’une méthode crédible pour savoir quels participants étaient trompeurs et lesquels étaient sincères.

Les instructions données en laboratoire fournissent des étiquettes connues, mais un réalisme limité. Les affaires de terrain apportent du réalisme, mais manquent souvent d’étiquettes certaines.

Un programme de validation sérieux doit reconnaître cette tension. Il devrait présenter les résultats séparément plutôt que de fusionner des jeux de données dissemblables dans un indicateur favorable unique.

L’évaluation doit inclure la sensibilité et la spécificité. La sensibilité mesure la fréquence à laquelle le système détecte les cas ciblés, tandis que la spécificité mesure la fréquence à laquelle il écarte correctement les cas non ciblés.

Ces valeurs devraient être présentées avec les taux de faux positifs, de faux négatifs et de résultats non concluants. Exclure les cas non concluants peut faire paraître les performances meilleures que ne les vivent les utilisateurs.

Les résultats devraient aussi être présentés selon une prévalence réaliste. Le contrôle d’une population générale bénéficiant d’une habilitation diffère mathématiquement de l’évaluation de suspects dans le cadre d’une enquête ciblée.

Supposons qu’un modèle soit testé sur un nombre égal de sujets trompeurs et sincères. Son exactitude annoncée peut sembler impressionnante parce que l’échantillon est artificiellement équilibré.

Dans le contrôle réel, les tromperies graves peuvent être beaucoup plus rares. Même un taux de faux positifs modeste peut alors produire bien plus de signalements injustifiés que de détections valides.

Les évaluateurs doivent tester différents groupes démographiques et états de santé. Les niveaux physiologiques de référence peuvent varier selon l’âge, les médicaments, le handicap, le stress, le sommeil et de nombreux autres facteurs.

L’objectif n’est pas d’exiger une physiologie identique. Il s’agit de déterminer si les erreurs du système touchent inégalement certains groupes.

La détection à distance exige des tests distincts pour l’éclairage, la distance, les mouvements, les vêtements, les caractéristiques de la peau, le placement de la caméra et les interférences environnementales. Un modèle peut échouer lorsque les conditions de collecte changent.

Les tests à l’échelle des sites sont essentiels. Les résultats obtenus dans un laboratoire contrôlé ne devraient pas autoriser un déploiement national.

Le programme devrait également tester les contre-mesures dans des conditions adverses. Les participants doivent disposer d’incitations et d’une préparation se rapprochant davantage de tentatives réelles de déjouer le système.

Les facteurs humains méritent une attention égale. Les examinateurs peuvent devenir moins vigilants lorsqu’un logiciel présente un score avec assurance.

Les chercheurs appellent cela le biais d’automatisation, soit la tendance à privilégier la recommandation d’une machine même lorsqu’il existe des éléments contradictoires. La formation seule ne l’élimine pas toujours.

Une étude rigoureuse devrait comparer les décisions prises avec et sans assistance algorithmique. Cette conception peut montrer si le système améliore les performances humaines ou modifie seulement le niveau de confiance.

Elle devrait également mesurer les résultats en aval. Un système utile doit améliorer les enquêtes, réduire les suivis inutiles ou soutenir des décisions d’habilitation solides.

Des examens plus rapides ne démontrent pas la réussite s’ils génèrent davantage de recours, d’entretiens répétés, de retards de recrutement ou d’impasses dans les enquêtes.

Des rapports transparents renforceraient la confiance. Au minimum, la DCSA devrait publier les protocoles de test, les descriptions des populations, les indicateurs d’évaluation, les limites connues et les règles de gouvernance.

Les programmes de sécurité nationale ne peuvent pas publier chaque détail opérationnel. Toutefois, le secret ne devrait pas empêcher des experts indépendants d’évaluer la validité fondamentale d’une technologie influençant les décisions concernant le personnel.

La réplication externe offrirait la garantie la plus solide. Un modèle devrait résister à des tests menés par des chercheurs qui ne l’ont pas conçu et n’ont aucun intérêt dans les marchés publics.

Cette exigence est particulièrement importante pour les systèmes propriétaires. Les fournisseurs peuvent protéger leur code source tout en soutenant des évaluations contrôlées par des tiers.

Le gouvernement devrait également définir à l’avance les seuils d’échec. Sans cela, les agences peuvent interpréter après coup des résultats mitigés et poursuivre le développement malgré des preuves faibles.

Un seuil pourrait préciser des taux de faux positifs maximaux dans certains cas d’usage. Il pourrait également interdire toute mesure défavorable fondée uniquement sur un résultat automatisé.

Les données historiques justifient cette prudence. Les National Academies ont averti qu’un perfectionnement supplémentaire des techniques conventionnelles ne produirait probablement que des améliorations modestes de l’exactitude.

Polygraph Next mérite un test empirique équitable. Il ne mérite pas qu’on suppose que de nouveaux capteurs et l’apprentissage automatique ont déjà résolu la science sous-jacente.

Trois signaux montreront où se dirige Polygraph Next

Le libellé du financement, la conception de la validation et l’ampleur des marchés indiqueront si ce programme reste au stade de la recherche ou évolue vers un jugement opérationnel.

Le premier signal est la réponse du Congrès pour l’exercice fiscal 2027. Les parlementaires peuvent accorder les $6.421 million demandés, les réduire, les refuser ou y joindre des conditions de rapport.

Un financement intégral sans exigences d’évaluation donnerait à la DCSA une grande latitude pour structurer le programme en interne. Un financement conditionné à un examen indépendant placerait la validation scientifique davantage au cœur du dispositif.

Un report des crédits aurait également son importance. Il pourrait raccourcir le calendrier des tests ou repousser certaines étapes vers des exercices budgétaires ultérieurs.

Le deuxième signal sera la publication d’un protocole de validation. Les lecteurs devraient rechercher des critères d’évaluation nommés, des populations réalistes, des hypothèses sur les taux de base et des résultats distincts pour le dépistage et les enquêtes ciblées.

Un protocole principalement axé sur la classification en laboratoire affaiblirait la confiance dans un déploiement à grande échelle. Une validation sur le terrain, avec un reporting transparent des erreurs, renforcerait la crédibilité du programme.

La définition de l’« exactitude » sera particulièrement révélatrice. Tout résultat excluant les examens non concluants ou regroupant des cas d’usage sans rapport entre eux mérite un examen attentif.

Le troisième signal concerne l’ampleur des premiers contrats et prototypes. Les avis de marchés publics pourraient indiquer quels capteurs, plateformes d’analyse et fonctions décisionnelles la DCSA souhaite acquérir.

Un contrat limité à la recherche sur les mesures maintiendrait le projet dans un cadre exploratoire. Un système conçu pour intégrer des scores au processus de contrôle opérationnel rendrait les questions de gouvernance plus urgentes.

Le libellé des contrats pourrait aussi préciser la propriété des données. Le gouvernement doit disposer de droits lui permettant d’auditer les modèles, de conserver les dossiers d’évaluation et d’enquêter sur les défaillances de performance.

Ces signaux devraient apparaître avant que quiconque ne considère Polygraph Next comme un détecteur de mensonges par IA opérationnel du Pentagone. Les éléments actuellement disponibles n’autorisent qu’une conclusion plus limitée.

Le Pentagone a identifié de véritables problèmes liés à des méthodes d’évaluation lentes, variables et vieillissantes. Il a proposé des capteurs et algorithmes modernes comme voie d’amélioration.

Ce qu’il n’a pas démontré, c’est que l’IA peut déduire de manière fiable la tromperie à partir de l’activité physiologique. Cette affirmation doit être testée, et non intégrée au nom même du programme.

Les chercheurs, fonctionnaires fédéraux, sous-traitants et défenseurs des libertés civiles devraient surveiller le niveau de preuve, plutôt que la sophistication de l’équipement. De meilleures mesures ne comptent que lorsqu’elles étayent des conclusions valides.

À mesure que les premières décisions de financement seront prises, une question devrait orienter le débat : Polygraph Next testera-t-il si l’IA améliore les évaluations de crédibilité, ou présumera-t-il cette amélioration tout en construisant le système autour d’elle ?

 
 

Commencez pour Gratuit

Un premier assistant IA local avec gestion des connaissances personnelles

Pour une meilleure expérience IA,

remio ne supporte que Windows 10+ (x64) et M-Chip Macs actuellement.

Votre partenaire IA au travail
Faites-en plus avec remio

Planifiez. Créez. Livrez.
Tout au même endroit.

bottom of page