Il piano del Pentagono per un rilevatore di menzogne basato sull'IA privilegia l'automazione rispetto all'accuratezza comprovata
Il piano del Pentagono per un rilevatore di menzogne basato sull'IA richiede 30,3 milioni di dollari in cinque anni per modernizzare una tecnologia la cui base scientifica resta fortemente contestata. Denominato Polygraph+ o Polygraph Next, il programma combinerebbe rilevamento fisiologico senza contatto con intelligenza artificiale, machine learning e valutazione automatizzata.
La Defense Counterintelligence and Security Agency, o DCSA, intende avviare l'iniziativa con 6,421 milioni di dollari nell'anno fiscale 2027. La richiesta di bilancio descrive test sul campo, studi di validazione indipendenti, valutazioni di prototipi, archiviazione centralizzata dei dati e strumenti di supporto alle decisioni.
Sembra un programma ingegneristico, ma il suo problema più difficile non è l'ingegneria. Un sensore può misurare i cambiamenti fisiologici con maggiore precisione senza dimostrare che tali cambiamenti indichino un inganno.
La tensione attorno a Polygraph Next è quindi più ampia di un normale aggiornamento delle apparecchiature. Il Pentagono vuole automatizzare e ampliare le valutazioni di credibilità prima di risolvere cosa tali valutazioni possano inferire in modo affidabile.
Il confronto storico è rilevante. Una fondamentale revisione delle National Academies ha rilevato che i poligrafi convenzionali ottengono risultati migliori del caso in alcune indagini specifiche, pur restando ben lontani dalla perfezione. Ha raggiunto una conclusione molto più severa riguardo allo screening dei dipendenti, in cui le persone innocenti possono superare di gran lunga le reali minacce alla sicurezza.
Il nuovo sistema promette maggiore coerenza, rapidità e tracciabilità. Tuttavia, i documenti di bilancio pubblici non forniscono un obiettivo di accuratezza, un tasso accettabile di falsi positivi, un protocollo di validazione pubblicato o una soglia di implementazione.
Queste informazioni mancanti determineranno se Polygraph Next diventerà un migliore strumento di ricerca o un modo più rapido per produrre conclusioni discutibili.
Cosa realizzerebbe il programma del Pentagono per un rilevatore di menzogne basato sull'IA
Polygraph Next è una proposta di ricerca finanziata, non un rilevatore completato con accuratezza dimostrata.
Il bilancio di Polygraph Next del Pentagono colloca il progetto nel portafoglio di ricerca, sviluppo, test e valutazione della DCSA. I documenti datano la richiesta ad aprile 2026.
Il calendario proposto indica 6,421 milioni di dollari per l'anno fiscale 2027. Gli importi pianificati includono poi 6,449 milioni di dollari nel 2028, 6,158 milioni nel 2029, 5,660 milioni nel 2030 e 5,654 milioni nel 2031.
Nel complesso, tali cifre annuali ammontano a 30,342 milioni di dollari. I documenti classificano il costo per il completamento e il costo totale del programma come “continuing”, il che significa che la richiesta quinquennale non rappresenta necessariamente un tetto definitivo.
Nella tabella del bilancio per la ricerca non compaiono spese degli anni precedenti per il progetto. Ciò rende l'anno fiscale 2027 il punto di avvio proposto per questo specifico programma.
La DCSA presenta Polygraph+ e Polygraph Next come nomi alternativi dello stesso progetto di modernizzazione. Il suo obiettivo dichiarato è migliorare accuratezza, affidabilità, usabilità e tracciabilità nelle valutazioni federali di credibilità.
Il programma presenta diverse componenti pianificate. Una è la valutazione automatizzata, in cui gli algoritmi valuterebbero i segnali e contribuirebbero a produrre una valutazione. Un'altra è il rilevamento a distanza, vale a dire la misurazione dell'attività fisiologica senza collegare direttamente i sensori convenzionali a un soggetto.
L'agenzia propone inoltre archiviazione centralizzata e analisi. Questa componente raccoglierebbe i dati degli esami per la valutazione, il confronto e il potenziale sviluppo di modelli.
La DCSA afferma che condurrà studi di validazione indipendenti, test sul campo e valutazioni di prototipi. Indica inoltre l'Applied Research Laboratory for Intelligence and Security e l'Oak Ridge National Laboratory come partner di ricerca.
Questi dettagli definiscono un percorso di sviluppo, ma rivelano poco sul modello operativo finale. I documenti non spiegano quali segnali fisiologici utilizzerebbe un sistema implementato.
Non specificano neppure se l'IA consiglierebbe punteggi, classificherebbe gli esami, segnalerebbe anomalie o influenzerebbe direttamente le decisioni sul personale. Questi ruoli comportano rischi molto diversi.
Un algoritmo che aiuta a identificare sensori rumorosi non equivale a uno che etichetta una persona come ingannevole. Analogamente, un supporto decisionale esaminato da un valutatore qualificato differisce da un sistema di screening in larga misura automatizzato.
L'ambito immediato del programma è la verifica del personale federale e il rilevamento delle minacce interne. Questi contesti coinvolgono dipendenti, candidati, personale militare e appaltatori che potrebbero aver bisogno di accedere a informazioni sensibili.
Questo contesto aumenta la posta in gioco. Un risultato errato può ritardare un'autorizzazione di sicurezza, reindirizzare un'indagine, danneggiare una carriera o accrescere i sospetti attorno a una persona innocente.
La richiesta non equivale inoltre a uno stanziamento. Il Congresso controlla ancora se i fondi proposti diventeranno disponibili e può modificare l'importo, le condizioni o gli obblighi di rendicontazione.
Per ora, Polygraph Next è meglio inteso come un piano governativo di ricerca e acquisizione. Ha ambizioni, un budget proposto e partner istituzionali, ma nessuna performance dimostrata pubblicamente.
Perché la verifica del personale è oggi sotto pressione
Il programma affronta un reale onere operativo, anche se la sua soluzione proposta rimane scientificamente irrisolta.
La DCSA occupa una posizione centrale nel sistema federale di verifica. Conduce indagini sui precedenti e supporta le decisioni sull'accesso alle informazioni classificate in gran parte del governo.
Il suo National Center for Credibility Assessment stabilisce standard di formazione e fornisce consulenza ai funzionari della difesa e dell'intelligence sulla politica relativa ai poligrafi. La missione di valutazione della credibilità del centro comprende anche supporto tecnico, ricerca, test, supervisione dei programmi e audit.
Questo ruolo istituzionale offre alla DCSA una chiara ragione per modernizzare i propri strumenti. Gli esami convenzionali richiedono personale formato, condizioni controllate, preparazione dei sensori, colloqui e interpretazione.
Questi requisiti limitano la capacità operativa. Possono anche creare differenze tra valutatori, sedi, apparecchiature e condizioni di test.
I sensori senza contatto promettono una configurazione più semplice. La valutazione automatizzata promette analisi più coerenti. I dati centralizzati promettono audit e tracciabilità più solidi.
Ogni obiettivo ha valore operativo. Nessuno, tuttavia, dimostra che il sistema possa distinguere accuratamente l'inganno da ansia, paura, confusione, rabbia o normali variazioni fisiologiche.
Il più ampio sistema di verifica è già sotto pressione a causa di tecnologie obsolete e di una modernizzazione ritardata. La DCSA sta sviluppando la piattaforma National Background Investigation Services per sostituire i sistemi più vecchi e sostenere riforme a livello di governo.
Una revisione della verifica del personale del 2026 ha rilevato che la DCSA conduce circa due milioni di indagini sui precedenti ogni anno. Ha inoltre rilevato che l'agenzia non disponeva ancora di un calendario affidabile per completare il suo principale programma tecnologico.
La stessa revisione ha riferito che gli avvisi di verifica continua sono saliti da circa 30.000 per trimestre nell'anno fiscale 2023 a oltre 100.000 nel terzo trimestre dell'anno fiscale 2025. La verifica continua utilizza controlli automatizzati dei registri per identificare sviluppi che richiedono una revisione.
Questo aumento illustra la sfida centrale. L'automazione può raccogliere e segnalare più informazioni, ma genera anche lavoro quando i sistemi producono un gran numero di avvisi.
Polygraph Next entra in questo contesto come un altro possibile filtro. Se migliora la qualità del segnale e riduce la variabilità nella valutazione, potrebbe aiutare gli investigatori a concentrare l'attenzione.
Se le sue classificazioni sono mal calibrate, può fare il contrario. Potrebbe generare avvisi aggiuntivi, rafforzare sospetti deboli e ampliare il carico di lavoro dei revisori umani.
La pressione ricade quindi sulla DCSA, sui richiedenti di autorizzazioni di sicurezza e sulle agenzie in cerca di personale qualificato. La DCSA ha bisogno di processi più rapidi, mentre i richiedenti necessitano di decisioni accurate e spiegabili.
Anche i datori di lavoro hanno bisogno di tempistiche prevedibili per le autorizzazioni. Gli appaltatori della difesa non possono assegnare alcuni dipendenti a lavori classificati finché il governo non completa la verifica richiesta.
I funzionari della sicurezza affrontano il rischio opposto. Muoversi troppo rapidamente può lasciare le agenzie vulnerabili a spionaggio, divulgazioni non autorizzate, coercizione o altre minacce interne.
Ecco perché un rilevatore più rapido appare allettante. Sembra offrire efficienza senza ridurre il controllo.
Tuttavia, la rapidità aiuta solo quando la classificazione sottostante è affidabile. Elaborare più velocemente segnali fisiologici ambigui non produce automaticamente una sicurezza migliore.
Polygraph Next deve quindi soddisfare due standard. Deve ridurre l'attrito operativo e deve dimostrare che i suoi risultati migliorano le decisioni in condizioni realistiche.
Il secondo standard è più difficile. Richiede prove sugli errori tra persone, ambienti, formati delle domande, condizioni mediche e livelli di stress diversi.
Senza tali prove, il Pentagono rischia di trattare la capacità operativa come accuratezza. Non sono misure intercambiabili.
Come Polygraph Next usa l'IA senza risolvere il problema dell'inferenza
L'IA può standardizzare la valutazione dei segnali fisiologici, ma non può fare in modo che tali segnali rappresentino unicamente le menzogne.
Un poligrafo convenzionale registra cambiamenti quali respirazione, attività cardiovascolare e conduttanza cutanea. I valutatori confrontano le risposte tra le domande e interpretano se particolari differenze suggeriscano un inganno.
Polygraph Next propone di aggiungere a questo processo valutazione tramite IA e machine learning. Il machine learning identifica schemi statistici negli esempi e applica tali schemi a nuovi dati.
Questo approccio potrebbe ridurre parte della variabilità da un valutatore all'altro. Un algoritmo può applicare la stessa regola matematica a migliaia di segmenti di segnale.
Può inoltre combinare più variabili di quante una persona possa valutare facilmente. Tempistica, forma del segnale, durata della risposta e correlazioni tra sensori potrebbero influenzare un punteggio.
Il rilevamento a distanza modifica il metodo di raccolta. Invece di dipendere interamente da apparecchiature collegate, un sistema potrebbe ottenere alcune misurazioni fisiologiche a distanza.
Il bilancio non identifica il pacchetto finale di sensori. Qualsiasi descrizione specifica oltre il monitoraggio fisiologico senza contatto sarebbe quindi prematura.
Tuttavia, l'architettura crea una chiara catena di inferenza. I sensori misurano innanzitutto una risposta fisica. Il software estrae caratteristiche da tale risposta.
Un modello converte poi tali caratteristiche in un punteggio o in una raccomandazione. Infine, un valutatore o un funzionario interpreta quel risultato in un contesto di sicurezza.
Gli errori possono entrare in ogni fase. Un sensore può acquisire rumore, un modello può apprendere correlazioni inaffidabili e un decisore può attribuire un peso eccessivo al risultato.
La maggiore difficoltà risiede tra la risposta misurata e lo stato mentale dichiarato. Una maggiore attivazione può accompagnare l'inganno, ma può anche accompagnare la paura di non essere creduti.
Un richiedente sincero può reagire con forza a un'accusa. Una persona ingannevole può restare calma o usare una contromisura che altera il modello registrato.
La revisione scientifica sul poligrafo delle National Academies ha esaminato questo problema prima che il machine learning moderno diventasse comune. Il suo avvertimento scientifico centrale è ancora valido.
Le risposte fisiologiche non corrispondono esclusivamente all'inganno. Ciò significa che un classificatore migliorato può diventare più coerente senza diventare più valido.
Consideriamo un modello addestrato su esami passati. Le etichette storiche possono derivare dalle valutazioni degli esaminatori, da confessioni, dagli esiti dei casi o dalle istruzioni impartite in laboratorio.
Ogni fonte di etichette presenta debolezze. Le valutazioni degli esaminatori possono riprodurre le assunzioni del metodo, mentre le confessioni possono essere indisponibili o incomplete.
Gli esperimenti di laboratorio forniscono una verità di base più chiara, perché i ricercatori sanno chi ha ricevuto istruzioni di mentire. Tuttavia, una menzogna simulata raramente comporta le conseguenze di un vero esame per l'ottenimento di un nulla osta.
I modelli possono anche apprendere scorciatoie. Possono associare movimento, stile di eloquio, condizioni di salute, caratteristiche demografiche o ambienti di test alle etichette presenti nei dati di addestramento.
Prestazioni elevate all'interno di un singolo dataset non risolverebbero questa preoccupazione. Il sistema deve funzionare su nuovi soggetti, in nuove sedi, con nuovi esaminatori e con tassi di base realistici.
I tassi di base descrivono quanto sia comune la condizione target nella popolazione esaminata. Nello screening del personale, i gravi responsabili di violazioni della sicurezza sono presumibilmente rari.
Questa rarità rende i falsi positivi particolarmente importanti. Anche un test che appare accurato in esperimenti bilanciati può segnalare molte persone innocenti in una forza lavoro a bassa prevalenza.
Un livello di valutazione basato sull'AI non può sottrarsi a questa matematica. Semmai, l'automazione rende la calibrazione più importante, perché può applicare la stessa soglia su scala più ampia.
La spiegabilità presenta un'altra sfida. Gli investigatori devono sapere se un punteggio riflette una risposta significativa, una scarsa qualità del segnale, una condizione fisica insolita o una limitazione del modello.
Un generico punteggio di confidenza non fornisce questa risposta. Un'elevata confidenza del modello può coesistere con una classificazione erronea espressa con altrettanta confidenza.
Il ruolo più difendibile per l'AI sarebbe circoscritto e verificabile. Potrebbe migliorare il controllo qualità, rilevare misurazioni corrotte o confrontare la coerenza della valutazione con quella degli esaminatori formati.
Un sistema commercializzato come rilevatore di menzogne basato sull'AI avanza una pretesa molto più ampia. Implica una connessione affidabile tra fisiologia osservabile e inganno che i ricercatori non hanno stabilito.
Il compromesso centrale è tra coerenza e validità
Polygraph Next può rendere le valutazioni più uniformi, facendo al tempo stesso apparire più autorevole un'inferenza non dimostrata.
L'argomento pratico più forte di DCSA riguarda la standardizzazione. I programmi federali traggono beneficio quando le procedure producono registrazioni comparabili tra esaminatori e sedi.
La valutazione automatizzata può documentare quali misurazioni hanno influenzato un risultato. I sistemi centralizzati possono conservare i registri e supportare verifiche successive.
Queste caratteristiche possono ridurre le variazioni arbitrarie. Potrebbero anche mettere in luce modelli di somministrazione incoerente che i processi precedenti non riuscivano a cogliere.
Tuttavia, coerenza non significa accuratezza. Un righello con una scala sbagliata può produrre errori identici ogni volta.
Questa distinzione è importante perché i punteggi generati al computer spesso trasmettono un'apparenza di obiettività. I funzionari possono affidarsi a un risultato numerico anche quando il suo significato scientifico rimane incerto.
L'etichetta “AI” può amplificare questo effetto. Gli utenti possono presumere che un sistema abbia individuato un sottile segnale di inganno quando in realtà ha appreso correlazioni specifiche dei suoi dati di addestramento.
I documenti pubblici del Pentagono affermano che il progetto includerà una validazione indipendente. Si tratta di un impegno importante, ma l'indipendenza richiede più dell'assegnazione a un team separato.
I valutatori devono avere accesso a metodi, dataset, definizioni degli errori e condizioni di test. Devono inoltre poter pubblicare risultati sfavorevoli senza pressioni da parte del programma.
La validazione dovrebbe separare gli esami relativi a incidenti specifici dallo screening generalizzato. Le due applicazioni coinvolgono popolazioni, domande, incentivi e compromessi statistici differenti.
Le National Academies hanno concluso che i poligrafi possono discriminare oltre il caso in alcuni incidenti specifici. Hanno anche rilevato che le prove sono più deboli per lo screening e hanno messo in guardia dall'affidarsi ai poligrafi per le decisioni di sicurezza riguardanti i dipendenti.
Questa differenza dovrebbe orientare Polygraph Next fin dall'inizio. Un unico dato di accuratezza da titolo di giornale nasconderebbe le applicazioni in cui gli errori contano di più.
Il sistema necessita inoltre di confini decisionali chiari. Un punteggio di ricerca non dovrebbe trasformarsi silenziosamente in una base per azioni sfavorevoli prima che ne siano comprese le limitazioni.
Storicamente, la politica federale ha trattato i risultati del poligrafo come una componente di un processo più ampio. Gli investigatori possono usare gli esami per guidare i colloqui o individuare questioni che richiedono ulteriori verifiche.
Polygraph Next potrebbe offuscare questo confine se i risultati automatizzati confluissero direttamente in altri sistemi di verifica. Le analisi centralizzate possono rendere un punteggio trasferibile e persistente.
La trasferibilità aumenta l'efficienza, ma aumenta anche le conseguenze degli errori. Un risultato dubbio può seguire un candidato attraverso verifiche, assegnazioni o agenzie.
I documenti di bilancio menzionano la tracciabilità come un vantaggio. Una tracciabilità adeguata dovrebbe mostrare chi ha usato un punteggio, in che modo ha influenzato una decisione e se le prove successive lo hanno confermato.
Dovrebbe anche consentire ai funzionari di correggere i registri. Altrimenti, i dati centralizzati possono conservare gli errori più efficacemente di quanto preservino la responsabilità.
La privacy è un'altra componente di questo compromesso. I dati fisiologici possono rivelare informazioni che vanno oltre la domanda posta da un esaminatore.
I documenti non descrivono pubblicamente i periodi di conservazione, le regole di accesso, le autorizzazioni per l'addestramento dei modelli o i limiti all'uso secondario. Queste politiche meritano scrutinio prima che si accumulino grandi dataset.
Anche la cybersicurezza conta. Un archivio centralizzato di valutazioni della credibilità conterrebbe informazioni personali e di sicurezza nazionale sensibili.
DCSA gestisce già sistemi che contengono ampi dati sulle indagini sui precedenti. L'aggiunta di registrazioni fisiologiche e risultati dei modelli approfondirebbe la sensibilità di quell'ambiente.
Il governo deve considerare anche i comportamenti avversariali. I soggetti con forti incentivi possono studiare i metodi di test e tentare di manipolare le proprie risposte.
DCSA identifica esplicitamente le contromisure come un problema della tecnologia attuale. Tuttavia, il machine learning non le sconfigge automaticamente.
Un modello addestrato su contromisure note può rilevare schemi familiari. Gli avversari possono reagire sviluppando tecniche al di fuori della distribuzione di addestramento.
Ciò crea una corsa agli armamenti tra rilevamento ed elusione. Le affermazioni di maggiore resilienza devono quindi essere testate contro partecipanti adattivi, non soltanto volontari collaborativi.
Il compromesso fondamentale del programma è ora chiaro. L'automazione può rendere il processo più rapido, più coerente e più facile da verificare.
Al tempo stesso, può amplificare i falsi positivi, nascondere assunzioni incerte e conferire ai giudizi contestati una patina numerica. La governance della tecnologia deve avanzare insieme ai suoi sensori e modelli.
Cosa deve dimostrare la validazione indipendente
Il test decisivo non è se Polygraph Next riconosca schemi di laboratorio, ma se migliori le decisioni reali senza danneggiare persone innocenti.
Il Pentagono dovrebbe iniziare definendo l'uso previsto. Un modello progettato per la garanzia della qualità necessita di prove diverse da uno impiegato per raccomandare una conclusione di inganno.
La documentazione pubblica dovrebbe identificare se i risultati siano consultivi o determinanti. Dovrebbe anche spiegare se i funzionari possano ignorarli e come tali deroghe vengano riesaminate.
Poi viene la verità di base. I ricercatori hanno bisogno di un metodo credibile per sapere quali partecipanti fossero ingannevoli e quali veritieri.
Le istruzioni di laboratorio forniscono etichette note, ma un realismo limitato. I casi sul campo offrono realismo, ma spesso mancano di etichette certe.
Un serio programma di validazione deve riconoscere questa tensione. Dovrebbe riportare i risultati separatamente, anziché fondere dataset dissimili in un'unica metrica favorevole.
La valutazione deve includere sensibilità e specificità. La sensibilità misura con quale frequenza il sistema rileva i casi target, mentre la specificità misura con quale frequenza esclude correttamente i casi non target.
Questi valori dovrebbero comparire insieme ai tassi di falsi positivi, falsi negativi e risultati inconcludenti. Escludere i casi inconcludenti può far apparire le prestazioni migliori di quanto gli utenti sperimentino realmente.
I risultati dovrebbero inoltre essere riportati con prevalenze realistiche. Lo screening di una forza lavoro generale dotata di nulla osta differisce matematicamente dalla valutazione di sospettati in un'indagine mirata.
Supponiamo che un modello venga testato su numeri uguali di soggetti ingannevoli e veritieri. La sua accuratezza dichiarata può apparire impressionante perché il campione è artificialmente bilanciato.
Nello screening reale, l'inganno grave può essere molto più raro. Anche un tasso modesto di falsi positivi può quindi produrre molte più segnalazioni di innocenti che rilevamenti validi.
I valutatori devono testare diversi gruppi demografici e condizioni di salute. I valori fisiologici di base possono variare in base a età, farmaci, disabilità, stress, sonno e numerosi altri fattori.
Il punto non è pretendere una fisiologia identica. È determinare se gli errori del sistema ricadano in modo diseguale sui vari gruppi.
Il rilevamento remoto richiede test separati per illuminazione, distanza, movimento, abbigliamento, caratteristiche della pelle, posizionamento della videocamera e interferenze ambientali. Un modello può fallire quando cambiano le condizioni di raccolta.
I test a livello di sede sono essenziali. I risultati ottenuti in un singolo laboratorio controllato non dovrebbero autorizzare un'implementazione nazionale.
Il programma dovrebbe inoltre testare le contromisure in condizioni avversariali. I partecipanti necessitano di incentivi e preparazione che approssimino meglio i reali tentativi di eludere il sistema.
I fattori umani meritano pari attenzione. Gli esaminatori possono diventare meno vigili quando il software presenta un punteggio sicuro.
I ricercatori chiamano questo fenomeno bias dell'automazione: la tendenza a privilegiare la raccomandazione di una macchina anche in presenza di prove contraddittorie. La sola formazione non lo elimina sempre.
Uno studio adeguato dovrebbe confrontare le decisioni con e senza assistenza algoritmica. Questo disegno può mostrare se il sistema migliori le prestazioni umane o si limiti a modificare il livello di fiducia.
Dovrebbe misurare anche gli esiti successivi. Un sistema utile deve migliorare le indagini, ridurre i follow-up non necessari o sostenere decisioni solide sui nulla osta.
Esami più rapidi non dimostrano il successo se generano più ricorsi, colloqui ripetuti, ritardi nel personale o vicoli ciechi investigativi.
Una rendicontazione trasparente rafforzerebbe la fiducia. Come minimo, DCSA dovrebbe pubblicare protocolli di test, descrizioni delle popolazioni, metriche di valutazione, limitazioni note e regole di governance.
I programmi di sicurezza nazionale non possono pubblicare ogni dettaglio operativo. Tuttavia, la segretezza non dovrebbe impedire a esperti indipendenti di valutare la validità di base di una tecnologia che influenza le decisioni sul personale.
La replicazione esterna offrirebbe la tutela più solida. Un modello dovrebbe superare i test condotti da ricercatori che non lo hanno sviluppato e non hanno alcun interesse negli appalti.
Questo requisito è particolarmente importante per i sistemi proprietari. I fornitori possono proteggere il codice sorgente pur sostenendo valutazioni controllate di terze parti.
Il governo dovrebbe anche predefinire soglie di fallimento. Senza di esse, le agenzie possono interpretare risultati contrastanti a posteriori e continuare lo sviluppo nonostante prove deboli.
Una soglia potrebbe specificare tassi massimi di falsi positivi in particolari casi d'uso. Potrebbe anche vietare azioni sfavorevoli basate esclusivamente su un risultato automatizzato.
Il quadro storico giustifica questa cautela. Le National Academies hanno avvertito che un ulteriore perfezionamento delle tecniche convenzionali produrrebbe probabilmente solo modesti miglioramenti dell'accuratezza.
Polygraph Next merita un'equa verifica empirica. Non merita l'assunzione che sensori più recenti e machine learning abbiano già risolto la scienza sottostante.
Tre segnali mostreranno dove è diretto Polygraph Next
Il linguaggio sui finanziamenti, il disegno della validazione e l'ambito degli appalti riveleranno se questo rimanga ricerca o si muova verso il giudizio operativo.
Il primo segnale è la risposta del Congresso per l'anno fiscale 2027. I legislatori possono concedere i 6,421 milioni di dollari richiesti, ridurli, respingerli o allegare condizioni di rendicontazione.
Un finanziamento completo senza requisiti di valutazione darebbe alla DCSA ampio margine per definire internamente il programma. Un finanziamento vincolato a una revisione indipendente collocherebbe la validazione scientifica più vicino al centro del progetto.
Anche uno stanziamento ritardato avrebbe conseguenze. Potrebbe comprimere il calendario dei test o rinviare le tappe fondamentali agli anni fiscali successivi.
Il secondo segnale è la pubblicazione di un protocollo di validazione. I lettori dovrebbero cercare endpoint nominati, popolazioni realistiche, ipotesi sui tassi di base e risultati separati per lo screening e le indagini specifiche.
Un protocollo incentrato principalmente sulla classificazione in laboratorio ridurrebbe la fiducia in un’adozione su larga scala. La validazione sul campo con una rendicontazione trasparente degli errori rafforzerebbe le ragioni del programma.
La definizione di “accuratezza” sarà particolarmente rivelatrice. Qualsiasi risultato che escluda gli esami inconcludenti o combini casi d’uso non correlati merita un’attenta verifica.
Il terzo segnale è la portata dei primi contratti e prototipi. Gli avvisi di gara potrebbero mostrare quali sensori, piattaforme di analisi e funzioni decisionali la DCSA intende acquisire.
Un contratto limitato alla ricerca sulle misurazioni manterrebbe il progetto in una fase esplorativa. Un sistema progettato per inserire punteggi nei processi operativi di verifica renderebbe più urgenti le questioni di governance.
Il linguaggio contrattuale potrebbe anche chiarire la proprietà dei dati. Il governo deve avere il diritto di verificare i modelli, conservare i registri delle valutazioni e indagare sui fallimenti delle prestazioni.
Questi segnali dovrebbero emergere prima che qualcuno consideri Polygraph Next un rilevatore di menzogne AI del Pentagono già operativo. I dati attualmente disponibili supportano soltanto una conclusione più limitata.
Il Pentagono ha individuato problemi reali nei metodi di valutazione lenti, variabili e obsoleti. Ha proposto sensori e algoritmi moderni come percorso verso il miglioramento.
Ciò che non ha dimostrato è che l’AI possa dedurre in modo affidabile l’inganno dall’attività fisiologica. Questa affermazione deve essere verificata, non incorporata nel nome del programma.
Ricercatori, dipendenti federali, appaltatori e sostenitori delle libertà civili dovrebbero osservare lo standard delle prove, non la sofisticazione delle apparecchiature. Misurazioni migliori contano solo quando supportano conclusioni valide.
Con l’arrivo delle prime decisioni di finanziamento, una domanda dovrebbe guidare il dibattito: Polygraph Next verificherà se l’AI migliora le valutazioni di credibilità, oppure presumerà tale miglioramento costruendo il sistema attorno a questa idea?



