top of page

Plan Pentagonu dotyczący wykrywacza kłamstw opartego na AI stawia automatyzację przed potwierdzoną dokładnością

2 godziny temu
13 minut(y) czytania

Plan Pentagonu dotyczący wykrywacza kłamstw opartego na AI zakłada wydanie 30,3 mln dolarów w ciągu pięciu lat na modernizację technologii, której podstawy naukowe wciąż są ostro kwestionowane. Program, nazwany Polygraph+ lub Polygraph Next, miałby łączyć bezkontaktowe monitorowanie fizjologiczne ze sztuczną inteligencją, uczeniem maszynowym i automatyczną oceną.

Defense Counterintelligence and Security Agency, czyli DCSA, chce rozpocząć przedsięwzięcie od 6,421 mln dolarów w roku fiskalnym 2027. Wniosek budżetowy opisuje testy terenowe, niezależne badania walidacyjne, oceny prototypów, scentralizowane przechowywanie danych oraz narzędzia wspierające podejmowanie decyzji.

Brzmi to jak program inżynieryjny, lecz jego najtrudniejszy problem nie jest natury inżynieryjnej. Czujnik może precyzyjniej mierzyć zmiany fizjologiczne, nie dowodząc zarazem, że wskazują one na kłamstwo.

Napięcie wokół Polygraph Next wykracza więc poza zwykłą modernizację sprzętu. Pentagon chce automatyzować i skalować oceny wiarygodności, zanim rozstrzygnie, co takie oceny mogą wiarygodnie wnioskować.

Porównanie historyczne ma znaczenie. Przełomowy przegląd National Academies wykazał, że konwencjonalne poligrafy w niektórych konkretnych dochodzeniach działają lepiej niż losowość, lecz wciąż są dalekie od doskonałości. W przypadku kontroli pracowników doszedł do znacznie surowszego wniosku, gdzie liczba niewinnych osób może znacznie przewyższać liczbę rzeczywistych zagrożeń dla bezpieczeństwa.

Nowy system obiecuje większą spójność, szybkość i możliwość śledzenia procesu. Publiczne dokumenty budżetowe nie podają jednak docelowej dokładności, dopuszczalnego odsetka fałszywie pozytywnych wyników, opublikowanego protokołu walidacji ani progu wdrożenia.

Brak tych informacji zadecyduje o tym, czy Polygraph Next stanie się lepszym narzędziem badawczym, czy szybszym sposobem generowania wątpliwych wniosków.

Co miałby stworzyć program Pentagonu dotyczący wykrywacza kłamstw opartego na AI

Polygraph Next to finansowana propozycja badawcza, a nie ukończony wykrywacz o potwierdzonej dokładności.

Budżet Polygraph Next Pentagonu umieszcza projekt w portfelu DCSA dotyczącym badań, rozwoju, testów i ewaluacji. Dokumenty datują wniosek na kwiecień 2026 roku.

Proponowany harmonogram przewiduje 6,421 mln dolarów na rok fiskalny 2027. Następnie planowane kwoty obejmują 6,449 mln dolarów w 2028 roku, 6,158 mln w 2029, 5,660 mln w 2030 oraz 5,654 mln w 2031 roku.

Łącznie te roczne kwoty dają 30,342 mln dolarów. Dokumenty klasyfikują koszt ukończenia i całkowity koszt programu jako „continuing”, co oznacza, że pięcioletni wniosek nie musi stanowić ostatecznego limitu.

W tabeli budżetu badawczego nie wykazano wcześniejszych wydatków na projekt. To sprawia, że rok fiskalny 2027 jest proponowanym punktem startowym tego konkretnego programu.

DCSA przedstawia Polygraph+ i Polygraph Next jako alternatywne nazwy tego samego przedsięwzięcia modernizacyjnego. Deklarowanym celem jest poprawa dokładności, niezawodności, użyteczności i identyfikowalności w federalnych ocenach wiarygodności.

Program składa się z kilku planowanych elementów. Jednym z nich jest automatyczna ocena, w której algorytmy analizowałyby sygnały i pomagały tworzyć ocenę. Innym jest wykrywanie z dystansu, czyli pomiar aktywności fizjologicznej bez bezpośredniego podłączania do badanej osoby konwencjonalnych czujników.

Agencja proponuje również scentralizowane przechowywanie danych i analitykę. Ten element gromadziłby dane z badań na potrzeby oceny, porównań i potencjalnego rozwoju modeli.

DCSA twierdzi, że przeprowadzi niezależne badania walidacyjne, testy terenowe i oceny prototypów. Wskazuje także Applied Research Laboratory for Intelligence and Security oraz Oak Ridge National Laboratory jako partnerów badawczych.

Te szczegóły wyznaczają ścieżkę rozwoju, lecz niewiele mówią o końcowym modelu działania. Dokumenty nie wyjaśniają, których sygnałów fizjologicznych używałby wdrożony system.

Nie określają też, czy AI miałaby rekomendować wyniki, klasyfikować badania, oznaczać anomalie czy bezpośrednio wpływać na decyzje dotyczące personelu. Te role niosą bardzo różne ryzyka.

Algorytm pomagający wykrywać zakłócenia czujników nie jest tym samym co algorytm oznaczający osobę jako kłamiącą. Podobnie narzędzie wspierające decyzję, analizowane przez wyszkolonego egzaminatora, różni się od w dużej mierze zautomatyzowanego systemu kontroli przesiewowej.

Bezpośredni zakres programu obejmuje federalną weryfikację personelu i wykrywanie zagrożeń wewnętrznych. Ustawia to w centrum pracowników, kandydatów, personel wojskowy i wykonawców, którzy mogą potrzebować dostępu do informacji wrażliwych.

Ten kontekst podnosi stawkę. Błędny wynik może opóźnić uzyskanie poświadczenia bezpieczeństwa, zmienić kierunek dochodzenia, zaszkodzić karierze lub zwiększyć podejrzenia wobec niewinnej osoby.

Wniosek nie jest też tym samym co przyznanie środków. Kongres wciąż decyduje, czy proponowane pieniądze staną się dostępne, i może zmienić ich wysokość, warunki lub wymogi sprawozdawcze.

Na razie Polygraph Next najlepiej rozumieć jako rządowy plan badań i pozyskania technologii. Ma ambicje, proponowany budżet i partnerów instytucjonalnych, ale nie wykazano publicznie jego skuteczności.

Dlaczego weryfikacja personelu znajduje się dziś pod presją

Program odpowiada na rzeczywiste obciążenie operacyjne, nawet jeśli jego proponowane rozwiązanie pozostaje naukowo nieustalone.

DCSA zajmuje centralną pozycję w federalnym systemie weryfikacji. Prowadzi postępowania sprawdzające i wspiera decyzje o dostępie do informacji niejawnych w znacznej części administracji.

Jej National Center for Credibility Assessment ustala standardy szkoleniowe i doradza urzędnikom obrony oraz wywiadu w sprawie polityki dotyczącej poligrafii. Misja oceny wiarygodności centrum obejmuje także wsparcie techniczne, badania, testy, nadzór nad programami i audyty.

Ta rola instytucjonalna daje DCSA wyraźny powód do modernizacji narzędzi. Konwencjonalne badania wymagają wyszkolonego personelu, kontrolowanych warunków, przygotowania czujników, wywiadów i interpretacji.

Wymagania te ograniczają przepustowość. Mogą również powodować różnice między egzaminatorami, lokalizacjami, sprzętem i warunkami testowymi.

Bezkontaktowe czujniki obiecują prostszą konfigurację. Automatyczna ocena obiecuje bardziej spójną analizę. Scentralizowane dane obiecują lepsze audytowanie i identyfikowalność.

Każdy z tych celów ma wartość operacyjną. Żaden jednak nie dowodzi, że system potrafi trafnie odróżnić kłamstwo od lęku, strachu, dezorientacji, złości lub zwykłej zmienności fizjologicznej.

Szerszy system weryfikacji już odczuwa presję związaną ze starzejącą się technologią i opóźnioną modernizacją. DCSA rozwija platformę National Background Investigation Services, aby zastąpić starsze systemy i wesprzeć reformy w całej administracji.

Przegląd weryfikacji personelu z 2026 roku wykazał, że DCSA prowadzi rocznie około dwóch milionów postępowań sprawdzających. Ustalono również, że agencja nadal nie miała wiarygodnego harmonogramu ukończenia swojego głównego programu technologicznego.

Ten sam przegląd podał, że liczba alertów dotyczących ciągłej weryfikacji wzrosła z około 30 000 na kwartał w roku fiskalnym 2023 do ponad 100 000 w trzecim kwartale roku fiskalnego 2025. Ciągła weryfikacja wykorzystuje automatyczne kontrole rejestrów do identyfikowania zdarzeń wymagających przeglądu.

Wzrost ten obrazuje główne wyzwanie. Automatyzacja może zbierać i oznaczać więcej informacji, ale tworzy też pracę, gdy systemy generują dużą liczbę alertów.

Polygraph Next trafia do tego środowiska jako kolejny możliwy filtr. Jeśli poprawi jakość sygnałów i ograniczy niespójną ocenę, może pomóc śledczym skoncentrować uwagę.

Jeśli jego klasyfikacje będą źle skalibrowane, może przynieść odwrotny skutek. Mógłby generować dodatkowe alerty, wzmacniać słabe podejrzenia i zwiększać obciążenie pracą ludzkich recenzentów.

Presja dotyczy zatem DCSA, osób ubiegających się o poświadczenie i agencji poszukujących wykwalifikowanego personelu. DCSA potrzebuje szybszych procesów, podczas gdy kandydaci potrzebują dokładnych i możliwych do wyjaśnienia decyzji.

Pracodawcy potrzebują również przewidywalnych terminów uzyskania poświadczeń. Wykonawcy obronni nie mogą przydzielić niektórym pracownikom zadań związanych z informacjami niejawnymi, dopóki rząd nie zakończy wymaganej weryfikacji.

Urzędnicy ds. bezpieczeństwa stoją przed przeciwnym ryzykiem. Zbyt szybkie działanie może narazić agencje na szpiegostwo, nieuprawnione ujawnienia, przymus lub inne zagrożenia wewnętrzne.

Dlatego szybszy wykrywacz brzmi atrakcyjnie. Pozornie oferuje wydajność bez ograniczania kontroli.

Szybkość pomaga jednak tylko wtedy, gdy leżąca u jej podstaw klasyfikacja jest wiarygodna. Szybsze przetwarzanie niejednoznacznych sygnałów fizjologicznych nie prowadzi automatycznie do lepszego bezpieczeństwa.

Polygraph Next musi więc spełnić dwa standardy. Musi ograniczyć tarcia operacyjne i wykazać, że jego wyniki poprawiają decyzje w realistycznych warunkach.

Drugi standard jest trudniejszy. Wymaga dowodów dotyczących błędów wśród różnych osób, środowisk, formatów pytań, stanów zdrowia i poziomów stresu.

Bez tych dowodów Pentagon ryzykuje utożsamianie przepustowości z dokładnością. Nie są to miary wymienne.

W jaki sposób Polygraph Next wykorzystuje AI, nie rozwiązując problemu wnioskowania

AI może ujednolicić ocenę sygnałów fizjologicznych, lecz nie może sprawić, że będą one jednoznacznie oznaczać kłamstwa.

Konwencjonalny poligraf rejestruje zmiany takie jak oddech, aktywność układu krążenia i przewodnictwo skóry. Egzaminatorzy porównują reakcje na poszczególne pytania i interpretują, czy konkretne różnice sugerują kłamstwo.

Polygraph Next proponuje dodanie do tego procesu oceny opartej na AI i uczeniu maszynowym. Uczenie maszynowe identyfikuje wzorce statystyczne w przykładach i stosuje je do nowych danych.

Takie podejście może ograniczyć część różnic między egzaminatorami. Algorytm może stosować tę samą regułę matematyczną do tysięcy segmentów sygnałów.

Może także łączyć więcej zmiennych, niż człowiek może łatwo ocenić. Na wynik mogłyby wpływać czas, kształt sygnału, czas trwania reakcji i korelacje między czujnikami.

Wykrywanie z dystansu zmienia metodę zbierania danych. Zamiast polegać wyłącznie na podłączonym sprzęcie, system mógłby uzyskiwać niektóre pomiary fizjologiczne z odległości.

Budżet nie wskazuje ostatecznego zestawu czujników. Jakikolwiek konkretny opis wykraczający poza bezkontaktowe monitorowanie fizjologiczne byłby więc przedwczesny.

Mimo to architektura tworzy wyraźny łańcuch wnioskowania. Czujniki najpierw mierzą reakcję fizyczną. Oprogramowanie wydobywa cechy z tej reakcji.

Następnie model przekształca te cechy w wynik lub rekomendację. Na końcu egzaminator lub urzędnik interpretuje ten wynik w kontekście bezpieczeństwa.

Błędy mogą pojawić się na każdym etapie. Czujnik może rejestrować zakłócenia, model może nauczyć się niewiarygodnych korelacji, a decydent może przypisać wynikowi nadmierną wagę.

Największa trudność występuje między zmierzoną reakcją a deklarowanym stanem psychicznym. Zwiększone pobudzenie może towarzyszyć kłamstwu, lecz może też wynikać z obawy, że komuś nie zostanie uwierzone.

Prawdomówny kandydat może silnie zareagować na oskarżenie. Osoba kłamiąca może zachować spokój lub zastosować środek zaradczy, który zmienia zarejestrowany wzorzec.

Naukowy przegląd poligrafii National Academies analizował ten problem, zanim nowoczesne uczenie maszynowe stało się powszechne. Jego kluczowe naukowe ostrzeżenie nadal pozostaje aktualne.

Reakcje fizjologiczne nie odpowiadają wyłącznie kłamstwu. Oznacza to, że lepszy klasyfikator może stać się bardziej spójny, nie stając się bardziej trafny.

Rozważmy model wytrenowany na wcześniejszych badaniach. Historyczne etykiety mogą pochodzić z ocen egzaminatorów, przyznań się, wyników spraw lub instrukcji laboratoryjnych.

Każde źródło etykiet ma słabości. Oceny egzaminatorów mogą powielać założenia danej metody, natomiast przyznania się mogą być niedostępne lub niepełne.

Eksperymenty laboratoryjne zapewniają wyraźniejszą prawdę referencyjną, ponieważ badacze wiedzą, kto otrzymał instrukcję kłamania. Symulowane kłamstwo rzadko jednak niesie konsekwencje prawdziwego badania poświadczenia bezpieczeństwa.

Modele mogą też uczyć się skrótów. Mogą wiązać ruch, sposób mówienia, stan zdrowia, cechy demograficzne lub środowisko badania z etykietami w danych treningowych.

Wysoka skuteczność w jednym zbiorze danych nie rozwiałaby tych obaw. System musi działać w przypadku nowych osób, nowych lokalizacji, nowych egzaminatorów i realistycznych częstości bazowych.

Częstości bazowe opisują, jak powszechny jest badany stan w testowanej populacji. W kontroli kandydatów do pracy poważne naruszenia bezpieczeństwa są przypuszczalnie rzadkie.

Ta rzadkość sprawia, że fałszywie dodatnie wyniki są szczególnie istotne. Nawet test pozornie dokładny w zrównoważonych eksperymentach może oznaczyć wiele niewinnych osób w populacji pracowników o niskiej częstości występowania badanego zjawiska.

Warstwa punktacji AI nie może uniknąć tej matematyki. Automatyzacja czyni kalibrację jeszcze ważniejszą, ponieważ może stosować ten sam próg na większą skalę.

Kolejnym wyzwaniem jest wyjaśnialność. Śledczy muszą wiedzieć, czy wynik odzwierciedla istotną reakcję, niską jakość sygnału, nietypowy stan fizyczny czy ograniczenie modelu.

Ogólny wskaźnik pewności nie daje takiej odpowiedzi. Wysoka pewność modelu może współistnieć z błędną klasyfikacją, co do której model jest bardzo pewny.

Najbardziej uzasadniona rola AI byłaby wąska i możliwa do przetestowania. Mogłaby poprawiać kontrolę jakości, wykrywać uszkodzone pomiary lub porównywać spójność punktacji z ocenami przeszkolonych egzaminatorów.

System reklamowany jako wykrywacz kłamstw AI wysuwa znacznie szersze twierdzenie. Sugeruje wiarygodny związek między obserwowalną fizjologią a oszustwem, którego badacze nie potwierdzili.

Kluczowy kompromis to spójność kontra trafność

Polygraph Next może ujednolicić oceny, jednocześnie nadając nieudowodnionemu wnioskowaniu pozory większego autorytetu.

Najsilniejszy praktyczny argument DCSA dotyczy standaryzacji. Programy federalne odnoszą korzyści, gdy procedury tworzą porównywalne zapisy u różnych egzaminatorów i w różnych lokalizacjach.

Automatyczna punktacja może dokumentować, które pomiary wpłynęły na wynik. Scentralizowane systemy mogą przechowywać zapisy i wspierać późniejsze audyty.

Takie rozwiązania mogą ograniczyć arbitralne różnice. Mogą też ujawnić wzorce niespójnego prowadzenia badań, których starsze procesy nie wychwytywały.

Spójność nie jest jednak dokładnością. Linijka z błędną skalą może za każdym razem dawać identyczne błędy.

To rozróżnienie ma znaczenie, ponieważ wyniki generowane komputerowo często sprawiają wrażenie obiektywnych. Urzędnicy mogą polegać na wyniku liczbowym, nawet gdy jego naukowe znaczenie pozostaje niepewne.

Etykieta „AI” może wzmacniać ten efekt. Użytkownicy mogą zakładać, że system wykrył subtelny sygnał oszustwa, podczas gdy w rzeczywistości nauczył się korelacji właściwych dla swoich danych treningowych.

Publiczne dokumenty Pentagonu wskazują, że projekt obejmie niezależną walidację. To ważne zobowiązanie, ale niezależność wymaga czegoś więcej niż powierzenia zadania odrębnemu zespołowi.

Ewaluatorzy potrzebują dostępu do metod, zbiorów danych, definicji błędów i warunków testowych. Muszą też móc publikować niekorzystne ustalenia bez presji ze strony programu.

Walidacja powinna rozdzielać badania dotyczące konkretnych incydentów od szerokiego screeningu. Te dwa zastosowania obejmują odmienne populacje, pytania, zachęty i kompromisy statystyczne.

National Academies uznały, że wariografy mogą rozróżniać wyniki lepiej niż przypadkowo w niektórych konkretnych incydentach. Stwierdziły też, że dowody są słabsze w przypadku screeningu, i ostrzegły przed poleganiem na wariografach przy decyzjach dotyczących bezpieczeństwa pracowników.

Ta różnica powinna kształtować Polygraph Next od samego początku. Jedna liczba określająca trafność ukryłaby zastosowania, w których błędy mają największe znaczenie.

System potrzebuje również jasnych granic decyzyjnych. Wynik badawczy nie powinien po cichu stawać się podstawą niekorzystnego działania, zanim jego ograniczenia zostaną zrozumiane.

Polityka federalna historycznie traktowała wyniki wariografu jako jedną część szerszego procesu. Śledczy mogą wykorzystywać badania do ukierunkowania rozmów lub wskazywania kwestii wymagających dalszej analizy.

Polygraph Next może zacierać tę granicę, jeśli zautomatyzowane wyniki będą trafiać bezpośrednio do innych systemów weryfikacyjnych. Scentralizowana analityka może uczynić wynik przenośnym i trwałym.

Przenośność zwiększa efektywność, ale zwiększa też konsekwencje błędu. Wątpliwy wynik może towarzyszyć kandydatowi podczas kolejnych ocen, przydziałów lub w różnych agencjach.

Dokumenty budżetowe wymieniają identyfikowalność jako korzyść. Prawidłowa identyfikowalność powinna pokazywać, kto użył wyniku, jak wpłynął on na decyzję oraz czy późniejsze dowody go potwierdziły.

Powinna też umożliwiać urzędnikom korygowanie zapisów. W przeciwnym razie scentralizowane dane mogą skuteczniej utrwalać pomyłki niż odpowiedzialność.

Prywatność jest kolejną częścią tego kompromisu. Dane fizjologiczne mogą ujawniać informacje wykraczające poza pytanie zadane przez egzaminatora.

Dokumenty nie opisują publicznie okresów przechowywania danych, zasad dostępu, uprawnień do trenowania modeli ani ograniczeń wtórnego wykorzystania. Polityki te zasługują na kontrolę, zanim zgromadzą się duże zbiory danych.

Znaczenie ma również cyberbezpieczeństwo. Scentralizowane repozytorium ocen wiarygodności zawierałoby wrażliwe dane osobowe i informacje dotyczące bezpieczeństwa narodowego.

DCSA już zarządza systemami zawierającymi obszerne dane z kontroli przeszłości. Dodanie zapisów fizjologicznych i wyników modeli zwiększyłoby wrażliwość tego środowiska.

Rząd musi także uwzględnić zachowania przeciwników. Osoby mające silną motywację mogą badać metody testowania i próbować manipulować swoimi reakcjami.

DCSA wyraźnie wskazuje środki przeciwdziałania jako problem obecnej technologii. Uczenie maszynowe nie pokonuje ich jednak automatycznie.

Model wytrenowany na znanych środkach przeciwdziałania może wykrywać znajome wzorce. Przeciwnicy mogą odpowiedzieć, opracowując techniki spoza rozkładu danych treningowych.

Tworzy to wyścig zbrojeń między wykrywaniem a unikaniem wykrycia. Twierdzenia o większej odporności muszą zatem być testowane z udziałem adaptujących się uczestników, a nie wyłącznie chętnych współpracowników.

Główny kompromis programu jest teraz jasny. Automatyzacja może uczynić proces szybszym, bardziej spójnym i łatwiejszym do audytowania.

Jednocześnie może skalować fałszywie dodatnie wyniki, ukrywać niepewne założenia i nadawać spornym osądom liczbową fasadę. Zarządzanie tą technologią musi rozwijać się wraz z jej czujnikami i modelami.

Co musi wykazać niezależna walidacja

Decydującym testem nie jest to, czy Polygraph Next rozpoznaje wzorce laboratoryjne, lecz czy poprawia rzeczywiste decyzje bez krzywdzenia niewinnych osób.

Pentagon powinien zacząć od zdefiniowania zamierzonego zastosowania. Model zbudowany do zapewniania jakości wymaga innych dowodów niż model używany do rekomendowania stwierdzenia oszustwa.

Publiczna dokumentacja powinna określać, czy wyniki mają charakter doradczy czy rozstrzygający. Powinna też wyjaśniać, czy urzędnicy mogą je uchylać i jak takie uchylenia są oceniane.

Następnie pojawia się kwestia prawdy referencyjnej. Badacze potrzebują wiarygodnej metody ustalania, którzy uczestnicy byli zwodniczy, a którzy mówili prawdę.

Instrukcje laboratoryjne zapewniają znane etykiety, lecz ograniczony realizm. Sprawy terenowe zapewniają realizm, lecz często nie mają pewnych etykiet.

Poważny program walidacyjny musi uznać to napięcie. Powinien raportować wyniki osobno, zamiast łączyć nieporównywalne zbiory danych w jedną korzystną miarę.

Ocena musi obejmować czułość i swoistość. Czułość mierzy, jak często system wykrywa przypadki docelowe, podczas gdy swoistość mierzy, jak często prawidłowo wyklucza przypadki niedocelowe.

Wartości te powinny być przedstawiane wraz ze wskaźnikami fałszywie dodatnich wyników, fałszywie ujemnych wyników i wyników nierozstrzygających. Wykluczanie przypadków nierozstrzygających może sprawić, że wydajność będzie wyglądać lepiej, niż doświadczają tego użytkownicy.

Wyniki powinny być też raportowane przy realistycznej częstości występowania. Screening ogólnej populacji pracowników z poświadczeniem bezpieczeństwa różni się matematycznie od oceny podejrzanych w ukierunkowanym dochodzeniu.

Załóżmy, że model testuje się na równej liczbie osób zwodniczych i prawdomównych. Raportowana trafność może wyglądać imponująco, ponieważ próba została sztucznie zrównoważona.

W rzeczywistym screeningu poważne oszustwa mogą być znacznie rzadsze. Nawet umiarkowany wskaźnik fałszywie dodatnich wyników może wtedy generować o wiele więcej niewinnych oznaczeń niż trafnych wykryć.

Ewaluatorzy muszą testować różne grupy demograficzne i stany zdrowia. Fizjologiczne wartości bazowe mogą różnić się w zależności od wieku, leków, niepełnosprawności, stresu, snu i wielu innych czynników.

Celem nie jest wymaganie identycznej fizjologii. Chodzi o ustalenie, czy błędy systemu rozkładają się nierównomiernie między grupami.

Zdalne wykrywanie wymaga odrębnych testów dotyczących oświetlenia, odległości, ruchu, odzieży, cech skóry, ustawienia kamery i zakłóceń środowiskowych. Model może zawodzić, gdy zmieniają się warunki zbierania danych.

Testowanie na poziomie lokalizacji jest niezbędne. Wyniki z jednego kontrolowanego laboratorium nie powinny uprawniać do wdrożenia na skalę krajową.

Program powinien również testować środki przeciwdziałania w warunkach adversarialnych. Uczestnicy potrzebują zachęt i przygotowania lepiej przybliżających rzeczywiste próby pokonania systemu.

Czynniki ludzkie zasługują na równą uwagę. Egzaminatorzy mogą stać się mniej czujni, gdy oprogramowanie przedstawia wynik z wysoką pewnością.

Badacze nazywają to uprzedzeniem automatyzacyjnym — skłonnością do faworyzowania rekomendacji maszyny nawet wtedy, gdy istnieją sprzeczne dowody. Samo szkolenie nie zawsze je eliminuje.

Właściwe badanie powinno porównywać decyzje podejmowane z pomocą algorytmiczną i bez niej. Taka konstrukcja może pokazać, czy system poprawia ludzką skuteczność, czy jedynie zmienia poziom pewności.

Powinno ono również mierzyć rezultaty dalszego etapu. Użyteczny system musi poprawiać dochodzenia, ograniczać niepotrzebne dalsze działania lub wspierać trafne decyzje dotyczące poświadczeń bezpieczeństwa.

Szybsze badania nie dowodzą sukcesu, jeśli prowadzą do większej liczby odwołań, powtarzanych rozmów, opóźnień kadrowych lub ślepych uliczek śledczych.

Przejrzyste raportowanie zwiększyłoby zaufanie. DCSA powinno co najmniej publikować protokoły testów, opisy populacji, wskaźniki oceny, znane ograniczenia i zasady zarządzania.

Programy bezpieczeństwa narodowego nie mogą publikować każdego szczegółu operacyjnego. Tajemnica nie powinna jednak uniemożliwiać niezależnym ekspertom oceny podstawowej trafności technologii wpływającej na decyzje personalne.

Zewnętrzna replikacja stanowiłaby najsilniejsze zabezpieczenie. Model powinien przejść testy badaczy, którzy go nie stworzyli i nie mają interesu w jego zakupie.

Wymóg ten jest szczególnie ważny dla systemów zastrzeżonych. Dostawcy mogą chronić kod źródłowy, jednocześnie wspierając kontrolowane oceny prowadzone przez niezależne strony trzecie.

Rząd powinien również z góry określić progi niepowodzenia. Bez nich agencje mogą po fakcie interpretować mieszane wyniki i kontynuować rozwój mimo słabych dowodów.

Próg mógłby określać maksymalne wskaźniki fałszywie dodatnich wyników w konkretnych przypadkach użycia. Mógłby również zakazywać podejmowania niekorzystnych działań wyłącznie na podstawie zautomatyzowanego wyniku.

Historia uzasadnia tę ostrożność. National Academies ostrzegły, że dalsze udoskonalanie konwencjonalnych technik prawdopodobnie przyniesie jedynie niewielką poprawę trafności.

Polygraph Next zasługuje na rzetelny test empiryczny. Nie zasługuje na założenie, że nowsze czujniki i uczenie maszynowe już rozwiązały podstawowe problemy naukowe.

Trzy sygnały pokażą, dokąd zmierza Polygraph Next

Język dotyczący finansowania, projekt walidacji i zakres zamówień ujawnią, czy projekt pozostaje badaniem, czy zmierza ku osądowi operacyjnemu.

Pierwszym sygnałem będzie odpowiedź Kongresu w roku fiskalnym 2027. Ustawodawcy mogą przyznać wnioskowane 6,421 mln USD, zmniejszyć tę kwotę, odrzucić ją lub dołączyć warunki dotyczące raportowania.

Pełne finansowanie bez wymogów dotyczących ewaluacji dałoby DCSA szerokie pole do wewnętrznego kształtowania programu. Finansowanie powiązane z niezależnym przeglądem umieściłoby walidację naukową bliżej centrum programu.

Opóźnione środki budżetowe również miałyby znaczenie. Mogłyby skrócić harmonogram testów lub przesunąć kamienie milowe na późniejsze lata fiskalne.

Drugim sygnałem będzie publikacja protokołu walidacji. Czytelnicy powinni zwracać uwagę na wskazane punkty końcowe, realistyczne populacje, założenia dotyczące częstości bazowej oraz odrębne wyniki dla badań przesiewowych i konkretnych dochodzeń.

Protokół skupiający się głównie na klasyfikacji laboratoryjnej osłabiłby zaufanie do szerokiego wdrożenia. Walidacja w warunkach terenowych z przejrzystym raportowaniem błędów wzmocniłaby argumenty za programem.

Definicja „dokładności” będzie szczególnie wymowna. Każdy wynik, który wyklucza nierozstrzygające badania lub łączy niepowiązane przypadki użycia, zasługuje na dokładną analizę.

Trzecim sygnałem będzie zakres wczesnych kontraktów i prototypów. Ogłoszenia o zamówieniach mogą pokazać, jakie czujniki, platformy analityczne i funkcje decyzyjne DCSA chce pozyskać.

Wąski kontrakt na badania pomiarowe utrzymałby projekt w ramach etapu eksploracyjnego. System zaprojektowany tak, by przekazywać wyniki punktowe do operacyjnej weryfikacji, zwiększyłby pilność pytań dotyczących zarządzania.

Język kontraktów może również wyjaśnić kwestie własności danych. Rząd potrzebuje uprawnień do audytowania modeli, zachowywania dokumentacji ewaluacyjnej i badania przypadków niepowodzeń w działaniu.

Sygnały te powinny pojawić się, zanim ktokolwiek uzna Polygraph Next za działający pentagonowy wykrywacz kłamstw oparty na AI. Obecny stan informacji uzasadnia jedynie bardziej ograniczony wniosek.

Pentagon zidentyfikował rzeczywiste problemy związane z powolnymi, zmiennymi i starzejącymi się metodami oceny. Zaproponował nowoczesne czujniki i algorytmy jako drogę do poprawy.

Nie wykazał jednak, że AI potrafi niezawodnie wnioskować o oszustwie na podstawie aktywności fizjologicznej. To twierdzenie trzeba przetestować, a nie wpisywać w nazwę programu.

Naukowcy, pracownicy federalni, wykonawcy i obrońcy swobód obywatelskich powinni obserwować standard dowodowy, a nie zaawansowanie sprzętu. Lepsze pomiary mają znaczenie tylko wtedy, gdy prowadzą do trafnych wniosków.

Gdy nadejdą pierwsze decyzje finansowe, debatę powinno prowadzić jedno pytanie: Czy Polygraph Next sprawdzi, czy AI poprawia oceny wiarygodności, czy też założy tę poprawę, budując wokół niej system?

 
 

Zacznij bezpłatnie

Asystent AI działający przede wszystkim lokalnie, z funkcją zarządzania wiedzą osobistą

Aby zapewnić lepsze działanie AI,

remio obsługuje obecnie wyłącznie Windows 10+ (x64) i M-Chip Macs.

Twój partner AI w pracy
Zrób więcej z remio

Planuj. Twórz. Dostarczaj.
Wszystko w jednym miejscu.

bottom of page