top of page

Der KI-Lügendetektorplan des Pentagons setzt Automatisierung vor nachgewiesene Genauigkeit

vor 2 Stunden
13 Min. Lesezeit

Der KI-Lügendetektorplan des Pentagons beantragt über fünf Jahre 30,3 Millionen US-Dollar, um eine Technologie zu modernisieren, deren wissenschaftliche Grundlage weiterhin stark umstritten ist. Das Programm mit dem Namen Polygraph+ oder Polygraph Next soll kontaktlose physiologische Sensorik mit künstlicher Intelligenz, maschinellem Lernen und automatisierter Bewertung kombinieren.

Die Defense Counterintelligence and Security Agency, kurz DCSA, will das Vorhaben im Haushaltsjahr 2027 mit 6,421 Millionen US-Dollar beginnen. Ihr Haushaltsantrag beschreibt Feldtests, unabhängige Validierungsstudien, Prototypbewertungen, zentrale Datenspeicherung und Entscheidungsunterstützungstools.

Das klingt nach einem Ingenieurprogramm, doch sein schwierigstes Problem ist nicht die Technik. Ein Sensor kann physiologische Veränderungen präziser messen, ohne damit zu belegen, dass diese Veränderungen auf Täuschung hindeuten.

Die Spannung rund um Polygraph Next geht daher über ein gewöhnliches Geräte-Upgrade hinaus. Das Pentagon will Glaubwürdigkeitsbewertungen automatisieren und skalieren, bevor geklärt ist, was diese Bewertungen zuverlässig ableiten können.

Der historische Vergleich ist wichtig. Eine wegweisende Überprüfung der National Academies kam zu dem Ergebnis, dass herkömmliche Polygraphen in einigen spezifischen Ermittlungen besser als Zufall abschneiden, aber dennoch weit von Perfektion entfernt sind. Bei der Überprüfung von Beschäftigten fiel ihr Urteil deutlich schärfer aus, da dort unschuldige Personen die tatsächlichen Sicherheitsbedrohungen bei weitem übertreffen können.

Das neue System verspricht mehr Konsistenz, Geschwindigkeit und Nachvollziehbarkeit. Die öffentlichen Haushaltsdokumente nennen jedoch weder ein Genauigkeitsziel noch eine akzeptable Falsch-Positiv-Rate, ein veröffentlichtes Validierungsprotokoll oder eine Einsatzschwelle.

Diese fehlenden Informationen werden darüber entscheiden, ob Polygraph Next zu einem besseren Forschungsinstrument wird oder zu einer schnelleren Methode, fragwürdige Schlussfolgerungen zu erzeugen.

Was das KI-Lügendetektorprogramm des Pentagons entwickeln würde

Polygraph Next ist ein finanzierter Forschungsvorschlag, kein fertiger Detektor mit nachgewiesener Genauigkeit.

Das Polygraph Next budget des Pentagons ordnet das Projekt dem Portfolio der DCSA für Forschung, Entwicklung, Tests und Evaluierung zu. Die Dokumente datieren den Antrag auf April 2026.

Der vorgeschlagene Zeitplan sieht 6,421 Millionen US-Dollar für das Haushaltsjahr 2027 vor. Danach sind 6,449 Millionen US-Dollar für 2028, 6,158 Millionen US-Dollar für 2029, 5,660 Millionen US-Dollar für 2030 und 5,654 Millionen US-Dollar für 2031 geplant.

Zusammen ergeben diese Jahresbeträge 30,342 Millionen US-Dollar. Die Dokumente stufen die noch zu fertigstellenden Kosten und die Gesamtkosten des Programms als „fortlaufend“ ein, was bedeutet, dass der Fünfjahresantrag nicht zwingend eine endgültige Obergrenze darstellt.

In der Forschungshaushaltstabelle sind für das Projekt keine Ausgaben aus Vorjahren aufgeführt. Damit wäre das Haushaltsjahr 2027 der vorgeschlagene Startpunkt für dieses spezifische Programm.

Die DCSA stellt Polygraph+ und Polygraph Next als alternative Namen für dasselbe Modernisierungsvorhaben dar. Ihr erklärtes Ziel besteht darin, Genauigkeit, Zuverlässigkeit, Benutzerfreundlichkeit und Nachvollziehbarkeit bei bundesstaatlichen Glaubwürdigkeitsbewertungen zu verbessern.

Das Programm hat mehrere geplante Komponenten. Eine davon ist die automatisierte Bewertung, bei der Algorithmen Signale auswerten und bei der Erstellung einer Einschätzung helfen sollen. Eine weitere ist die Distanzsensorik, also die Messung physiologischer Aktivität ohne herkömmliche Sensoren direkt an einer Person anzubringen.

Die Behörde schlägt zudem eine zentrale Speicherung und Analyse vor. Diese Komponente würde Daten aus Untersuchungen für Auswertung, Vergleich und potenzielle Modellentwicklung zusammenführen.

Die DCSA erklärt, sie werde unabhängige Validierungsstudien, Feldtests und Prototypbewertungen durchführen. Außerdem nennt sie das Applied Research Laboratory for Intelligence and Security und das Oak Ridge National Laboratory als Forschungspartner.

Diese Details zeigen einen Entwicklungspfad auf, verraten aber wenig über das endgültige Betriebsmodell. Die Dokumente erklären nicht, welche physiologischen Signale ein eingesetztes System verwenden würde.

Ebenso wenig legen sie fest, ob KI Bewertungen empfehlen, Untersuchungen klassifizieren, Anomalien markieren oder Personalentscheidungen direkt beeinflussen würde. Diese Rollen bergen sehr unterschiedliche Risiken.

Ein Algorithmus, der bei der Erkennung störanfälliger Sensoren hilft, ist nicht gleichzusetzen mit einem, der eine Person als täuschend einstuft. Ebenso unterscheidet sich eine Entscheidungshilfe, die von einem geschulten Prüfer bewertet wird, von einem weitgehend automatisierten Screening-System.

Der unmittelbare Anwendungsbereich des Programms umfasst die Überprüfung von Bundespersonal und die Erkennung von Insider-Bedrohungen. Davon betroffen sind Beschäftigte, Bewerber, Militärangehörige und Auftragnehmer, die möglicherweise Zugang zu sensiblen Informationen benötigen.

Dieser Kontext erhöht den Einsatz. Ein fehlerhaftes Ergebnis kann eine Sicherheitsfreigabe verzögern, eine Ermittlung in eine andere Richtung lenken, eine Karriere schädigen oder den Verdacht gegen eine unschuldige Person verstärken.

Der Antrag ist außerdem nicht mit einer Bewilligung gleichzusetzen. Der Kongress entscheidet weiterhin darüber, ob die vorgeschlagenen Mittel verfügbar werden, und kann Betrag, Bedingungen oder Berichtspflichten ändern.

Vorerst ist Polygraph Next am besten als staatlicher Forschungs- und Beschaffungsplan zu verstehen. Er verfügt über Ambitionen, einen vorgeschlagenen Haushalt und institutionelle Partner, aber über keine öffentlich nachgewiesene Leistung.

Warum die Überprüfung von Personal jetzt unter Druck steht

Das Programm reagiert auf eine reale operative Belastung, auch wenn seine vorgeschlagene Lösung wissenschaftlich weiterhin ungeklärt ist.

Die DCSA nimmt im System der bundesstaatlichen Sicherheitsüberprüfungen eine zentrale Stellung ein. Sie führt Hintergrunduntersuchungen durch und unterstützt in großen Teilen der Regierung Entscheidungen über den Zugang zu Verschlusssachen.

Ihr National Center for Credibility Assessment legt Ausbildungsstandards fest und berät Verteidigungs- und Geheimdienstvertreter in Fragen der Polygraphenpolitik. Die credibility assessment mission des Zentrums umfasst zudem technische Unterstützung, Forschung, Tests, Programmaufsicht und Audits.

Diese institutionelle Rolle gibt der DCSA einen klaren Grund, ihre Instrumente zu modernisieren. Herkömmliche Untersuchungen erfordern geschultes Personal, kontrollierte Bedingungen, die Vorbereitung von Sensoren, Befragungen und Interpretation.

Diese Anforderungen begrenzen den Durchsatz. Sie können zudem Unterschiede zwischen Prüfern, Standorten, Geräten und Testbedingungen verursachen.

Kontaktlose Sensoren versprechen einen einfacheren Aufbau. Automatisierte Bewertung verspricht konsistentere Analysen. Zentrale Datenhaltung verspricht stärkere Prüfungen und Nachvollziehbarkeit.

Jedes dieser Ziele hat operativen Wert. Keines belegt jedoch, dass das System Täuschung zuverlässig von Angst, Furcht, Verwirrung, Wut oder gewöhnlichen physiologischen Schwankungen unterscheiden kann.

Das umfassendere Überprüfungssystem steht bereits durch alternde Technologie und verzögerte Modernisierung unter Druck. Die DCSA entwickelt die Plattform National Background Investigation Services, um ältere Systeme zu ersetzen und behördenübergreifende Reformen zu unterstützen.

Eine personnel vetting review aus dem Jahr 2026 stellte fest, dass die DCSA jährlich rund zwei Millionen Hintergrunduntersuchungen durchführt. Sie stellte außerdem fest, dass der Behörde weiterhin ein verlässlicher Zeitplan für den Abschluss ihres großen Technologieprogramms fehlte.

Dieselbe Überprüfung berichtete, dass Warnmeldungen aus der kontinuierlichen Überprüfung von etwa 30.000 pro Quartal im Haushaltsjahr 2023 auf mehr als 100.000 im dritten Quartal des Haushaltsjahres 2025 stiegen. Die kontinuierliche Überprüfung nutzt automatisierte Registerabgleiche, um Entwicklungen zu identifizieren, die eine Prüfung erfordern.

Dieser Anstieg verdeutlicht die zentrale Herausforderung. Automatisierung kann mehr Informationen sammeln und markieren, schafft aber auch Arbeit, wenn Systeme große Mengen an Warnmeldungen erzeugen.

Polygraph Next tritt in diesem Umfeld als weiterer möglicher Filter auf. Wenn es die Signalqualität verbessert und inkonsistente Bewertungen verringert, könnte es Ermittlern helfen, ihre Aufmerksamkeit gezielter einzusetzen.

Wenn seine Klassifizierungen schlecht kalibriert sind, kann es das Gegenteil bewirken. Es könnte zusätzliche Warnmeldungen erzeugen, schwache Verdachtsmomente verstärken und die Arbeitsbelastung menschlicher Prüfer ausweiten.

Der Druck lastet daher auf der DCSA, auf Antragstellern für Sicherheitsfreigaben und auf Behörden, die qualifiziertes Personal suchen. Die DCSA benötigt schnellere Prozesse, während Antragsteller genaue und nachvollziehbare Entscheidungen brauchen.

Auch Arbeitgeber benötigen planbare Zeiträume für Sicherheitsfreigaben. Verteidigungsauftragnehmer können einige Beschäftigte nicht für Tätigkeiten mit Verschlusssachen einsetzen, bevor die Regierung die erforderliche Überprüfung abgeschlossen hat.

Sicherheitsverantwortliche stehen dem gegenteiligen Risiko gegenüber. Ein zu schnelles Vorgehen kann Behörden anfällig für Spionage, unbefugte Offenlegungen, Nötigung oder andere Insider-Bedrohungen machen.

Deshalb klingt ein schnellerer Detektor attraktiv. Er scheint Effizienz zu bieten, ohne die Prüfung zu verringern.

Doch Geschwindigkeit hilft nur, wenn die zugrunde liegende Klassifizierung vertrauenswürdig ist. Eine schnellere Verarbeitung mehrdeutiger physiologischer Signale führt nicht automatisch zu besserer Sicherheit.

Polygraph Next muss daher zwei Maßstäbe erfüllen. Es muss operative Reibung verringern und nachweisen, dass seine Ergebnisse Entscheidungen unter realistischen Bedingungen verbessern.

Der zweite Maßstab ist schwieriger. Er erfordert Belege zu Fehlern bei unterschiedlichen Personen, Umgebungen, Frageformaten, medizinischen Zuständen und Stressniveaus.

Ohne diese Belege riskiert das Pentagon, Durchsatz mit Genauigkeit gleichzusetzen. Das sind keine austauschbaren Kennzahlen.

Wie Polygraph Next KI nutzt, ohne das Inferenzproblem zu lösen

KI kann die Bewertung physiologischer Signale standardisieren, aber sie kann nicht bewirken, dass diese Signale ausschließlich für Lügen stehen.

Ein herkömmlicher Polygraph zeichnet Veränderungen wie Atmung, kardiovaskuläre Aktivität und Hautleitfähigkeit auf. Prüfer vergleichen Reaktionen auf verschiedene Fragen und interpretieren, ob bestimmte Unterschiede auf Täuschung hindeuten.

Polygraph Next schlägt vor, diesem Prozess KI- und Machine-Learning-Bewertungen hinzuzufügen. Maschinelles Lernen identifiziert statistische Muster in Beispielen und wendet diese Muster auf neue Daten an.

Dieser Ansatz könnte einige Unterschiede zwischen Prüfern verringern. Ein Algorithmus kann dieselbe mathematische Regel auf Tausende von Signalsegmenten anwenden.

Er kann außerdem mehr Variablen kombinieren, als eine Person leicht auswerten kann. Timing, Signalform, Reaktionsdauer und Korrelationen zwischen Sensoren könnten alle eine Bewertung beeinflussen.

Die Distanzsensorik verändert die Erfassungsmethode. Anstatt sich vollständig auf angelegte Geräte zu verlassen, könnte ein System einige physiologische Messungen aus der Entfernung gewinnen.

Der Haushalt benennt nicht das endgültige Sensorpaket. Jede spezifische Beschreibung über kontaktloses physiologisches Monitoring hinaus wäre daher verfrüht.

Dennoch schafft die Architektur eine klare Inferenzkette. Sensoren messen zunächst eine physische Reaktion. Software extrahiert Merkmale aus dieser Reaktion.

Ein Modell wandelt diese Merkmale dann in eine Bewertung oder Empfehlung um. Schließlich interpretiert ein Prüfer oder Beamter dieses Ergebnis im Sicherheitskontext.

Fehler können auf jeder Stufe auftreten. Ein Sensor kann Störungen erfassen, ein Modell kann unzuverlässige Korrelationen lernen und ein Entscheidungsträger kann dem Ergebnis zu viel Gewicht beimessen.

Die größte Schwierigkeit liegt zwischen der gemessenen Reaktion und dem behaupteten mentalen Zustand. Erhöhte Erregung kann mit Täuschung einhergehen, aber auch mit der Angst, dass einem nicht geglaubt wird.

Ein wahrheitsgemäßer Antragsteller kann auf eine Anschuldigung stark reagieren. Eine täuschende Person kann ruhig bleiben oder eine Gegenmaßnahme anwenden, die das aufgezeichnete Muster verändert.

Die scientific polygraph review der National Academies untersuchte dieses Problem, bevor modernes maschinelles Lernen verbreitet wurde. Ihre zentrale wissenschaftliche Warnung gilt weiterhin.

Physiologische Reaktionen entsprechen nicht ausschließlich Täuschung. Das bedeutet, dass ein verbesserter Klassifikator konsistenter werden kann, ohne valider zu werden.

Betrachten wir ein Modell, das mit früheren Untersuchungen trainiert wurde. Historische Labels können aus Prüferurteilen, Geständnissen, Fallausgängen oder Laboranweisungen stammen.

Jede Quelle für Labels hat Schwächen. Prüferurteile können die Annahmen der Methode reproduzieren, während Geständnisse möglicherweise nicht verfügbar oder unvollständig sind.

Laborexperimente liefern klarere Ground Truth, weil Forschende wissen, wer Anweisungen zum Lügen erhalten hat. Eine simulierte Lüge hat jedoch selten die Konsequenzen einer realen Sicherheitsüberprüfung.

Modelle können zudem Abkürzungen lernen. Sie könnten Bewegung, Sprechstil, Gesundheitszustände, demografische Merkmale oder Testumgebungen mit den Labels in den Trainingsdaten verknüpfen.

Eine hohe Leistung innerhalb eines Datensatzes würde diese Sorge nicht ausräumen. Das System muss bei neuen Personen, neuen Standorten, neuen Prüfern und realistischen Basisraten funktionieren.

Basisraten beschreiben, wie häufig die Zielbedingung in der getesteten Population vorkommt. Bei der Personalüberprüfung sind schwerwiegende Sicherheitsverstöße vermutlich selten.

Diese Seltenheit macht falsch-positive Ergebnisse besonders bedeutsam. Selbst ein Test, der in ausgewogenen Experimenten präzise erscheint, kann in einer Belegschaft mit geringer Prävalenz viele unschuldige Personen markieren.

Eine KI-Bewertungsschicht kann dieser Mathematik nicht entkommen. Wenn überhaupt, macht Automatisierung die Kalibrierung wichtiger, weil sie denselben Schwellenwert in größerem Maßstab anwenden kann.

Erklärbarkeit stellt eine weitere Herausforderung dar. Ermittler müssen wissen, ob ein Wert eine aussagekräftige Reaktion, schlechte Signalqualität, einen ungewöhnlichen körperlichen Zustand oder eine Modellbeschränkung widerspiegelt.

Ein allgemeiner Vertrauenswert liefert diese Antwort nicht. Hohe Modellzuversicht kann mit einer selbstsicher falschen Klassifizierung einhergehen.

Die am besten vertretbare Rolle für KI wäre eng begrenzt und überprüfbar. Sie könnte die Qualitätskontrolle verbessern, beschädigte Messungen erkennen oder die Bewertungskonsistenz mit geschulten Prüfern vergleichen.

Ein System, das als KI-Lügendetektor vermarktet wird, erhebt einen viel weitergehenden Anspruch. Es impliziert eine verlässliche Verbindung zwischen beobachtbarer Physiologie und Täuschung, die Forschende nicht nachgewiesen haben.

Der zentrale Zielkonflikt lautet Konsistenz versus Validität

Polygraph Next kann Bewertungen einheitlicher machen und zugleich eine unbelegte Schlussfolgerung autoritativer erscheinen lassen.

Das stärkste praktische Argument von DCSA betrifft die Standardisierung. Bundesprogramme profitieren, wenn Verfahren über Prüfer und Standorte hinweg vergleichbare Aufzeichnungen erzeugen.

Automatisierte Bewertung kann dokumentieren, welche Messungen ein Ergebnis beeinflusst haben. Zentralisierte Systeme können Aufzeichnungen bewahren und spätere Audits unterstützen.

Diese Funktionen können willkürliche Unterschiede verringern. Sie könnten auch Muster inkonsistenter Durchführung sichtbar machen, die ältere Prozesse nicht erfassen konnten.

Konsistenz ist jedoch nicht Genauigkeit. Ein Lineal mit falscher Skala kann jedes Mal identische Fehler erzeugen.

Diese Unterscheidung ist wichtig, weil computergenerierte Werte oft den Anschein von Objektivität erwecken. Verantwortliche könnten einem numerischen Ergebnis folgen, selbst wenn seine wissenschaftliche Bedeutung unsicher bleibt.

Die Bezeichnung „KI“ kann diesen Effekt verstärken. Nutzer könnten annehmen, ein System habe ein feines Täuschungssignal erkannt, obwohl es tatsächlich Korrelationen gelernt hat, die spezifisch für seine Trainingsdaten sind.

Die öffentlichen Dokumente des Pentagons besagen, dass das Projekt eine unabhängige Validierung umfassen wird. Das ist eine wichtige Zusage, doch Unabhängigkeit erfordert mehr als die Zuweisung eines separaten Teams.

Evaluatoren benötigen Zugang zu Methoden, Datensätzen, Fehlerdefinitionen und Testbedingungen. Sie müssen zudem negative Befunde ohne Programmdruck veröffentlichen können.

Die Validierung sollte Untersuchungen konkreter Vorfälle von breit angelegten Screenings trennen. Die beiden Anwendungen betreffen unterschiedliche Populationen, Fragen, Anreize und statistische Zielkonflikte.

Die National Academies kamen zu dem Schluss, dass Polygraphen bei einigen konkreten Vorfällen besser als zufällig unterscheiden können. Sie stellten außerdem fest, dass die Evidenz für Screenings schwächer ist, und warnten davor, sich bei Sicherheitsentscheidungen über Beschäftigte auf Polygraphen zu verlassen.

Dieser Unterschied sollte Polygraph Next von Beginn an prägen. Eine einzige prominent ausgewiesene Genauigkeitszahl würde die Anwendungen verschleiern, bei denen Fehler am schwersten wiegen.

Das System benötigt außerdem klare Entscheidungsgrenzen. Ein Forschungswert sollte nicht stillschweigend zur Grundlage nachteiliger Maßnahmen werden, bevor seine Grenzen verstanden sind.

Die Bundespolitik hat Polygraphergebnisse historisch als einen Teil eines umfassenderen Prozesses behandelt. Ermittler können Untersuchungen nutzen, um Gespräche zu steuern oder Punkte zu identifizieren, die einer weiteren Prüfung bedürfen.

Polygraph Next könnte diese Grenze verwischen, wenn automatisierte Ergebnisse direkt in andere Überprüfungssysteme einfließen. Zentralisierte Analysen können einen Wert übertragbar und dauerhaft machen.

Übertragbarkeit steigert die Effizienz, erhöht aber auch die Folgen von Fehlern. Ein fragwürdiges Ergebnis kann einem Bewerber durch Überprüfungen, Zuweisungen oder Behörden hinweg folgen.

Die Haushaltsdokumente nennen Nachverfolgbarkeit als Vorteil. Eine ordnungsgemäße Nachverfolgbarkeit sollte zeigen, wer einen Wert genutzt hat, wie er eine Entscheidung beeinflusste und ob spätere Belege ihn stützten.

Sie sollte es Verantwortlichen auch ermöglichen, Aufzeichnungen zu korrigieren. Andernfalls können zentralisierte Daten Fehler wirksamer bewahren als Rechenschaftspflicht.

Datenschutz ist ein weiterer Teil dieses Zielkonflikts. Physiologische Daten können Informationen offenlegen, die über die Frage hinausgehen, die ein Prüfer gestellt hat.

Die Dokumente beschreiben öffentlich weder Aufbewahrungsfristen, Zugriffsregeln, Berechtigungen für Modelltraining noch Grenzen für die Sekundärnutzung. Diese Richtlinien verdienen Prüfung, bevor sich große Datensätze ansammeln.

Auch Cybersicherheit ist von Bedeutung. Ein zentrales Repository für Glaubwürdigkeitsbewertungen würde sensible persönliche und nationale Sicherheitsinformationen enthalten.

DCSA verwaltet bereits Systeme mit umfangreichen Daten aus Hintergrundüberprüfungen. Das Hinzufügen physiologischer Aufzeichnungen und Modellergebnisse würde die Sensibilität dieser Umgebung weiter erhöhen.

Die Regierung muss auch gegnerisches Verhalten berücksichtigen. Personen mit hohen Anreizen können Testmethoden studieren und versuchen, ihre Reaktionen zu manipulieren.

DCSA benennt Gegenmaßnahmen ausdrücklich als Problem der aktuellen Technologie. Maschinelles Lernen überwindet sie jedoch nicht automatisch.

Ein mit bekannten Gegenmaßnahmen trainiertes Modell kann vertraute Muster erkennen. Gegner können darauf reagieren, indem sie Techniken entwickeln, die außerhalb der Trainingsverteilung liegen.

Dadurch entsteht ein Wettrüsten zwischen Erkennung und Umgehung. Behauptungen über eine höhere Widerstandsfähigkeit müssen daher mit anpassungsfähigen Teilnehmern getestet werden, nicht nur mit kooperativen Freiwilligen.

Der zentrale Zielkonflikt des Programms ist nun klar. Automatisierung kann den Prozess schneller, konsistenter und leichter auditierbar machen.

Gleichzeitig kann sie falsch-positive Ergebnisse skalieren, unsichere Annahmen verschleiern und umstrittenen Urteilen einen numerischen Anstrich verleihen. Die Governance der Technologie muss sich gemeinsam mit ihren Sensoren und Modellen weiterentwickeln.

Was eine unabhängige Validierung nachweisen muss

Der entscheidende Test ist nicht, ob Polygraph Next Labormuster erkennt, sondern ob es reale Entscheidungen verbessert, ohne unschuldigen Menschen zu schaden.

Das Pentagon sollte zunächst den vorgesehenen Einsatz definieren. Ein Modell für Qualitätssicherung benötigt andere Nachweise als eines, das eine Täuschungsfeststellung empfehlen soll.

Die öffentliche Dokumentation sollte benennen, ob Ergebnisse beratend oder entscheidend sind. Sie sollte außerdem erklären, ob Verantwortliche sie überstimmen können und wie solche Überstimmungen überprüft werden.

Als Nächstes folgt die Ground Truth. Forschende benötigen eine glaubwürdige Methode, um festzustellen, welche Teilnehmer täuschten und welche wahrheitsgemäß waren.

Laboranweisungen liefern bekannte Labels, aber nur begrenzten Realismus. Fälle aus der Praxis liefern Realismus, verfügen jedoch häufig nicht über zweifelsfreie Labels.

Ein ernsthaftes Validierungsprogramm muss diese Spannung anerkennen. Es sollte Ergebnisse getrennt berichten, statt ungleiche Datensätze zu einer günstigen Kennzahl zu vermischen.

Die Bewertung muss Sensitivität und Spezifität umfassen. Sensitivität misst, wie häufig das System Zielgruppenfälle erkennt, während Spezifität misst, wie häufig es Nicht-Zielgruppenfälle korrekt freigibt.

Diese Werte sollten zusammen mit Raten falsch-positiver und falsch-negativer Ergebnisse sowie nicht eindeutigen Ergebnissen erscheinen. Das Entfernen nicht eindeutiger Fälle kann die Leistung besser erscheinen lassen, als Nutzer sie erleben.

Ergebnisse sollten zudem unter realistischen Prävalenzbedingungen berichtet werden. Das Screening einer allgemeinen sicherheitsüberprüften Belegschaft unterscheidet sich mathematisch von der Bewertung Verdächtiger in einer gezielten Untersuchung.

Angenommen, ein Modell wird mit gleichen Zahlen täuschender und wahrheitsgemäßer Personen getestet. Seine berichtete Genauigkeit kann beeindruckend wirken, weil die Stichprobe künstlich ausgewogen ist.

Beim tatsächlichen Screening kann schwerwiegende Täuschung wesentlich seltener sein. Selbst eine moderate Falsch-Positiv-Rate kann dann weit mehr unschuldige Markierungen als valide Erkennungen erzeugen.

Evaluatoren müssen verschiedene demografische Gruppen und Gesundheitszustände testen. Physiologische Ausgangswerte können je nach Alter, Medikation, Behinderung, Stress, Schlaf und zahlreichen weiteren Faktoren variieren.

Dabei geht es nicht darum, identische Physiologie zu verlangen. Es geht darum festzustellen, ob die Fehler des Systems ungleichmäßig auf Gruppen verteilt sind.

Fernerkundung erfordert separate Tests für Beleuchtung, Abstand, Bewegung, Kleidung, Hautmerkmale, Kameraplatzierung und Störungen aus der Umgebung. Ein Modell kann versagen, wenn sich die Erfassungsbedingungen ändern.

Tests auf Standortebene sind unerlässlich. Ergebnisse aus einem kontrollierten Labor sollten keinen landesweiten Einsatz autorisieren.

Das Programm sollte Gegenmaßnahmen auch unter gegnerischen Bedingungen testen. Teilnehmer benötigen Anreize und Vorbereitung, die realen Versuchen zur Überwindung des Systems stärker entsprechen.

Menschliche Faktoren verdienen ebenso Aufmerksamkeit. Prüfer könnten weniger wachsam werden, wenn Software einen selbstsicheren Wert präsentiert.

Forschende nennen dies Automatisierungsbias: die Tendenz, die Empfehlung einer Maschine zu bevorzugen, selbst wenn widersprüchliche Belege vorliegen. Schulung allein beseitigt dies nicht immer.

Eine ordnungsgemäße Studie sollte Entscheidungen mit und ohne algorithmische Unterstützung vergleichen. Dieses Design kann zeigen, ob das System die menschliche Leistung verbessert oder lediglich das Vertrauen verändert.

Sie sollte auch nachgelagerte Ergebnisse messen. Ein nützliches System muss Ermittlungen verbessern, unnötige Nachverfolgung verringern oder fundierte Sicherheitsfreigabeentscheidungen unterstützen.

Schnellere Untersuchungen belegen keinen Erfolg, wenn sie mehr Einsprüche, wiederholte Befragungen, Verzögerungen bei der Personalbesetzung oder Ermittlungs-Sackgassen verursachen.

Transparente Berichterstattung würde das Vertrauen stärken. DCSA sollte mindestens Testprotokolle, Beschreibungen der Populationen, Bewertungsmetriken, bekannte Einschränkungen und Governance-Regeln veröffentlichen.

Nationale Sicherheitsprogramme können nicht jedes operative Detail veröffentlichen. Geheimhaltung sollte jedoch unabhängige Experten nicht daran hindern, die grundlegende Validität einer Technologie zu bewerten, die Personalentscheidungen beeinflusst.

Externe Replikation würde die stärkste Absicherung bieten. Ein Modell sollte Tests durch Forschende bestehen, die es nicht entwickelt haben und kein Interesse an der Beschaffung haben.

Diese Anforderung ist besonders wichtig für proprietäre Systeme. Anbieter können Quellcode schützen und dennoch kontrollierte Bewertungen durch Dritte unterstützen.

Die Regierung sollte zudem Versagensschwellen vorab definieren. Andernfalls können Behörden gemischte Ergebnisse nachträglich interpretieren und die Entwicklung trotz schwacher Evidenz fortsetzen.

Ein Schwellenwert könnte maximale Falsch-Positiv-Raten für bestimmte Anwendungsfälle festlegen. Er könnte auch nachteilige Maßnahmen untersagen, die ausschließlich auf einem automatisierten Ergebnis beruhen.

Die historische Bilanz rechtfertigt diese Vorsicht. Die National Academies warnten, dass eine weitere Verfeinerung konventioneller Techniken wahrscheinlich nur bescheidene Verbesserungen der Genauigkeit bringen würde.

Polygraph Next verdient einen fairen empirischen Test. Es verdient nicht die Annahme, dass neuere Sensoren und maschinelles Lernen die zugrunde liegende Wissenschaft bereits gelöst haben.

Drei Signale werden zeigen, wohin sich Polygraph Next entwickelt

Formulierungen zur Finanzierung, das Validierungsdesign und der Umfang der Beschaffung werden zeigen, ob dies Forschung bleibt oder sich in Richtung operativer Urteile bewegt.

Das erste Signal ist die Reaktion des Kongresses auf das Haushaltsjahr 2027. Gesetzgeber können die beantragten 6,421 Millionen US-Dollar bereitstellen, sie kürzen, ablehnen oder Berichtspflichten anfügen.

Eine vollständige Finanzierung ohne Evaluierungsauflagen würde DCSA großen Spielraum geben, das Programm intern zu gestalten. An eine unabhängige Prüfung geknüpfte Mittel würden die wissenschaftliche Validierung stärker ins Zentrum rücken.

Auch eine verzögerte Mittelbewilligung wäre von Bedeutung. Sie könnte den Testzeitplan verdichten oder Meilensteine in spätere Haushaltsjahre verschieben.

Das zweite Signal ist die Veröffentlichung eines Validierungsprotokolls. Leser sollten auf klar benannte Endpunkte, realistische Populationen, Annahmen zu Basisraten und getrennte Ergebnisse für Screenings und spezifische Untersuchungen achten.

Ein Protokoll, das sich überwiegend auf die Klassifizierung im Labor konzentriert, würde das Vertrauen in einen breiten Einsatz schwächen. Feldvalidierungen mit transparenter Fehlerberichterstattung würden die Argumentation für das Programm stärken.

Besonders aufschlussreich wird die Definition von „Genauigkeit“ sein. Jedes Ergebnis, das nicht eindeutige Untersuchungen ausschließt oder nicht zusammenhängende Anwendungsfälle kombiniert, verdient eine genaue Prüfung.

Das dritte Signal ist der Umfang früher Verträge und Prototypen. Beschaffungsbekanntmachungen könnten zeigen, welche Sensoren, Analyseplattformen und Entscheidungsfunktionen DCSA erwerben möchte.

Ein eng gefasster Vertrag für Messforschung würde das Projekt im explorativen Rahmen halten. Ein System, das Bewertungen in operative Überprüfungen einspeisen soll, würde die Dringlichkeit der Governance-Fragen erhöhen.

Die Vertragssprache könnte auch die Datenhoheit klären. Die Regierung braucht Rechte, um Modelle zu prüfen, Evaluierungsunterlagen zu sichern und Leistungsversagen zu untersuchen.

Diese Signale sollten sichtbar werden, bevor irgendjemand Polygraph Next als funktionsfähigen KI-Lügendetektor des Pentagons betrachtet. Die derzeitige Faktenlage stützt nur eine wesentlich eingeschränktere Schlussfolgerung.

Das Pentagon hat tatsächliche Probleme mit langsamen, uneinheitlichen und veralteten Bewertungsmethoden benannt. Es hat moderne Sensoren und Algorithmen als möglichen Weg zu Verbesserungen vorgeschlagen.

Nicht gezeigt hat es, dass KI Täuschung anhand physiologischer Aktivitäten zuverlässig ableiten kann. Diese Behauptung muss getestet werden, statt im Namen des Programms verankert zu werden.

Forscher, Bundesbedienstete, Auftragnehmer und Bürgerrechtsvertreter sollten auf den Evidenzstandard achten, nicht auf die technische Raffinesse der Ausstattung. Bessere Messungen sind nur dann relevant, wenn sie valide Schlussfolgerungen stützen.

Wenn die ersten Finanzierungsentscheidungen fallen, sollte eine Frage die Debatte leiten: Wird Polygraph Next testen, ob KI Glaubwürdigkeitsbewertungen verbessert, oder diese Verbesserung voraussetzen und das System darauf aufbauen?

 
 

Kostenlos loslegen

Ein Local-First-KI-Assistent mit persönlichem Wissensmanagement

Für ein besseres KI-Erlebnis

unterstützt remio derzeit nur Windows 10+ (x64) und M-Chip Macs.

Ihr KI-Partner bei der Arbeit
Mehr schaffen mit remio

Planen. Erstellen. Liefern.
Alles an einem Ort.

bottom of page