top of page

DHS-KI-FOIA-Schwärzungen versprechen Tempo, bergen jedoch das Risiko größerer Geheimhaltung

29. Sept.
13 Min. Lesezeit

DHS plant, KI einzusetzen, um bei jährlich 100.000 bis 140.000 Anfragen auf öffentliche Unterlagen Schwärzungen zu empfehlen – obwohl es nur begrenzte Belege dafür gibt, dass Maschinen verlässliche Entscheidungen über Offenlegung treffen können. Die Initiative zu DHS-KI-FOIA-Schwärzungen verspricht kürzere Bearbeitungszeiten. Sie birgt jedoch auch das Risiko, übermäßige Zurückhaltung von Informationen schneller, kostengünstiger und für Antragsteller schwerer anfechtbar zu machen.

Das Department of Homeland Security erklärt, Beschäftigte würden die Empfehlungen prüfen, bevor Unterlagen die Behörde verlassen. Diese Schutzmaßnahme ist wichtig, weil der Freedom of Information Act, kurz FOIA, eine kontextbezogene rechtliche Beurteilung verlangt. Ein Modell kann Namen oder Identifikationsnummern erkennen. Es kann jedoch nicht eigenständig entscheiden, ob die Veröffentlichung einer politischen Erörterung einen rechtlich anerkannten Schaden verursachen würde.

Es geht nicht um einen Wettstreit zwischen Technologie und papierbasierter Bürokratie. Der eigentliche Konflikt besteht zwischen effizienter Bearbeitung und einem tatsächlichen öffentlichen Zugang. Bundesbehörden sehen sich mit einem Volumen an Aktenanfragen konfrontiert, das menschliche Prüfer kaum bewältigen können. Dennoch hat die Regierung nicht gezeigt, dass automatisierte Empfehlungen durchgängig die Offenlegung begünstigen werden, wenn das Gesetz sie zulässt.

Diese Frage hat bei DHS besonderes Gewicht. Das Ministerium bearbeitete im Haushaltsjahr 2025 laut Bundesdaten, die im federal redaction plan zitiert werden, fast eine Million Anfragen. Nur 2,3 Prozent führten zu Unterlagen ohne Schwärzungen. Wenn Automatisierung auch nur einen Teil dieses Arbeitsvolumens beeinflusst, prägen ihre Annahmen, was Journalistinnen und Journalisten, Forschende, Anwältinnen und Anwälte sowie gewöhnliche Bürger über Bundesaktivitäten erfahren können.

Was DHS-KI-FOIA-Schwärzungen tatsächlich leisten werden

Die unmittelbare Veränderung ist keine autonome Zensur, sondern der Einsatz automatisierter Empfehlungen in einem rechtlichen Prüfverfahren von enormem Umfang.

U.S. Customs and Border Protection, eine DHS-Behörde, plant den Einsatz von Google-Technologien für künstliche Intelligenz und maschinelles Lernen bei der FOIA-Bearbeitung. Das System soll Inhalte identifizieren, die möglicherweise zurückgehalten werden dürfen, und staatlichen Beschäftigten Schwärzungen empfehlen.

Eine Schwärzung entfernt vor der Veröffentlichung einen Teil einer Unterlage, in der Regel durch das Abdecken von Text, Bildern, Audio- oder Videomaterial. Behörden wenden Schwärzungen an, wenn Informationen unter eine FOIA-Ausnahme fallen oder ein anderes Gesetz die Offenlegung untersagt. Häufige Beispiele sind personenbezogene Daten, Verschlusssachen, Informationen zur Strafverfolgung und bestimmte interne Beratungen.

Laut DHS soll die Automatisierung die Bearbeitungszeiten verkürzen. Das Ministerium hat außerdem erklärt, Mitarbeitende würden jeden Fall prüfen und sicherstellen, dass Antragsteller korrekte und vollständige Informationen erhalten. Diese Aussagen deuten darauf hin, dass ein Mensch weiterhin die Verantwortung für die endgültige Entscheidung trägt.

Der geplante Umfang verändert jedoch die praktische Bedeutung dieser Prüfung. DHS erwartet, KI auf Anfragekategorien anzuwenden, die mehr als 10 Prozent seiner Eingänge ausmachen. Das Ministerium schätzt diese Spanne auf etwa 100.000 bis 140.000 Anfragen.

Eine maschinelle Empfehlung zu prüfen, ist nicht zwangsläufig dasselbe wie eine eigenständige neue Entscheidung zu treffen. Eine vielbeschäftigte Person könnte bei den vom Modell markierten Passagen beginnen und sich darauf konzentrieren, sie zu bestätigen. Ein solcher Ablauf kann Automatisierungsbias erzeugen – die Tendenz, die Ausgabe eines Systems zu akzeptieren, weil sie systematisch oder autoritativ wirkt.

Der Unterschied wird entscheidend, sobald ein Modell über offensichtlich personenbezogene Informationen hinausgeht. Das Erkennen einer Social-Security-Nummer folgt einem relativ stabilen Muster. Die Anwendung einer Ausnahme auf eine E-Mail über eine noch nicht abgeschlossene Richtlinie erfordert dagegen ein Verständnis von Autor, Zweck, Zeitpunkt, Zielgruppe und Bezug des Dokuments zu einer endgültigen Entscheidung.

DHS hat öffentlich nicht dargelegt, wie häufig sein System einfache Mustererkennung statt solcher kontextbezogenen Entscheidungen übernehmen wird. Auch umfassende Leistungsergebnisse, Fehlerquoten, Testaufzeichnungen, Trainingsbeispiele oder Überstimmungsraten wurden nicht veröffentlicht.

Auch andere Ministerien experimentieren. Das Department of the Interior nutzt Berichten zufolge Microsoft-Technologie, um Material zu finden, das unter den Schutz des Anwalts-Mandanten-Verhältnisses fallen könnte. Das Department of Health and Human Services hat ein Proof-of-Concept-System zur Prüfung und Schwärzung großer Dokumentensammlungen beschrieben. Das Justice Department erklärt, mehrere Bereiche nutzten bereits automatisierte Such- und Prüfungsfunktionen.

Die Entwicklung geht daher über einen einzelnen DHS-Einsatz hinaus. Bundesbehörden bauen eine Schicht maschineller Unterstützung zwischen Regierungsunterlagen und den Menschen auf, die sie anfordern. Ungeklärt bleibt, ob diese Schicht Prüfern helfen wird, freigabefähige Informationen zu finden, oder sie dazu ermutigt, mehr davon zu entfernen.

Diese Unsicherheit macht aus einer operativen Modernisierung einen Test der Regierungstransparenz.

Warum Bundesbehörden FOIA jetzt automatisieren

KI hält Einzug in FOIA, weil Anfragemengen und Aktenbestände die bestehenden Prüfsysteme vieler Behörden überfordert haben.

FOIA gibt der Öffentlichkeit das Recht, Unterlagen von Behörden der Exekutive anzufordern. Das Gesetz gilt nicht für den Kongress, Bundesgerichte oder die meisten Stellen, die den Präsidenten direkt beraten. Jede erfasste Behörde muss relevante Unterlagen auffinden, prüfen, rechtmäßige Ausnahmen anwenden und sämtliches angemessen abtrennbares, nicht ausgenommenes Material freigeben.

Dieser Prozess wird langsam, wenn eine Anfrage Tausende von E-Mails, Anhängen, Nachrichten, Videos, Tabellen und gescannten Dokumenten umfasst. Prüfer müssen Duplikate finden, relevantes Material identifizieren, andere Stellen konsultieren, berechtigte Geheimnisse schützen und alles bewahren, was rechtlich veröffentlicht werden kann.

Behörden der Bundesregierung bearbeiteten im Haushaltsjahr 2025 die Rekordzahl von 1,6 Millionen Anfragen. Das entsprach laut den jährlichen FOIA-Daten des Justice Department einem Anstieg von 9 Prozent gegenüber dem Vorjahr.

Technologie kann mehrere mechanische Teile dieser Arbeitslast übernehmen. Optische Zeichenerkennung wandelt gescannte Seiten in durchsuchbaren Text um. Deduplizierung entfernt wiederholte E-Mail-Verläufe. Entitätserkennung findet Namen, Telefonnummern, Adressen und andere wiederkehrende Muster. Klassifikationssysteme können Dokumente priorisieren, die für eine Anfrage relevant erscheinen.

Diese Anwendungen sind nicht gleichermaßen riskant. Das Durchsuchen einer Sammlung nach relevanten Unterlagen kann den Zugang erweitern, wenn die Alternative eine unvollständige manuelle Suche ist. Das automatische Verbergen von Sprache betrifft hingegen den Inhalt der öffentlichen Veröffentlichung.

Bundesvertreter befassen sich seit Jahren mit dieser Unterscheidung. Im Mai 2026 veranstalteten der Chief FOIA Officers Council, das Office of Government Information Services des National Archives und das Justice Department die dritte NexGen FOIA Tech Showcase.

Die Technologiepräsentation der Regierung suchte Werkzeuge für elektronische Beweisermittlung, Fallbearbeitung, barrierefreie Veröffentlichungen, öffentliche Lesesäle und automatisierte Schwärzung. Vorgeschlagene Systeme deckten Papierakten, digitale Inhalte, Video, Audio und strukturierte Daten ab.

Die Veranstaltung folgte ähnlichen Präsentationen in den Jahren 2022 und 2024. Sie spiegelte außerdem eine Empfehlung des föderalen FOIA Advisory Committee wider, das Behörden dazu ermutigte, Brancheninformationen über KI-gestützte Bearbeitung einzuholen.

Die Einführung ist weiterhin begrenzt, nimmt jedoch zu. Die jüngste FOIA-Bewertung des National Archives ergab, dass 20,6 Prozent der antwortenden Bundesbehörden 2025 KI oder maschinelles Lernen nutzten, um Unterlagen zu durchsuchen oder zu organisieren. Im vorherigen Bericht waren es 18,6 Prozent gewesen.

Derselbe Bericht ergab, dass 80 Prozent elektronische Beweisermittlungswerkzeuge für FOIA-Suchen verwendeten, gegenüber 72 Prozent im Jahr 2020. Diese Zahlen zeigen, dass Behörden die Dokumentenarbeit bereits automatisierten, bevor generative KI zur dominierenden Technologiegeschichte wurde.

Das Problem der Rückstände ist real. Verzögerter Zugang kann korrekte Informationen nutzlos machen. Eine Unterlage, die erst nach einer Wahl, einem Gerichtsverfahren, einer politischen Debatte oder einem öffentlichen Notfall veröffentlicht wird, kann zu spät kommen, um Rechenschaftspflicht zu ermöglichen.

Automatisierung kann daher der Offenheit dienen, wenn sie Beschäftigten hilft, Dokumente zu finden, Duplikate zu entfernen oder eindeutig geschützte personenbezogene Daten zu identifizieren. Schnellere Bearbeitung ist kein belangloser Vorteil.

Die Gefahr entsteht, wenn Behörden Geschwindigkeit als primären Maßstab für Erfolg behandeln. Eine abgeschlossene Anfrage ist nicht zwangsläufig eine erfüllte Anfrage. Eine schnelle Antwort voller unnötiger schwarzer Balken kann der Öffentlichkeit weniger Nutzen bringen als eine langsamere, sorgfältig geprüfte Offenlegung.

Deshalb kann die zentrale Leistungsfrage nicht lauten, wie viele Seiten das System pro Stunde verarbeitet. Sie muss lauten, wie viele rechtmäßig zugängliche Informationen die Öffentlichkeit erreichen, mit wie vielen Fehlern und nach welchem Maß an menschlicher Kontrolle.

Das Effizienzversprechen trifft auf ein Offenlegungsproblem

Dasselbe System, das rechtmäßige Schwärzungen beschleunigen kann, kann auch die bestehende Tendenz der Regierung skalieren, zu viele Informationen zurückzuhalten.

DHS bearbeitete im Haushaltsjahr 2025 994.992 FOIA-Anfragen. In nur 2,3 Prozent der abgeschlossenen Fälle gab es Unterlagen ohne Schwärzungen. Rund 40 Prozent führten zu teilweise geschwärzten Veröffentlichungen.

Die übrigen Anfragen endeten aus verschiedenen Gründen. Einige wurden auf Grundlage gesetzlicher Ausnahmen vollständig abgelehnt. In vielen Fällen erklärte das Ministerium, keine relevanten Unterlagen gefunden zu haben. Andere Anfragen wurden zurückgezogen, an andere Stellen verwiesen oder aus Verfahrensgründen geschlossen.

Diese Kategorien belegen kein Fehlverhalten. DHS befasst sich mit Einwanderung, Grenzdurchsetzung, Cybersicherheit, Katastrophenschutz, Transportsicherheit und Schutzmaßnahmen. Seine Unterlagen enthalten regelmäßig personenbezogene Daten sowie Informationen im Zusammenhang mit Strafverfolgung oder nationaler Sicherheit.

Dennoch ist der Ausgangspunkt wichtig. DHS führt automatisierte Empfehlungen nicht in ein System ein, das für umfassende, ungeschwärzte Offenlegungen bekannt ist. Es führt sie in ein System ein, in dem vollständige Veröffentlichungen bereits selten sind.

KI kann dieses System in beide Richtungen lenken. Ein gut konzipiertes Modell könnte Beschäftigten helfen, einen geschützten Namen zu isolieren und gleichzeitig den Rest eines Absatzes freizugeben. Das würde die gesetzliche Vorgabe unterstützen, ausgenommene Informationen von Material zu trennen, das die Öffentlichkeit erhalten darf.

Ein schlecht kalibriertes Modell könnte einen ganzen Absatz markieren, weil ein Satz geschützter Sprache ähnelt. Wenn Beschäftigte die Empfehlung übernehmen, würde das System nicht ausgenommenen Kontext zusammen mit potenziell sensiblem Text verbergen.

Modelle machen zudem zwei unterschiedliche Arten von Fehlern. Ein falsch negatives Ergebnis übersieht Informationen, die geschützt werden sollten, und kann dadurch private oder geheime Daten offenlegen. Ein falsch positives Ergebnis kennzeichnet rechtmäßig zugängliche Informationen zur Entfernung.

Staatliche Anreize behandeln diese Fehler nicht gleich. Eine versehentliche Offenlegung kann unmittelbar einen Sicherheitsvorfall, eine Datenschutzbeschwerde oder ein Disziplinarproblem auslösen. Eine unnötige Schwärzung belastet dagegen gewöhnlich den Antragsteller, der Einspruch einlegen oder klagen muss, um sie anzufechten.

Dieses Ungleichgewicht begünstigt konservative Einstellungen. Ein System, das darauf optimiert ist, versehentliche Freigaben zu vermeiden, wird wahrscheinlich mehr Material markieren. Menschliche Prüfer, die unter Zeitdruck arbeiten, könnten diese Vorschläge dann genehmigen, weil Zurückhaltung institutionell sicherer wirkt.

Das Ergebnis kann eine schrittweise Verschärfung der Geheimhaltung sein. Jede Modell-Empfehlung wirkt für sich genommen vorsichtig. Über Hunderttausende Anfragen hinweg könnte der kumulative Effekt jedoch große Informationsmengen entfernen, die eine gründlichere Prüfung freigeben würde.

Automatisierung kann auch Konsistenz ermöglichen, doch Konsistenz bedeutet nicht automatisch Fairness. Ein Modell kann eine enge Auslegung des Gesetzes in einer gesamten Behörde anwenden. Es kann ebenso uneinheitliche Entscheidungen aus den Unterlagen reproduzieren, die zu seiner Konfiguration oder Schulung verwendet wurden.

FOIA-Entscheidungen hängen oft von der institutionellen Geschichte ab. Wenn frühere Prüfer regelmäßig eine bestimmte Art von Diskussion zurückhielten, kann ein System, das aus ihrer Arbeit lernt, diese Praxis als normale Antwort darstellen. Das Modell weiß nicht, ob frühere Entscheidungen auf sorgfältiger rechtlicher Analyse, überholten Leitlinien oder gewohnheitsmäßiger Überredaktion beruhten.

Dadurch entsteht eine Rückkopplungsschleife. Frühere Zurückhaltungen beeinflussen automatisierte Empfehlungen. Prüfer akzeptieren diese Empfehlungen. Die genehmigte Ausgabe wird anschließend zum Beleg, der künftige automatisierte Entscheidungen stützt.

Die Regierung kann diese Schleife nur durch bewusste Bewertung unterbrechen. Behörden benötigen Testbestände, die sowohl ausgenommene als auch freizugebende Inhalte enthalten. Unabhängige Prüfer sollten falsch positive und falsch negative Ergebnisse sowie die Menge nicht ausgenommener Texte messen, die rund um zulässige Schwärzungen verloren geht.

Auch Daten zu Übersteuerungen sind wichtig. Wenn Beschäftigte Modellvorschläge nahezu nie ablehnen, könnte die Aufsicht nur nominell sein. Wenn Prüfer häufig Schwärzungen hinzufügen oder entfernen, spart das System möglicherweise nicht so viel Arbeit wie versprochen.

DHS hat erklärt, dass Menschen weiterhin beteiligt bleiben werden. Es hat jedoch noch nicht gezeigt, ob diese Beteiligung unabhängig, ausreichend besetzt, dokumentiert und Qualitätskontrollen unterworfen sein wird. Bis diese Details öffentlich werden, bleibt das Effizienzversprechen unvollständig.

KI kann vorhersehbaren Schaden nicht allein anhand von Mustern beurteilen

Ein Modell kann Sprachmuster erkennen, doch FOIA verlangt von Behörden, jede Zurückhaltungsentscheidung mit einem konkreten, vernünftigerweise vorhersehbaren Schaden zu verknüpfen.

Der Kongress verschärfte diese Anforderung mit dem FOIA Improvement Act von 2016. Eine Behörde darf ausgenommene Informationen im Allgemeinen nur zurückhalten, wenn sie vernünftigerweise vorhersehen kann, dass eine Offenlegung ein durch die Ausnahme geschütztes Interesse schädigen würde. Sie darf Informationen auch zurückhalten, wenn ein anderes Gesetz ihre Freigabe untersagt.

Der Maßstab des vorhersehbaren Schadens verhindert, dass Behörden jede technisch verfügbare Ausnahme als automatische Anweisung behandeln. Ein Dokument kann innerhalb der Grenzen einer Ausnahme liegen und dennoch keinen gewichtigen Grund für Geheimhaltung bieten.

Die Leitlinien zur Offenlegung des Justizministeriums weisen Behörden an, den Kontext zu berücksichtigen. Relevante Faktoren können das Alter einer Akte, frühere offizielle Offenlegungen, ihre Sensibilität und ihr Zweck sein. Behörden sollten sachkundige Mitarbeitende hinzuziehen, wenn der mögliche Schaden unklar ist.

Diese Arbeit unterscheidet sich grundlegend von der Entitätserkennung. Ein Modell kann den Namen einer Person finden. Es kann jedoch nicht allein anhand des Namens bestimmen, ob eine Offenlegung die Privatsphäre verletzen, eine vertrauliche Quelle identifizieren, amtliches Handeln offenlegen oder bereits veröffentlichte Informationen wiederholen würde.

Dieselbe Herausforderung gilt für das Beratungsprozessprivileg. Dieser Schutz kann bestimmte vorentscheidende Mitteilungen abdecken, die behördliche Beratungen widerspiegeln. Er erlaubt einer Behörde nicht, jeden Entwurf, jede Empfehlung oder jede interne E-Mail zu verbergen.

Forscher haben maschinelles Lernen für dieses Problem getestet. Jason R. Baron, Mahmoud F. Sayed und Douglas W. Oard stellten Material aus den Präsidentenakten Clintons zusammen und trainierten Klassifikatoren, um potenziell beratende Passagen zu identifizieren.

Ihre Studie zum maschinellen Lernen ergab, dass Systeme am besten abschnitten, wenn Training und Bewertung einheitlichen Auslegungen der Prüfer folgten. Die Leistung nahm ab, wenn sich Prüfer, Aktenverwahrer oder Themengebiet änderten.

In einer späteren öffentlichen Diskussion beschrieb Baron die Methoden als zu rund 70 Prozent treffgenau bei der Unterscheidung von Material, das mit dem Beratungsprozessprivileg verbunden ist. Veröffentliche Ergebnisse unter einheitlichen Bedingungen berichteten F1-Werte zwischen 70 und 83 Prozent. Ein F1-Wert verbindet, wie viele relevante Passagen ein Modell findet, mit der Häufigkeit, mit der seine positiven Klassifizierungen korrekt sind.

Diese Ergebnisse sind für die Triage nützlich. Sie reichen nicht aus, um unbeaufsichtigte rechtliche Entscheidungen zu stützen. Bei einer Leistung von 70 Prozent wird ein folgenreicher Anteil der Passagen falsch klassifiziert.

Die Forschung legt zudem ein tieferes Problem offen. Menschliche Prüfer sind sich nicht immer einig, ob dieselbe Formulierung eine Zurückhaltung rechtfertigt. Ein System, das auf die Auslegung eines Prüfers trainiert wurde, kann Schwierigkeiten haben, wenn ein anderer das Gesetz anders anwendet.

Diese Uneinigkeit ist nicht bloß technisches Rauschen. Sie spiegelt den kontextabhängigen Charakter von FOIA wider. Rechtliche Bewertungen hängen davon ab, wofür die Akte steht, was die Regierung bereits offengelegt hat und welcher konkrete Schaden aus einer Freigabe folgen würde.

DHS benötigt daher mehr als einen Menschen, der am Ende einer automatisierten Pipeline platziert ist. Eine aussagekräftige Prüfung erfordert ausreichend Zeit, Befugnis und Informationen, um die Empfehlung des Modells abzulehnen. Die beschäftigte Person muss zudem prüfen, ob eine engere Schwärzung das legitime Interesse schützen würde.

Behörden sollten für jeden automatisierten Vorschlag einen Prüfpfad bewahren. Dieser Nachweis sollte ausweisen, welche Passagen das System markiert hat, mit welcher Ausnahme es sie verknüpft hat, was die beschäftigte Person geändert hat und warum die endgültige Entscheidung den Maßstab des vorhersehbaren Schadens erfüllte.

Antragsteller benötigen keinen Zugang zu sensiblen Trainingsdaten oder Details zur Systemsicherheit. Sie benötigen verständliche Informationen darüber, wie automatisierte Werkzeuge ihre Unterlagen beeinflusst haben. Ohne diese Transparenz wird ein Widerspruch schwieriger, weil der Antragsteller nicht zwischen dem Urteil eines Juristen und einer modellgestützten Voreinstellung unterscheiden kann.

Eine Black-Box-Empfehlung darf nicht allein deshalb zu einer Black Box auf der Seite werden, weil ein Mensch auf „Genehmigen“ geklickt hat.

Menschliche Prüfung ist nur dann ein Schutzmechanismus, wenn sie Ergebnisse verändert

Die Formulierung „Mensch in der Schleife“ bietet wenig Schutz, sofern Behörden nicht messen, ob Menschen automatisierte Empfehlungen tatsächlich hinterfragen.

DHS erklärt, dass Beschäftigte KI-gestützte Fälle prüfen werden. Auch die bundesweite FOIA-Ombudsstelle warnt, dass KI und maschinelles Lernen das professionelle Urteil über Ausnahmen und vorhersehbaren Schaden nicht ersetzen können.

Das ist die richtige formale Position. Ihre Wirksamkeit wird vom Workflow-Design abhängen.

Wenn ein Prüfer das vollständige Dokument sieht, bevor vorgeschlagene Markierungen erscheinen, kann die Person eine unabhängige Einschätzung bilden. Wenn das System eine Seite präsentiert, die bereits mit vorgeschlagenen Schwärzungen bedeckt ist, setzen diese Markierungen einen Anker. Der Prüfer muss dann das Entfernen eines Schutzes rechtfertigen, anstatt zu entscheiden, ob er einen hinzufügen soll.

Der Unterschied mag prozedural erscheinen, verändert aber die Richtung des Zweifels. Im ersten Workflow kann Ungewissheit für Offenlegung sprechen. Im zweiten begünstigt Ungewissheit das Beibehalten der Black Box des Modells.

Die Personalausstattung schafft eine weitere Einschränkung. Eine Behörde kann Automatisierung gerade deshalb einführen, weil sie nicht genug Personal hat, um ihr Arbeitsaufkommen zu bewältigen. Wenn derselbe Mangel Prüfern nur Minuten lässt, um jedes Ergebnis zu prüfen, wird die formale menschliche Genehmigung zu einem Durchsatzkontrollpunkt.

Leistungsziele können diesen Druck verstärken. Führungskräfte können abgeschlossene Anfragen, bearbeitete Seiten oder den Abbau von Rückständen messen. Diese Zahlen lassen sich leicht zählen. Die Menge nicht ausgenommener Informationen, die durch sorgfältige Prüfung bewahrt wird, ist schwerer zu erfassen.

Ein wirksames Aufsichtsprogramm würde mehrere Kennzahlen verwenden. Behörden sollten maschinengestützte Entscheidungen mit unabhängigen Prüfungsstichproben vergleichen. Sie sollten erfassen, wie oft Beschäftigte vorgeschlagene Schwärzungen entfernen, einschränken oder Schutzmaßnahmen ergänzen, die das System übersehen hat.

Sie sollten Ergebnisse außerdem über verschiedene Dokumenttypen hinweg testen. Ein Werkzeug, das Passnummern in standardisierten Formularen zuverlässig erkennt, kann bei Policy-E-Mails, handschriftlichen Notizen, Tabellenkalkulationen, aufgezeichneten Interviews oder historischen Dokumenten schlecht abschneiden.

Die Tests müssen die Folgen beider Fehlertypen umfassen. Falsch negative Ergebnisse können geschützte Informationen offenlegen. Falsch positive Ergebnisse können den öffentlichen Zugang verweigern. Datenschutz- und Sicherheitsfehler als die einzigen bedeutsamen Fehlschläge zu behandeln, würde Überredaktion in den Bewertungsprozess einbauen.

Behörden sollten aggregierte Ergebnisse veröffentlichen. Nützliche Offenlegungen würden die Zahl der mit KI bearbeiteten Anfragen, die beteiligten Ausnahmen, Fehlerquoten aus Stichproben, Übersteuerungsquoten der Prüfer und Veränderungen der Bearbeitungszeit umfassen.

Öffentliche Berichterstattung würde nicht die sensiblen Inhalte einzelner Anfragen offenlegen. Sie würde zeigen, ob das Werkzeug als Assistent oder als nicht ausgewiesener Entscheidungsträger agiert.

Widersprüche bieten eine weitere Evidenzquelle. Wenn KI-gestützte Fälle zu mehr erfolgreichen Verwaltungswidersprüchen führen, würde dieser Trend darauf hindeuten, dass das System oder sein Prüfprozess zu weitgehend zurückhält. Behörden sollten diese Ergebnisse mit konventionell geprüften Fällen vergleichen.

Gerichte werden letztlich eine Rolle spielen. FOIA-Verfahren verlangen oft, dass Behörden die Grundlage für Schwärzungen durch Erklärungen oder einen Vaughn-Index erläutern, ein Dokument, das zurückgehaltenes Material mit geltend gemachten Ausnahmen verknüpft. Automatisierte Werkzeuge verringern diese rechtliche Last nicht.

Wenn eine Behörde nicht erklären kann, warum eine Offenlegung Schaden verursachen würde, ohne sich allgemein auf ein Modell zu beziehen, sollte ihre Begründung scheitern. Die Regierung bleibt für die endgültige Entscheidung verantwortlich, unabhängig davon, welcher Anbieter die Software geliefert hat.

Die Aufsicht über Anbieter ist daher Teil öffentlicher Rechenschaftspflicht. Verträge sollten staatliche Tests erlauben, Protokolle bewahren, Modelländerungen dokumentieren und verhindern, dass sensible Unterlagen für nicht zusammenhängendes Training wiederverwendet werden. Behörden müssen außerdem verstehen, ob Aktualisierungen das Verhalten verändern, nachdem ein System in Produktion gegangen ist.

Die stärkste Form staatlicher KI-Schwärzung würde Beschäftigten helfen, mögliche sensible Inhalte zu finden, während ihr unabhängiges rechtliches Urteil erhalten bleibt. Die schwächste Form würde Überredaktion in einen wiederholbaren Workflow mit einer menschlichen Unterschrift am Ende verwandeln.

DHS hat die erste Version beschrieben. Die Belege, die sie von der zweiten unterscheiden würden, wurden bislang nicht öffentlich gemacht.

Drei Signale werden zeigen, ob das System der Offenheit dient

Der nächste Test besteht nicht darin, ob DHS KI einsetzt, sondern ob das Ministerium nachweist, dass die Technologie mehr rechtmäßig freizugebende Informationen veröffentlicht, ohne geschütztes Material offenzulegen.

Das erste Signal ist operative Transparenz. DHS sollte eine klare Beschreibung veröffentlichen, welche Antragskategorien automatisierte Empfehlungen verwenden, welche Modelle die Arbeit ausführen und welche Ausnahmen sie unterstützen.

Diese Beschreibung sollte grundlegende Mustererkennung von kontextbezogener rechtlicher Klassifizierung trennen. Das Auffinden einer Identifikationsnummer birgt ein anderes Risiko als die Bewertung interner Policy-Diskussionen. Beides unter einem einzigen „KI“-Label zusammenzufassen, würde eine aussagekräftige Kontrolle verhindern.

Das Ministerium sollte außerdem aggregierte Leistungskennzahlen offenlegen. Falsch-Positiv-Raten werden zeigen, wie oft das System empfiehlt, freizugebendes Material zu verbergen. Falsch-Negativ-Raten werden anzeigen, wie oft es geschützte Informationen übersieht.

Übersteuerungsquoten der Prüfer werden offenlegen, ob Menschen unabhängiges Urteil ausüben. Eine nahezu null liegende Quote könnte bedeuten, dass das Werkzeug außergewöhnlich genau ist. Wahrscheinlicher würde sie Fragen nach Automatisierungsbias, begrenzter Prüfzeit oder Anreizen aufwerfen, die Beschäftigte davon abhalten, Vorschläge zu ändern.

Das zweite Signal ist die Qualität der freigegebenen Unterlagen. Die Bearbeitungszeit sollte sinken, aber die Offenlegung darf nicht schrumpfen. Forscher können den Anteil vollständiger Freigaben, teilweiser Freigaben und vollständiger Ablehnungen vor und nach der Einführung vergleichen.

Diese Kategorien sind unvollkommen. Ein gelöschtes Wort und zehn Seiten voller Black Boxes können beide als teilweise Freigabe gelten. DHS sollte daher den Anteil freigegebenen relevanten Textes in repräsentativen Dokumentstichproben untersuchen.

Verwaltungswidersprüche werden eine weitere Kennzahl liefern. Ein Anstieg erfolgreicher Anfechtungen von maschinengestützten Schwärzungen würde die Argumentation des Ministeriums schwächen. Stabile oder verbesserte Offenlegungsergebnisse, verbunden mit kürzeren Verzögerungen, würden sein Effizienzargument stützen.

Das dritte Signal ist durchsetzbare Rechenschaftspflicht. Antragsteller müssen wissen, wann Automatisierung eine Antwort wesentlich beeinflusst hat. Mitarbeitende in Berufungsstellen der Behörden und Gerichte benötigen Aufzeichnungen darüber, wie jede Empfehlung in die endgültige Entscheidung eingeflossen ist.

Der Kongress, Generalinspektoren und das Nationalarchiv sollten prüfen, ob das DHS den Standard des vorhersehbaren Schadens unabhängig anwendet, nachdem das Modell eine Passage markiert hat. Sie sollten zudem Kontrollen der Anbieter, Datensicherheit, Modellaktualisierungen und Schutzmaßnahmen gegen Rückkopplungsschleifen bewerten.

Keine dieser Schutzmaßnahmen erfordert eine Ablehnung der Automatisierung. FOIA-Stellen brauchen bessere Werkzeuge für Suche, Deduplizierung, Dokumentenkonvertierung und Prüfung. Der öffentliche Zugang verbessert sich nicht, wenn relevante Unterlagen jahrelang unberührt in einem Rückstau liegen.

Schnellere Schwärzung ist jedoch nicht dasselbe wie schnellere Offenlegung. Erstere entfernt Informationen. Letztere verschafft der Öffentlichkeit rechtzeitig Zugang zu allem, was das Gesetz erlaubt.

Diese Unterscheidung sollte jede Bewertung der KI-gestützten FOIA-Schwärzungen des DHS leiten. Das Ministerium kann seinen Ansatz durch die Veröffentlichung von Prüfmethoden, Fehlermessungen, Daten zu manuellen Übersteuerungen sowie Offenlegungsergebnissen vor und nach der Einführung validieren.

Journalisten, Forschende, Anwälte und andere Antragsteller sollten diese Indikatoren beobachten, statt niedrigere Bearbeitungszeiten als Erfolgsnachweis zu akzeptieren. Sie sollten außerdem Verwaltungsbeschwerden einlegen, wenn eine Behörde nur allgemeine Begründungen liefert oder offenbar mehr zurückhält als nötig.

KI kann helfen, die Grenze zwischen öffentlichen und geschützten Informationen zu finden. Sie sollte diese Grenze nicht stillschweigend in Richtung Geheimhaltung verschieben. Die entscheidende Frage ist einfach: Werden Amerikaner nach der Beschleunigung des Verfahrens durch das DHS mehr nutzbare Informationen erhalten – oder lediglich ihre geschwärzten Seiten früher?

 
 

Kostenlos loslegen

Ein Local-First-KI-Assistent mit persönlichem Wissensmanagement

Für ein besseres KI-Erlebnis

unterstützt remio derzeit nur Windows 10+ (x64) und M-Chip Macs.

Ihr KI-Partner bei der Arbeit
Mehr schaffen mit remio

Planen. Erstellen. Liefern.
Alles an einem Ort.

bottom of page