OpenAI-Pentagon-Vertragsunterlagen enthüllen umstrittene Forderung nach KI, die selten Nein sagt
OpenAI steht unter neuer Beobachtung, nachdem Pentagon-Unterlagen militärische Modelle mit „minimalen Ablehnungsraten“ beschrieben, obwohl beide Seiten bestreiten, dass diese Anforderung in ihre unterzeichnete Vereinbarung aufgenommen wurde. Die umstrittene Formulierung erscheint in Version P00003 eines OpenAI-Pentagon-Vertrags, der durch eine Klage nach dem Freedom of Information Act erlangt wurde. Sie beschreibt spezialisierte Systeme, die Anfragen zur nationalen Sicherheit möglichst selten ablehnen sollen.
Diese Formulierung beweist nicht, dass das Pentagon ein uneingeschränktes Modell erhielt. OpenAI erklärt, die Bestimmung abgelehnt zu haben, während das Verteidigungsministerium sagt, kein aktiver Vertrag enthalte sie. Dennoch veröffentlichte die Regierung P00003 als Antwort auf eine Anfrage, die Entwürfe ausdrücklich ausschloss, wie aus der Vertragsrecherche hervorgeht.
Die Unterlagen schufen zudem ein ungewöhnliches Überprüfungsproblem. Ein Pentagon-Jurist bestätigte zunächst, dass die veröffentlichte Unterlage den endgültigen Vertrag darstelle, zog diese Bestätigung jedoch zurück, nachdem Reporter OpenAI kontaktiert hatten. Unterdessen deuten separate Dokumente darauf hin, dass beide Parteien am 6. Februar eine erweiterte P00003-Vereinbarung unterzeichneten, bevor eine weitere Vereinbarung am 27. Februar den Einsatz in klassifizierten Netzwerken genehmigte.
Die Kontroverse geht daher über einen einzelnen umstrittenen Satz hinaus. Sie stellt auf die Probe, ob vertragliche Zusagen, Beschränkungen auf Modellebene und öffentliche Zusicherungen überprüft werden können, wenn fortschrittliche KI in geheime Militärsysteme einzieht.
Anthropic liefert den unmittelbaren Vergleich. Der Streit des Unternehmens mit dem Pentagon drehte sich um Einschränkungen bei massenhafter inländischer Überwachung und autonomen Waffen. OpenAI kündigte später den Einsatz in klassifizierten Umgebungen an und erklärte zugleich, die eigene Vereinbarung bewahre Schutzmaßnahmen in diesen Bereichen.
Der zentrale Konflikt ist klar: Die Regierung will Modelle, die bei rechtmäßigen militärischen Missionen durchgehend nutzbar bleiben, während KI-Anbieter sagen, manche Einsätze erforderten weiterhin feste Grenzen. Ein Modell, das darauf optimiert ist, seltener abzulehnen, kann Analysten bei legitimer Arbeit helfen. Dasselbe Designziel kann jedoch auch eine wichtige Schutzschicht schwächen, wenn Eingaben Überwachung, Zielauswahl oder tödliche Gewalt betreffen.
Der OpenAI-Pentagon-Vertrag hat zwei widersprüchliche Vorgeschichten
Die veröffentlichten Unterlagen und die offiziellen Erklärungen ergeben bislang kein einheitliches Bild davon, was die Parteien unterzeichnet haben.
Die Kontroverse beginnt mit einer 2025 an OpenAI Public Sector vergebenen Prototyp-Vereinbarung. Eine bundesweite Vertragsmitteilung beschreibt eine Prototyp-Vereinbarung mit Festbetrag im Wert von bis zu 200 Millionen US-Dollar. Ihr erklärter Zweck war die Entwicklung von Frontier-KI-Fähigkeiten zur Bewältigung kritischer Herausforderungen der nationalen Sicherheit.
OpenAI war nicht allein. Das Pentagon baute auch Beziehungen zu Anthropic, Google und xAI für militärische KI-Prototypen auf. Zu den berichteten Einsatzfällen gehörten Logistik, nachrichtendienstliche Entscheidungsunterstützung und umfassendere Kriegführungsaktivitäten.
P00003 erweiterte die frühere OpenAI-Vereinbarung. Die über das FOIA-Verfahren veröffentlichte Version definierte „OpenAI Mission Models“ als Systeme, die für Anwendungen der nationalen Sicherheit konzipiert sind. Sie erklärte, diese Modelle hätten „minimale Ablehnungsraten“ und böten operative Fähigkeiten, die auf militärische Nutzer zugeschnitten seien.
Eine Ablehnung liegt vor, wenn ein Modell eine Anfrage nicht ausführt, weil Richtlinien, Sicherheits- oder technische Kontrollen die Aufgabe als unzulässig identifizieren. Ablehnungsraten können auch steigen, wenn Schutzmaßnahmen legitime Arbeit fälschlicherweise blockieren. Die Verringerung unnötiger Ablehnungen ist daher in vielen Kontexten ein nachvollziehbares Produktziel.
Der militärische Kontext verändert die Tragweite. Eine Ablehnung bei harmloser Dokumentformatierung ist unpraktisch. Eine Ablehnung bei Zielauswahl, Bevölkerungsüberwachung oder Waffenbetrieb kann eine bewusst gesetzte Sicherheitsgrenze sein.
OpenAI-Sprecher Nate Evans sagte gegenüber The Intercept, das Unternehmen habe Formulierungen, die minimale Ablehnungsraten verlangten, niemals akzeptiert. Er bezeichnete den veröffentlichten Text als früheren Regierungsvorschlag, den OpenAI abgelehnt habe. Evans erklärte, die endgültig unterzeichnete Vereinbarung habe die Anforderung nicht enthalten.
Pentagon-Sprecher Jacob Bliss sagte ebenfalls, die Formulierung erscheine in keiner aktuellen Vereinbarung zwischen dem Ministerium und OpenAI. Diese Dementis stellen den Status des Dokuments P00003 unmittelbar infrage, erklären jedoch nicht, warum es in einer Herausgabe finaler Unterlagen enthalten war.
The Intercept und Legal Advocates for Safe Science and Technology hatten unterzeichnete Verträge, Änderungen und zugehörige endgültige Dokumente angefordert. Berichten zufolge wies die Anfrage das Ministerium an, keine Entwürfe einzubeziehen. Diese Unterscheidung ist wichtig, denn FOIA-Veröffentlichungen können vorläufiges Material enthalten, doch die Antragsteller hatten gerade versucht, diese Unklarheit zu verhindern.
Ein Pentagon-Anwalt teilte der Publikation zunächst mit, P00003 sei der endgültige Vertrag. Nachdem OpenAI Fragen zu der Formulierung erhalten hatte, revidierte der Anwalt diese Antwort und bat die Reporter, sie zu ignorieren. Das Ministerium erklärte anschließend, es benötige mehr Zeit, um festzustellen, was veröffentlicht worden war.
Diese Abfolge lässt mehrere Möglichkeiten offen. Die Regierung könnte versehentlich einen Entwurf herausgegeben haben. Das Dokument könnte akzeptierte Bedingungen mit Formulierungen verbinden, die später durch ein anderes Instrument entfernt wurden. Es könnte auch eine unterzeichnete Änderung darstellen, die vor dem Einsatz durch eine spätere Vereinbarung ersetzt wurde.
Keine dieser Möglichkeiten lässt sich ohne die Unterschriftsseiten, die Überarbeitungshistorie oder den maßgeblichen Ersatztext mit Sicherheit auswählen. Die entscheidende Tatsache ist nicht, dass OpenAI zweifelsfrei ein Modell mit niedriger Ablehnungsrate bereitstellte. Entscheidend ist, dass die öffentliche Aktenlage bislang nicht feststellen kann, welche Version die Arbeit regelte.
Warum „minimale Ablehnungsraten“ die Sicherheitsfrage verändern
Ein Ziel niedriger Ablehnungsraten misst Verfügbarkeit, sagt jedoch nicht aus, ob das Modell in Hochrisikosituationen weiterhin begrenzt bleibt.
KI-Produkte für Verbraucher lehnen häufig Eingaben zu Malware, Missbrauch personenbezogener Daten, Waffenbau oder gezielter Gewalt ab. Diese Kontrollen sind unvollkommen. Sie weisen mitunter harmlose Forschung, Fiktion, Cybersicherheitstests oder Anfragen ohne gefährliche Absicht zurück.
Staatliche Nutzer haben legitime Gründe, ein anderes Verhalten zu verlangen. Ein Geheimdienstanalyst muss möglicherweise extremistische Propaganda zusammenfassen, ohne sie zu unterstützen. Ein Cybersicherheitsteam könnte ein Modell bitten, bösartigen Code zu erklären, damit Verteidiger ihn identifizieren können. Militärplaner benötigen möglicherweise Analysen zu Waffen, Gegnern und Gefechtsbedingungen.
Eine Standardrichtlinie für Verbraucher könnte solche Aufgaben allein deshalb blockieren, weil sie gefährliches Vokabular erkennt. Spezialisierte Modelle können solche Fehlalarme verringern, indem sie die Berechtigung des Nutzers, die Einsatzumgebung und die beabsichtigte Mission berücksichtigen.
Die umstrittene Klausel geht über die Beschreibung missionsspezifischen Zugangs hinaus. „Minimale Ablehnungsraten“ definiert erfolgreiche Leistung danach, wie selten das System Nein sagt. Ohne begleitende Metriken, Ausnahmen oder Bewertungsregeln verrät die Formulierung wenig darüber, welche Ablehnungen bestehen bleiben sollten.
Ein Modell kann Ablehnungen verringern, indem es legitime von unzulässigen Anfragen besser unterscheidet. Ein anderes kann dasselbe numerische Ergebnis erzielen, indem es Schutzmaßnahmen entfernt. Das sind grundlegend unterschiedliche Systeme, selbst wenn ihre aggregierten Ablehnungsraten identisch erscheinen.
Heidy Khlaaf, leitende Wissenschaftlerin des AI Now Institute und ehemalige Ingenieurin für Systemsicherheit bei OpenAI, sagte The Intercept, die Formulierung beziehe sich wahrscheinlich auf wenige oder keine Modellschutzmaßnahmen. Sie stellte zudem die Prämisse infrage, nationale sicherheitsspezifische Leitplanken ohne transparente Grenzen zu schaffen.
Diese Interpretation bleibt eine Experteneinschätzung und kein Beweis für die eingesetzte Konfiguration. Die Vertragsformulierung offenbart weder Trainingsdaten, Systemanweisungen, Zugriffskontrollen, Bewertungsergebnisse noch die Bedingungen, die eine menschliche Überprüfung auslösen.
Diese fehlenden Details sind entscheidend. Ein Militärmodell könnte umfassend antworten und dennoch nicht in der Lage sein, Handlungen einzuleiten. Es könnte in einer kontrollierten Cloud-Umgebung mit authentifizierten Nutzern, protokollierten Eingaben und separaten Autorisierungssystemen arbeiten. Alternativ könnte seine Ausgabe in operative Arbeitsabläufe fließen, in denen Geschwindigkeit die Möglichkeiten zur Kontrolle verringert.
Auch die Unterscheidung zwischen Beratung und Handlung kann verschwimmen. Ein Modell muss keinen Abzug betätigen, um ein tödliches Ergebnis zu beeinflussen. Es könnte potenzielle Ziele priorisieren, Geheimdienstberichte zusammenführen, Überwachungsprioritäten empfehlen oder Beweise für einen Kommandeur zusammenfassen.
Jeder Schritt kann die endgültige Entscheidung beeinflussen. Eine menschliche Unterschrift am Ende gewährleistet nicht automatisch sinnvolle Aufsicht, wenn die Person weder Zeit noch Informationen oder Befugnisse hat, das System infrage zu stellen.
Das Ablehnungsverhalten ist nur eine Kontrolle innerhalb dieser Kette. Beschaffungsbeschränkungen definieren zulässige Zwecke. Modellrichtlinien bestimmen, welche Anfragen Antworten erhalten. Die technische Architektur steuert Datenzugriff und externe Handlungen. Militärdoktrin weist Verantwortung zu, wenn Menschen auf Grundlage der Ausgabe handeln.
Eine glaubwürdige Sicherheitsbehauptung muss erklären, wie diese Ebenen einander verstärken. Sie sollte außerdem benennen, was geschieht, wenn eine Ebene versagt.
OpenAI erklärt, sein Einsatz enthalte technische Schutzvorkehrungen und verlange menschliche Verantwortung für Entscheidungen über tödliche Gewalt. Die öffentliche Beschreibung untersagt zudem massenhafte inländische Überwachung. Dies sind wesentliche Zusagen, doch die nicht veröffentlichte Vereinbarung begrenzt die unabhängige Bewertung ihrer praktischen Funktionsweise.
Die umstrittene Formulierung bleibt daher selbst dann bedeutsam, wenn OpenAI sie erfolgreich entfernen ließ. Sie zeigt, was zumindest ein Regierungsentwurf während der Verhandlungen priorisierte. Die Klausel stellte die Verfügbarkeit von Antworten in den Mittelpunkt, während die Grenzen akzeptabler Ablehnung in der veröffentlichten Sprache unbestimmt blieben.
Die öffentlichen Schutzvorkehrungen von OpenAI treffen auf den breiten Missionsstandard des Pentagons
Die zentrale Spannung besteht zwischen den von OpenAI zugesagten roten Linien und einem militärischen Beschaffungsmodell, das auf alle rechtmäßigen Verwendungszwecke ausgerichtet ist.
Am 27. Februar erzielte OpenAI eine Vereinbarung, die seinen Modellen den Betrieb in klassifizierten militärischen Umgebungen erlaubte. Der Zeitpunkt folgte auf das Scheitern der Verhandlungen zwischen Anthropic und dem Pentagon über akzeptable Einschränkungen.
OpenAI veröffentlichte seine Darstellung am folgenden Tag. In seiner Erklärung zur Vereinbarung erklärte das Unternehmen, das Militär benötige fortschrittliche KI, da potenzielle Gegner ähnliche Technologien in ihre Systeme integrierten.
OpenAI stellte zudem mehrere Schutzmaßnahmen vor. Das Unternehmen erklärte, seine Technologie dürfe keine massenhafte inländische Überwachung unterstützen. Es verlangte menschliche Verantwortung für Entscheidungen über tödliche Gewalt, einschließlich autonomer Waffen. Ferner erklärte das Unternehmen, OpenAI-Mitarbeiter würden an der Einführung mitwirken und überwachen, wie die Systeme betrieben würden.
Diese Zusagen klingen ähnlich wie die von Anthropic angesprochenen Bedenken. Anthropic widersetzte sich Forderungen, Claude ohne die gewünschten vertraglichen Einschränkungen für alle rechtmäßigen militärischen Zwecke bereitzustellen. Das Pentagon stufte das Unternehmen anschließend als Risiko für die Lieferkette ein, während die Regierung Bundesbehörden anwies, die Nutzung seiner Produkte zu beenden.
Die Formulierung „alle rechtmäßigen Zwecke“ erscheint umfassend, doch Rechtmäßigkeit ist keine vollständige Sicherheitsspezifikation. Gesetze können sich ändern, zwischen Rechtsordnungen unterscheiden oder operative Fragen offenlassen. Regierungsjuristen und Technologieanbieter können dieselbe Befugnis auch unterschiedlich auslegen.
OpenAI erklärt, dass seine Bedingungen Schutzmaßnahmen über bestehende Gesetze hinaus enthalten. Kritiker haben hinterfragt, ob diese Bedingungen durchsetzbare Verbote schaffen oder primär die aktuelle Regierungspolitik wiederholen. Der vollständige maßgebliche Vertrag würde helfen, diese Frage zu klären, doch er war bislang nicht in einer unabhängig überprüfbaren Form öffentlich verfügbar.
Die Formulierung zu minimalen Ablehnungen verschärft diese Unsicherheit. Falls die endgültige Vereinbarung sie entfernt hat, hat OpenAI mindestens eine weitreichende Regierungsforderung erfolgreich abgewehrt. Falls ähnliche Anforderungen in anderer Formulierung bestehen blieben, könnten öffentliche Beschreibungen den operativen Standard nicht erfassen.
Die Position der Regierung schafft eine weitere Spannung. Vertreter wollen, dass kommerzielle KI-Systeme Aufgaben unterstützen, die Verbraucherprodukte nicht abdecken können. Zugleich wehren sie sich dagegen, dass private Anbieter eine unbegrenzte Kontrolle über Militärpolitik ausüben.
Diese Sorge ist nicht unbegründet. Ein nicht gewähltes Unternehmen sollte nicht allein durch die Änderung der Nutzungsregeln eines Modells die nationale Sicherheitspolitik bestimmen. Militärische Befugnisse gehören in eine rechtliche und demokratische Befehlskette.
Anbieter kontrollieren jedoch weiterhin Systeme mit bekannten Einschränkungen. Modelle können falsche Informationen erzeugen, gegnerischen Anweisungen folgen, sensible Daten preisgeben oder überzeugende Antworten liefern, die nicht durch Belege gestützt sind. Eine Beschaffungsklausel kann diese technischen Risiken nicht beseitigen.
Die Lösung erfordert mehr als die Entscheidung, ob OpenAI oder das Pentagon das letzte Wort hat. Verträge benötigen präzise verbotene Nutzungen, messbare Schutzmaßnahmen, Protokollierungspflichten, Eskalationsverfahren und Folgen bei Verstößen.
Unabhängige Aufsicht ist wichtig, weil beide Parteien Anreize haben, ihre Vereinbarkeit zu betonen. Das Pentagon will leistungsfähige Systeme mit weniger operativen Hürden. OpenAI möchte Zugang zu einem einflussreichen Kunden, während es seine öffentlich vertretene Sicherheitsposition aufrechterhält.
Der Streit mit Anthropic zeigt, was geschieht, wenn diese Anreize auseinanderlaufen. Anthropics Weigerung, die von der Regierung bevorzugten Bedingungen zu akzeptieren, führte zu politischer Vergeltung und operativem Ausschluss. Dieses Ergebnis setzt jeden konkurrierenden Anbieter unter Druck, entgegenkommender zu wirken.
OpenAI trat während dieses Konflikts in die klassifizierte Umgebung ein. Das Unternehmen erklärt, es habe stärkere statt schwächere Schutzmaßnahmen beibehalten. Der umstrittene Datensatz P00003 macht dokumentarische Belege nun entscheidend für die Bewertung dieser Behauptung.
Klassifizierter Einsatz birgt Risiken über Modellablehnungen hinaus
Selbst ein sorgfältig begrenztes Modell kann erhebliche Risiken schaffen, wenn Geheimhaltung externe Tests, die Meldung von Vorfällen und öffentliche Rechenschaftspflicht einschränkt.
Klassifizierte Netzwerke verhindern, dass sensible Geheimdienstinformationen unbefugte Nutzer erreichen. Sie hindern jedoch auch Forschende, Journalisten und die breitere Öffentlichkeit daran, das Verhalten eines eingesetzten Modells zu untersuchen.
Diese Geheimhaltung ist für viele militärische Operationen notwendig. Sie schafft dennoch eine Überprüfungslücke. Externe Beobachter können keine Tests durchführen, Ablehnungsverhalten vergleichen, Protokolle prüfen oder feststellen, ob Schutzmaßnahmen nach dem Einsatz verändert wurden.
Die Regierung kann interne Bewertungen durchführen, doch diese Prüfungen müssen mehr beantworten als die Frage, ob das Modell Aufgaben erfüllt. Sie sollten Halluzinationen, Automatisierungsbias, Datenabfluss, Prompt Injection und die Leistung unter gegnerischen Bedingungen messen.
Halluzinationen entstehen, wenn ein Modell unbelegte oder falsche Inhalte in selbstsicherer Form erzeugt. In einem gewöhnlichen Büroablauf könnte ein Nutzer ein erfundenes Zitat erkennen. In einer sich schnell entwickelnden Operation kann eine plausible, aber falsche Zusammenfassung eine folgenreiche Entscheidung prägen.
Automatisierungsbias schafft ein separates Problem. Menschen setzen häufig übermäßiges Vertrauen in maschinell erzeugte Empfehlungen, insbesondere wenn das System mehr Informationen verarbeitet, als sie überprüfen können. Ein Modell mit niedriger Ablehnungsrate kann diese Tendenz verschärfen, indem es selbst bei unvollständiger Beweislage eine Antwort liefert.
Das Modell könnte auch auf klassifiziertes Material treffen, das bösartige Anweisungen enthält. Prompt Injection ist ein Angriff, bei dem Befehle in Daten verborgen werden, die das System analysieren soll. Ein kompromittiertes Dokument könnte dem Modell sagen, Informationen offenzulegen, Richtlinien zu ignorieren oder seine Schlussfolgerungen zu manipulieren.
Diese Fehlermodi erfordern keine böswillige Absicht der Regierung. Sie ergeben sich aus den Einschränkungen der Technologie und der Komplexität militärischer Informationssysteme.
OpenAI erklärt, dass sein Einsatz eine cloudbasierte Umgebung nutzt, statt Modelle direkt auf Waffenplattformen zu platzieren. Diese Trennung kann unmittelbare Aktionsrisiken verringern. Sie beseitigt jedoch nicht den Einfluss des Modells auf Geheimdienstanalyse, Planung, Logistik oder Unterstützung bei der Zielauswahl.
Das Pentagon hat KI als Mittel beschrieben, um Entscheidungen in komplexen operativen Umgebungen zu unterstützen. Bis Mai hatte das Ministerium Vereinbarungen für klassifizierte Netzwerke mit Google, Microsoft, Amazon Web Services, Nvidia, OpenAI, Reflection und SpaceX angekündigt. Die Ausweitung klassifizierter KI zeigt, dass die politische Frage weit über einen einzelnen Anbieter hinausgeht.
Mehrere Anbieter können die Abhängigkeit von einem einzigen Unternehmen verringern. Sie können jedoch auch uneinheitliche Schutzmaßnahmen, überlappende Verantwortlichkeiten und Druck schaffen, mit dem am wenigsten restriktiven Wettbewerber gleichzuziehen.
Ein Modell, das häufiger ablehnt, könnte bei Bewertungen verlieren, die auf Aufgabenerfüllung ausgerichtet sind. Ein Modell, das freier antwortet, könnte operativ überlegen erscheinen, bis ein schwerwiegender Fehler eintritt. Beschaffungskennzahlen können daher Sicherheitsverhalten prägen, auch ohne eine ausdrückliche Forderung, Schutzvorkehrungen zu entfernen.
Die öffentliche Debatte sollte Ablehnungen nicht als grundsätzlich gut behandeln. Übermäßige Ablehnungen können ein System unzuverlässig machen und Nutzer dazu bewegen, weniger kontrollierte Alternativen zu suchen. Die entscheidende Frage lautet, ob Ablehnungen an der richtigen Grenze erfolgen.
Die Beantwortung dieser Frage erfordert szenariobasierte Tests. Bewerter sollten untersuchen, ob Modelle rechtswidrige Überwachung, unbelegte Zielidentifikation, autonome tödliche Handlungen und Versuche zur Umgehung von Genehmigungen ablehnen. Sie sollten zudem prüfen, dass Modelle legitime nachrichtendienstliche und defensive Aufgaben erfüllen können.
Ergebnisse können, wo nötig, klassifiziert bleiben, doch Aufsichtsorgane benötigen Zugang dazu. Generalinspektoren, Kongressausschüsse und angemessen sicherheitsüberprüfte unabhängige Experten können Kontrollen bewerten, ohne operative Geheimnisse zu veröffentlichen.
Die Kontroverse um den OpenAI-Pentagon-Vertrag zeigt, was geschieht, wenn weder der Vertrag noch der Bewertungsrahmen geprüft werden können. Die Öffentlichkeit erhält Zusicherungen vom Anbieter und vom Kunden, doch ihr fehlen die Belege, um diese zu überprüfen.
Die Dokumentationslücke ist nun das zentrale Risiko
Die stärkste Schlussfolgerung lautet nicht, dass OpenAI seine Schutzmaßnahmen entfernt hat, sondern dass die Aktenführung der Regierung eine Prüfung einer folgenreichen Vereinbarung unmöglich gemacht hat.
Die veröffentlichten Dokumente enthalten eine Klausel, die beide Parteien nach eigener Aussage abgelehnt haben. Die FOIA-Anfrage verlangte endgültige Unterlagen und schloss Entwürfe aus. Ein Regierungsanwalt behandelte P00003 zunächst als endgültig und zog diese Schlussfolgerung später zurück.
Jede Tatsache kann eine harmlose administrative Erklärung haben. Zusammengenommen untergraben sie jedoch das Vertrauen in die offizielle Vertragshistorie.
Versionskontrolle sollte bei einer Beschaffung klassifizierter Frontier-KI selbstverständlich sein. Prüfer müssen wissen, wer eine Bedingung vorgeschlagen hat, wann sie geändert wurde, wer die Überarbeitung genehmigte und welches Dokument für den Einsatz maßgeblich ist.
Die Zeitleiste im Februar erhöht die Komplexität. Ein separates Dokument weist Berichten zufolge darauf hin, dass OpenAI am 6. Februar eine erweiterte Version von P00003 akzeptierte. Am 27. Februar schlossen die Parteien die Vereinbarung für das klassifizierte Netzwerk ab.
Die Beziehung zwischen diesen Vereinbarungen bleibt unklar. Das Dokument vom 27. Februar könnte die frühere Änderung ersetzen. Es könnte sie ergänzen. Es könnte auch einen eigenständigen Einsatz regeln und gleichzeitig Teile der Prototypvereinbarung in Kraft lassen.
OpenAIs Dementi ist spezifisch: Das Unternehmen erklärt, der unterzeichnete Vertrag verlange keine minimalen Ablehnungsraten. Diese Aussage verdient es, klar festgehalten zu werden. Sie sollte nicht zu einem Beweis dafür ausgeweitet werden, dass das veröffentlichte Dokument nie unterzeichnet wurde oder dass es an anderer Stelle keine vergleichbare Leistungsanforderung gibt.
Das Dementi des Pentagons ist ähnlich begrenzt. Die Aussage, die Formulierung erscheine in keinem aktuellen Vertrag, belegt nicht, ob sie einst in einer ausgeführten Änderung enthalten war. Eine Bedingung kann nach einer Änderung oder Ersetzung aus einer aktiven Vereinbarung verschwinden.
Die Regierung kann einen Großteil des Streits aufklären, ohne klassifizierte Operationen offenzulegen. Sie könnte die relevanten Unterschriftsseiten, die Chronologie der Änderungen, Ersetzungsklauseln und nicht klassifizierte Teile der maßgeblichen Anforderungen veröffentlichen.
OpenAI könnte zudem den genauen Vertragstext veröffentlichen, der seine öffentlichen Schutzmaßnahmen stützt, vorbehaltlich notwendiger Schwärzungen. Das Unternehmen hat seine Auslegung der Vereinbarung bereits offengelegt; eine Bestätigung der maßgeblichen Klauseln würde dieser Darstellung Substanz verleihen.
Kritiker müssen ebenfalls Übertreibungen vermeiden. „Minimale Ablehnungsraten“ belegt nicht, dass ein Modell Waffen kontrolliert, Überwachung durchführt oder jede Einschränkung ignoriert. Das Dokument beschreibt eine gewünschte Eigenschaft, nicht Belege für einen konkreten verbotenen Einsatz.
Die Formulierung offenbart auch nicht die tatsächliche Ablehnungsrate. In der verfügbaren Berichterstattung erscheint kein verifizierter Prozentsatz, Benchmark oder Vergleich mit dem Consumer-ChatGPT. Behauptungen, das Militär habe ein vollständig uneingeschränktes Modell erhalten, gehen daher über die Belege hinaus.
Die Unsicherheit selbst hat Folgen. Entwickler, die an Sicherheitssystemen arbeiten, benötigen Vertrauen darauf, dass Einsatzverpflichtungen dem Beschaffungsdruck standhalten. Unternehmenskunden benötigen genaue Dokumentation, wenn unterschiedliche Modellkonfigurationen unter verschiedenen Richtlinien betrieben werden.
Wissensarbeiter müssen außerdem verstehen, dass ein vertrauter Modellname kein vertrautes Verhalten garantiert. Eine militärische Konfiguration, ein Unternehmenseinsatz und ein öffentlicher Chatbot können unterschiedliche Anweisungen, Tools, Berechtigungen und Ablehnungsschwellen verwenden.
Die Pflege einer durchsuchbaren Aufzeichnung von Richtlinien, Bewertungen und Überarbeitungen ist zentral für verantwortungsvolle KI-Governance. Eine gut verwaltete Wissensdatenbank kann öffentliche Aufsicht nicht ersetzen, doch dasselbe Prinzip gilt: Folgenschwere Entscheidungen erfordern nachvollziehbare Quellen und Versionshistorien.
Der Streit sollte daher als Dokumentationsversagen behandelt werden, bis stärkere Belege mehr feststellen. Diese Einordnung bleibt hinsichtlich der zugrunde liegenden Behauptung vorsichtig und erkennt zugleich an, dass Vertragsunklarheit bei diesem Risikoniveau inakzeptabel ist.
Worauf nach der Offenlegung der minimalen Ablehnungen zu achten ist
Drei Signale werden bestimmen, ob diese Episode zu einem korrigierbaren Aktenstreit oder zum Beleg eines tiefergehenden Rechenschaftsproblems wird.
Das erste Signal ist die Veröffentlichung der tatsächlichen Kette maßgeblicher Verträge. Das Pentagon sollte darlegen, ob P00003 unterzeichnet, ersetzt oder versehentlich erstellt wurde. Es sollte außerdem zeigen, wie die Änderung vom 6. Februar mit der Vereinbarung über den klassifizierten Einsatz vom 27. Februar zusammenhängt.
Eine klare Chronologie würde die Erklärung der Parteien stützen, falls sie zeigt, dass die umstrittene Klausel nur in einem abgelehnten Entwurf verblieb. Eine fortgesetzte Weigerung oder widersprüchliche Antworten würden die Sorge verstärken, dass die öffentliche Darstellung relevante Bedingungen auslässt.
Das zweite Signal ist ein konkreter Bewertungsrahmen für militärische KI-Ablehnungen. Vertreter müssen keine sensiblen Prompts oder Geheimdienstdaten offenlegen. Sie können dennoch Kategorien verbotener Nutzungen, Testmethoden, Meldepflichten und die für die Untersuchung von Fehlern zuständige Stelle veröffentlichen.
Ein solcher Rahmen sollte falsche Ablehnungen von notwendigen Ablehnungen unterscheiden. Er sollte zudem Halluzinationen, unbefugte Tool-Nutzung, Prompt Injection und menschliche Aufsicht unter operativem Zeitdruck testen.
Die Veröffentlichung aussagekräftiger Bewertungsstandards würde OpenAIs Argument stärken, dass ein nützlicheres militärisches Modell feste Grenzen beibehalten kann. Ein Leistungsprogramm, das sich nur auf Antwortraten konzentriert, würde es schwächen.
Das dritte Signal ist, wie das Pentagon Schutzmaßnahmen bei konkurrierenden Anbietern handhabt. Google, Microsoft, Amazon, Nvidia, Reflection, SpaceX, OpenAI und andere Auftragnehmer sollten nicht ohne dokumentierten Grund wesentlich unterschiedlichen Regeln für Überwachung oder tödliche Entscheidungen unterliegen.
Die Auseinandersetzung mit Anthropic macht diesen Vergleich besonders wichtig. Vor ihrem Scheitern konzentrierten sich die Pentagon-Verhandlungen Berichten zufolge darauf, ob das Unternehmen eine weitergehende militärische Nutzung erlauben würde. OpenAI kündigte anschließend eine Vereinbarung an, die Beschränkungen aufrechterhielt, welche in öffentlichen Beschreibungen ähnlich wirkten.
Wenn sich gemeinsame Schutzmaßnahmen über verschiedene Anbieter hinweg herausbilden, wird die Episode eher wie eine schwierige Verhandlung mit anschließender Annäherung der Richtlinien erscheinen. Wenn Anbieter unterschiedliche Bedingungen erhalten, je nachdem, wie bereit sie sind, Ablehnungen zu reduzieren, könnte der Wettbewerbsdruck die Sicherheitsuntergrenze schrittweise senken.
Die Geschichte um den OpenAI-Pentagon-Vertrag dreht sich letztlich darum, wer diese Untergrenze definiert und wie sie überhaupt überprüft werden kann. Weder eine pauschale Ablehnung noch uneingeschränkte Befolgung sind ein angemessener Standard für militärische KI.
Leser sollten auf Dokumente, messbare Kontrollen und einheitliche Anbieterregeln achten, statt auf eine weitere Runde von Zusicherungen. Bis diese vorliegen, bleibt die Klausel zu „minimalen Ablehnungsraten“ umstritten, und das Berichten zufolge darunter bereitgestellte System bleibt ungeprüft. Die nächste Offenlegung sollte eine einfache Frage beantworten: Welche Schutzmaßnahmen binden das eingesetzte Modell, wenn eine rechtmäßige militärische Anfrage dennoch ein inakzeptables Risiko schafft?



