Anthropics Plan für unabhängige KI-Evaluatoren gewinnt OpenAI-Unterstützung, doch der Zugang ist der Prüfstein
Anthropics unabhängige KI-Evaluatoren wurden am 12. September 2026 von einer politischen Idee zu einer öffentlichen Verpflichtung – trotz des harten Wettbewerbs zwischen Frontier-Laboren. CEO Dario Amodei erklärte, externe Teams sollten fortlaufenden, mitarbeitendenähnlichen Zugang zu Sicherheitspraktiken, Vorfällen, Trainingsprozessen und fortgeschrittenen Systemen erhalten. OpenAI-CEO Sam Altman sagte rasch, sein Unternehmen werde dieselbe Verpflichtung eingehen.
Diese Einigung ist folgenreicher als ein weiteres Versprechen, Modelle vor ihrer Veröffentlichung zu testen. Anthropic schlägt externe Beobachter vor, die nahe genug am Labor bleiben, um zu untersuchen, wie Sicherheitsentscheidungen dort entstehen. Schreibtische, Zugangsausweise, Firmenlaptops und direkter Kontakt mit Forschenden würden die kurzen Testfenster ersetzen, die externe Evaluierungen häufig prägen.
Der Vorschlag schafft für beide Unternehmen zugleich eine unmittelbare Glaubwürdigkeitsprüfung. Mitarbeitendenähnlicher Zugang klingt substanziell, doch keines der Unternehmen hat vollständige Regeln zur Auswahl der Evaluatoren, Vertraulichkeit, Berichtsrechten oder strittigen Erkenntnissen veröffentlicht. Das Modell der unabhängigen KI-Evaluierung wird nur dann Bedeutung haben, wenn Evaluatoren unangenehme Belege untersuchen und aussagekräftige Schlussfolgerungen kommunizieren können.
Anthropics unabhängige KI-Evaluatoren würden mehr als fertige Modelle prüfen
Anthropic schlägt eine fortlaufende Beobachtung des Entwicklungsprozesses vor, nicht einen weiteren einmaligen Benchmark vor dem Start.
Amodei stellte die Verpflichtung in seinem Essay über das Tempo vom September 2026 vor. Er argumentierte, dass sich Modellfähigkeiten schneller verbesserten als Alignment-, Überwachungs- und Sicherheitskontrollen. In seiner Formulierung bedeutet ein angemessenes Tempo nicht, die Modellentwicklung zu beenden. Es bedeutet, genügend Zeit für Schutzmaßnahmen und Überprüfung zu lassen, bevor stärkere Fähigkeiten weitergeführt werden.
Der erste Schritt seines dreiteiligen Vorschlags betrifft eingebettete Evaluatoren. Jeder Frontier-Entwickler würde einem unabhängigen Team fortlaufenden Zugang gewähren, der dem von Mitarbeitenden ähnelt. Das Team würde die Einhaltung von Sicherheitsverpflichtungen überprüfen, Vorfälle melden und sowohl abgeschlossene Modelle als auch die Prozesse zu ihrer Erstellung bewerten.
Dieser Umfang stellt die entscheidende Veränderung dar. Externe Modellevaluierungen konzentrieren sich üblicherweise auf ein bestimmtes System während eines begrenzten Zeitraums vor der Veröffentlichung. Evaluatoren erhalten Zugang, führen vereinbarte Tests durch, dokumentieren Ergebnisse und übergeben die Kontrolle an den Entwickler zurück. Ihre Arbeit kann gefährliche Fähigkeiten aufdecken, bietet jedoch nur eine Momentaufnahme.
Eingebetteter Zugang würde die Prüfungsfläche erweitern. Evaluatoren könnten untersuchen, ob interne Teams Testrichtlinien einhielten, angemessen auf Warnsignale reagierten und Ausnahmen dokumentierten. Sie könnten beobachten, wie sich Schutzmaßnahmen während des fortlaufenden Trainings verändern, statt nur das zur Bewertung präsentierte fertige System zu beurteilen.
Amodei erklärte, Anthropic plane, Büroräume, Ausweise, Laptops und Zugang zu relevanten Mitarbeitenden bereitzustellen. Die berichtete Verpflichtung umfasst auch die Überwachung von Sicherheitspraktiken und die Meldung von Vorfällen. Diese Details deuten auf physische und organisatorische Präsenz hin, begründen jedoch keinen uneingeschränkten technischen Zugang.
Die Unterscheidung ist wichtig, weil Frontier-Modelle zunehmend in komplexen Systemen arbeiten. Sie nutzen Software-Tools, behalten über mehrere Schritte hinweg Kontext und handeln in kontrollierten Umgebungen. Das Verhalten eines Modells kann von seinem System Prompt, seinen Berechtigungen, seiner Scaffolding-Struktur, Überwachungstools und den verfügbaren Rechenressourcen abhängen.
Ein Evaluator, der nur eine öffentliche Schnittstelle testet, sieht die letzte Schicht. Ein eingebetteter Evaluator kann untersuchen, wie Entwickler diese Schicht konfigurierten und was während interner Tests geschah. Diese umfassendere Sicht kann Fehler aufdecken, die in einer ausgefeilten Demonstration oder einem Standard-Benchmark verschwinden.
OpenAI hat dieses Evaluierungsproblem bereits anerkannt. Sein Evaluierungsleitfaden vom Mai 2026 besagt, dass moderne Bewertungen Umgebungen, Tools und Arbeitsabläufe berücksichtigen müssen. Einen fortgeschrittenen Agenten wie einen gewöhnlichen Chatbot zu behandeln, kann Ergebnisse liefern, die seine tatsächlichen Betriebsbedingungen nicht abbilden.
OpenAIs Zustimmung steht daher im Einklang mit den zuvor formulierten Evaluierungsgrundsätzen. Das Konzept zu unterstützen, ist jedoch nicht dasselbe wie die Einrichtung eines operativen Programms. Die Unternehmen müssen weiterhin festlegen, welche Systeme, Unterlagen, Mitarbeitenden und internen Umgebungen unabhängige Teams prüfen dürfen.
Der Vorschlag sollte zudem von der breiteren Forderung getrennt werden, den Fortschritt an der Frontier zu verlangsamen. Eingebettete Evaluierung ist eine konkrete Verpflichtung, die jedes Unternehmen unabhängig umsetzen kann. Branchenkoordination, kartellrechtliche Schutzmaßnahmen und internationale Abkommen erfordern gemeinsames Handeln von Regierungen und Wettbewerbern.
Damit wird der Zugang für Evaluatoren zum frühesten überprüfbaren Teil von Amodeis Agenda. Anthropic und OpenAI benötigen keinen Vertrag, bevor sie Auswahlkriterien oder Zugangsregeln veröffentlichen. Sie können damit beginnen, Evaluatoren zu benennen, Schutz für Berichterstattung einzurichten und den Umfang des Programms zu veröffentlichen.
Warum OpenAIs Zustimmung den Einsatz erhöht
OpenAIs Unterstützung macht Anthropics Vorschlag zu einem Wettbewerbsstandard, den andere Frontier-Labore nun akzeptieren, erfüllen oder öffentlich ablehnen müssen.
Altman erklärte, er stimme Amodei beim angemessenen Tempo an der Frontier zu. Laut Associated Press verpflichtete er OpenAI zudem, unabhängigen Evaluatoren mitarbeitendenähnlichen Zugang zu gewähren. Die Reaktion kam schnell genug, um die Geschichte von einer Anthropic-Politikerklärung zu einer Herausforderung für die Branche zu machen.
Die beiden Unternehmen konkurrieren um Forschende, Unternehmenskunden, Rechenkapazität und die Führungsrolle bei fortgeschrittenen Modellen. Diese Rivalität macht ihre Einigung bemerkenswert. Sicherheitsverpflichtungen werden oft schwächer, wenn ein Beteiligter glaubt, ein anderer könne durch ihre Missachtung schneller vorankommen.
Ein entsprechendes Versprechen von OpenAI verringert diesen unmittelbaren Einwand. Anthropic kann nicht als einziger großer Entwickler dargestellt werden, der fortlaufende Prüfung akzeptiert. OpenAI steht unterdessen unter Druck, Altmans Zustimmung in Bedingungen zu übersetzen, die mindestens so konkret sind wie Anthropics vorgeschlagene Regelung.
Andere Entwickler stehen nun vor einer klareren Frage. Google DeepMind, Meta, xAI und weitere Frontier-Labore müssen entscheiden, ob eingebetteter Zugang zu einer gemeinsamen Erwartung wird. Schweigen stellt sie außerhalb eines Standards, den zwei genau beobachtete Wettbewerber unterstützen.
Dieser Druck wird mehr als die öffentliche Kommunikation beeinflussen. Unternehmenskunden benötigen zunehmend Belege zu Modell-Governance, Reaktion auf Vorfälle und Kontrollen bei der Bereitstellung. Ein Entwickler mit glaubwürdiger externer Prüfung kann Käufern neben seinen eigenen System Cards und Sicherheitsberichten eine weitere Quelle der Absicherung bieten.
Entwickler stehen auch unter internem Druck von Forschenden, die ernste Risiken identifizieren. Eingebettete Evaluatoren können einen Kanal für Belege bieten, der nicht vollständig von managementkontrollierter Veröffentlichung abhängt. Dieser Kanal ist nur dann relevant, wenn Mitarbeitende sich ohne Vergeltung oder verfahrensmäßige Behinderung an Evaluatoren wenden können.
Der potenzielle Nutzen erstreckt sich auf Regulierungsbehörden. Staatliche Stellen verfügen selten über das Personal, die Infrastruktur oder den unmittelbaren Zugang, der nötig ist, um jede Frontier-Evaluierung nachzuvollziehen. Qualifizierte externe Organisationen können technische Prüfung zwischen interner Überprüfung und formeller behördlicher Durchsetzung leisten.
Ein Evaluator darf jedoch nicht zum Ersatz für öffentliche Autorität werden. Ein privates Bewertungsteam kann keine verbindlichen Sanktionen verhängen, sofern Gesetz oder Vertrag ihm diese Befugnis nicht einräumen. Es kann auch keine umfassenderen politischen Entscheidungen über gesellschaftlich akzeptables Risiko treffen.
OpenAIs Verpflichtung erhöht die Erwartungen, weil das Unternehmen bereits politische Maßnahmen zu unabhängigen Sicherheitsbewertungen unterstützt hat. Seine KI-politische Position vom 9. September befürwortete kalifornische Vorschläge zu Sicherheitsbewertungen, Auditorenstandards, Jugendschutz und biologischen Risiken. Das Unternehmen erklärte außerdem, gemeinsam mit anderen Laboren freiwillige Frontier-Standards verfolgen zu wollen.
Das neue Versprechen verbindet diese öffentlichen Positionen mit OpenAIs eigenen Abläufen. Gesetzgebung zu Audits zu unterstützen, ist leichter, als externen Spezialisten zu erlauben, interne Meinungsverschiedenheiten zu beobachten. Mitarbeitendenähnlicher Zugang wird prüfen, ob das Unternehmen Kontrolle akzeptiert, wenn Erkenntnisse eine wettbewerbliche Veröffentlichung verzögern.
Anthropic steht vor derselben Prüfung. Seine Identität betont seit Langem Sicherheit, Interpretierbarkeit und verantwortungsvolle Skalierung. Eingebettete Evaluatoren können diesen Anspruch stärken, doch eine schwache Umsetzung würde einen schärferen Widerspruch zwischen der Positionierung des Unternehmens und seinen tatsächlichen Kontrollen schaffen.
Das unmittelbare Ziel des Drucks ist daher nicht die Regierung. Es sind die Labore, die diese Verpflichtung eingehen. Sie haben freiwillig den Standard angehoben, an dem Journalisten, Forschende, Kunden, Mitarbeitende und politische Entscheidungsträger ihr Verhalten messen können.
Der tatsächliche Zielkonflikt besteht zwischen Unabhängigkeit und internem Zugang
Evaluatoren benötigen tiefen Zugang, um Frontier-Systeme zu verstehen, doch die Abhängigkeit von einem Labor kann die Unabhängigkeit schwächen, die ihren Erkenntnissen Wert verleiht.
Externe Evaluierung war immer mit einem Zugangsproblem verbunden. Begrenzter Zugang schützt geistiges Eigentum, Nutzerdaten, Modellgewichte und Sicherheitskontrollen. Er kann Rezensenten jedoch auch daran hindern, die exakten Mechanismen hinter gefährlichem oder irreführendem Verhalten zu erkennen.
Mitarbeitendenähnlicher Zugang bewegt sich zum anderen Extrem. Evaluatoren könnten interne Tests beobachten und regelmäßig mit Sicherheitsteams sprechen. Sie könnten technischen Kontext erhalten, der ihre Schlussfolgerungen präziser macht. Zugleich könnten sie finanziell, sozial oder operativ von dem überprüften Unternehmen abhängig werden.
Diese Spannung lässt sich nicht dadurch lösen, dass ein Team als unabhängig bezeichnet wird. Die Beziehung braucht durchsetzbare Schutzmaßnahmen. Evaluatoren sollten über geschützte Finanzierung, feste Berichtsrechte, sichere Kommunikationskanäle und klare Befugnisse zur Sicherung relevanter Belege verfügen.
Auch Auswahlverfahren erfordern Prüfung. Ein Unternehmen sollte nicht nur Gutachter auswählen können, die seine Annahmen voraussichtlich akzeptieren. Eine Rotation zwischen qualifizierten Organisationen könnte Risiken durch Vertrautheit verringern, während transparente Qualifikationsregeln wohlwollende Ernennungen abschrecken könnten.
Die Finanzierung stellt eine weitere Herausforderung dar. Frontier-Evaluierung erfordert technisches Personal, sichere Rechenumgebungen und spezialisierte Testwerkzeuge. Wenn ein Labor die gesamten Kosten trägt, könnten Beobachter infrage stellen, ob Evaluatoren Erkenntnisse veröffentlichen können, die der Beziehung schaden.
Staatliche oder branchenweit gebündelte Finanzierung könnte die direkte Abhängigkeit verringern. Gebündelte Finanzierung benötigt jedoch Kontrollen, die verhindern, dass dominante Unternehmen den Markt für Evaluatoren prägen. Öffentliche Zuschüsse können andere Belastungen schaffen, darunter politischen Einfluss und langsame Beschaffung.
Veröffentlichungsrechte sind ebenso wichtig. Evaluatoren werden auf vertrauliches Material stoßen, das nicht sicher in einem öffentlichen Bericht erscheinen kann. Modellschwachstellen, Details zu gefährlichen Fähigkeiten, private Nutzerinformationen und Sicherheitsarchitektur erfordern einen sorgfältigen Umgang.
Vertraulichkeit darf nicht zu einem universellen Grund für Schweigen werden. Ein glaubwürdiger Rahmen sollte zwischen sensiblen technischen Details und übergeordneten Erkenntnissen zu Compliance, ungelösten Risiken und der Reaktion auf Vorfälle unterscheiden. Evaluatoren benötigen einen Weg, ernsthafte Bedenken über die Unternehmensführung hinaus zu melden.
Das Labor benötigt außerdem ein faires Verfahren zur Korrektur sachlicher Fehler. Technische Bewertungen können Fehlalarme erzeugen, Annahmen über die Umgebung übersehen oder unvollständige Daten falsch interpretieren. Ein Reaktionsverfahren verbessert die Genauigkeit, darf dem Unternehmen jedoch kein Vetorecht über Veröffentlichungen einräumen.
Ein Rahmenwerk für sicheren Zugang aus dem Jahr 2026 beschrieb das zugrunde liegende Sicherheitsdilemma. Entwickler verfügen über sensible Modellspezifikationen, während Evaluatoren ausreichend Zugang benötigen, um aussagekräftige Bewertungen durchzuführen. Evaluatoren müssen zudem private Methoden schützen, damit Labore Modelle nicht gezielt auf bekannte Tests optimieren können.
Eingebettete Überprüfung verschärft beide Risiken. Ein Evaluator mit internem Zugang kann versehentlich proprietäre Informationen offenlegen. Ein Entwickler mit Einblick in Evaluierungsmethoden kann direkt auf den Test hin trainieren und so hohe Ergebnisse erzielen, ohne die Sicherheit umfassender zu verbessern.
Technische Trennung kann helfen. Sichere Evaluierungsumgebungen können Datenbewegungen begrenzen, Zugriffe protokollieren und Testmaterialien von Entwicklungsteams trennen. Diese Kontrollen sollten beide Seiten schützen, ohne dem Labor zu erlauben, jede investigative Entscheidung zu überwachen.
Die beste Regelung wird weder einem gewöhnlichen Auftragnehmerverhältnis noch einem uneingeschränkten Beschäftigungsverhältnis entsprechen. Sie erfordert einen Zugang, der mit dem von Insidern vergleichbar ist, verbunden mit einer Governance, die unabhängiges Urteilsvermögen wahrt. Diese Kombination ist schwierig, doch alles Schwächere droht zu bloß zeremonieller Aufsicht zu führen.
Arbeitnehmerähnlicher Zugang braucht dennoch ein detailliertes Regelwerk
Der Vorschlag bleibt unvollständig, bis Anthropic und OpenAI Zugang, Befugnisse, Umgang mit Vorfällen und öffentliche Offenlegung in operativen Begriffen definieren.
Die Formulierung „arbeitnehmerähnlicher Zugang“ besitzt Überzeugungskraft, weil sie Nähe impliziert. Sie legt jedoch nicht fest, welcher Mitarbeiter, welche Systeme oder welche Berechtigungen gemeint sind. Ein Forscher, der am Modellverhalten arbeitet, hat anderen Zugang als ein Mitarbeiter der Kommunikation oder ein externer Auftragnehmer auf Besuch.
Technischer Zugang sollte mehr umfassen als den öffentlichen Modellendpunkt. Abhängig von der Evaluierung benötigen Prüfer möglicherweise System-Prompts, Tool-Berechtigungen, Modellversionen, Monitoring-Ergebnisse und Aufzeichnungen aus Tests gefährlicher Fähigkeiten. Trainingsdaten und Modellgewichte werfen größere Sicherheits- und Rechtsfragen auf.
Prozesszugang ist ebenso wichtig. Evaluatoren müssen verstehen, wer eine Bereitstellung genehmigen kann, was beim Überschreiten von Schwellenwerten geschieht und wie das Management Meinungsverschiedenheiten löst. Andernfalls könnten sie Tests beobachten, ohne zu sehen, wie diese Tests Entscheidungen beeinflussen.
Der Zugang zu Informationen über Vorfälle verdient eine eigene Regel. Ein Labor muss definieren, was als Vorfall gilt, wann Evaluatoren benachrichtigt werden und ob eine nachträgliche Überprüfung zulässig ist. Eine verspätete Benachrichtigung kann Prüfer daran hindern, Protokolle zu sichern oder relevante Mitarbeiter zu befragen.
Evaluatoren benötigen auch Schutz vor dem Entzug ihres Zugangs. Ein Unternehmen sollte ein Team nicht unmittelbar nach einer kritischen Feststellung abziehen können. Verträge sollten Kündigungsbedingungen, Streitbeilegung und fortbestehende Rechte zur Berichterstattung über vor dem Abzug abgeschlossene Arbeit festlegen.
Die Programme benötigen Standards für Interessenkonflikte. Evaluatoren können mehrere konkurrierende Labore beraten, eine künftige Beschäftigung anstreben oder von der Finanzierung durch Entwickler abhängig sein. Die öffentliche Offenlegung bedeutender Beziehungen kann Lesern helfen, die Unabhängigkeit hinter jedem Bericht einzuschätzen.
Anthropics umfassenderes Risikorahmenwerk argumentiert bereits, dass Entwickler von Frontier-Modellen qualifizierte unabhängige Evaluatoren einbeziehen sollten. Es fordert außerdem veröffentlichte Überprüfungen von Unternehmensbewertungen und Risikoberichten. Eingebetteter Zugang würde diesen Ansatz von regelmäßiger Überprüfung hin zu fortlaufender institutioneller Aufsicht erweitern.
Die öffentliche Berichterstattung bleibt jedoch ungewiss. Ein Evaluator könnte einen detaillierten Bericht, eine begrenzte Bestätigungserklärung oder gar nichts veröffentlichen, sofern kein schwerwiegender Vorfall eintritt. Diese Formate bieten sehr unterschiedliche Grade an Rechenschaftspflicht.
Eine enge Bestätigungserklärung könnte bestätigen, dass ein Prozess stattgefunden hat, ohne offenzulegen, was Evaluatoren festgestellt haben. Eine detaillierte Überprüfung könnte getestete Risiken, Einschränkungen, Meinungsverschiedenheiten und Abhilfemaßnahmen beschreiben. Letztere bietet mehr Wert, schafft jedoch größere Sicherheits- und Haftungsrisiken.
Verfahren für Meinungsverschiedenheiten werden den Ernst der Verpflichtung offenbaren. Angenommen, Evaluatoren empfehlen, die Bereitstellung zu verschieben, während das Management die Kontrollen für ausreichend hält. Leser müssen wissen, wer entscheidet, ob abweichende Meinungen öffentlich werden und welche Dokumentation erhalten bleibt.
Kein privater Evaluator kann garantieren, dass ein Modell sicher ist. Frontier-Systeme arbeiten in sich wandelnden Umgebungen und interagieren mit Nutzern, die neue Fehlermodi entdecken. Evaluierung kann Unsicherheit verringern, Gefahren identifizieren und Kontrollen testen, aber sie kann Risiken nicht beseitigen.
Diese Einschränkung sollte in jeder öffentlichen Beschreibung des Programms erscheinen. Ein Unternehmen darf die Anwesenheit eines Evaluators nicht als umfassende Zertifizierung verwenden. Die Aussage sollte auf die tatsächlich untersuchten Systeme, Bedingungen, Tests und Zeitpunkte beschränkt bleiben.
Auch Standards für die Kompetenz von Evaluatoren müssen definiert werden. Teams benötigen möglicherweise Fachwissen in Cybersicherheit, biologischen Risiken, autonomen Agenten, Interpretierbarkeit und organisatorischer Governance. Keine einzelne Organisation wird zwangsläufig jeden Risikobereich abdecken.
Ein Modell mit mehreren Evaluatoren könnte eine stärkere Abdeckung bieten. Eine Organisation könnte gefährliche Fähigkeiten testen, während eine andere Governance und Reaktion auf Vorfälle überprüft. Gegenprüfungen können die Abhängigkeit von einer einzelnen Methodik oder institutionellen Beurteilung verringern.
Die nächste nützliche Veröffentlichung eines der beiden Unternehmen ist daher keine weitere Unterstützungserklärung. Sie ist eine Programmcharta mit benannten Verantwortlichkeiten, definierten Zugangsstufen, geschützten Berichterstattungskanälen und einem Startdatum.
Freiwillige Aufsicht kann Vertrauen stärken, ohne das KI-Rennen zu beenden
Anthropics Vorschlag kann Sicherheitsversagen offenlegen, beseitigt jedoch nicht die kommerziellen und geopolitischen Anreize, die Labore zu schnellerer Entwicklung drängen.
Amodeis weitergehendes Argument beginnt mit der Beschleunigung von Fähigkeiten. Er sagt, dass KI-Systeme zunehmend zum Aufbau späterer Systeme beitragen – eine Dynamik, die als rekursive Selbstverbesserung bezeichnet wird. In diesem Kontext unterstützen Modelle Forschung, Programmierung, Tests und Optimierung, die in die Entwicklung zurückfließen.
Die Behauptung bedeutet nicht, dass eine autonome Maschine sich ohne menschliche Kontrolle eigenständig neu entwirft. Sie beschreibt einen Entwicklungszyklus, in dem KI die Forschungsproduktivität steigert. Schnellere Forschung kann die Zeit für Evaluierung, Monitoring und Sicherheitsarbeit verkürzen.
Amodei verwies auch auf Fehlschläge bei autonomen Agenten und Cybersicherheitstests. Sein Essay warnt, dass ein leistungsfähigerer fehlangepasster Schwarm schwere, internetweite Schäden verursachen könnte. Diese Prognose ist seine Einschätzung, keine unabhängig belegte Zeitlinie.
Die Unterscheidung ist wichtig, weil extreme Vorhersagen die Aufmerksamkeit von unmittelbaren Governance-Fragen ablenken können. Evaluatoren müssen sich nicht auf eine genaue Katastrophenprognose einigen, um aktuelle Vorfälle, Zugangskontrollen und Bereitstellungsverfahren zu untersuchen. Die bestehende Unsicherheit rechtfertigt bereits bessere Belege.
Der zentrale Einwand betrifft freiwillige Koordination. Unternehmen können versprechen, die Entwicklung zu drosseln, dabei aber Drosselung unterschiedlich auslegen. Ein Labor könnte die Bereitstellung verzögern, ein anderes mit internem Training fortfahren und ein drittes zusätzliches Monitoring als ausreichend betrachten.
Amodei räumt das Wettbewerbsproblem ein. Sein zweiter vorgeschlagener Schritt erfordert eine branchenweite Sicherheitskoordination, die möglicherweise durch kartellrechtliche Ausnahmen unterstützt wird. Sein dritter hängt von der Zusammenarbeit zwischen demokratischen Regierungen und geopolitischen Wettbewerbern ab.
Diese Schritte stehen vor weitaus größeren Hindernissen als eingebettete Evaluierung. Regierungen könnten Beschränkungen ablehnen, die ihrer Ansicht nach die nationale Wettbewerbsfähigkeit schwächen. Rivalisierende Labore könnten vermuten, dass Sicherheitsstandards etablierte Akteure schützen, indem sie die Kosten für kleinere Entwickler erhöhen.
Kritiker können berechtigterweise fragen, ob etablierte Unternehmen von Regulierung profitieren, die kleinere Wettbewerber nicht finanzieren können. Unabhängige Evaluierung erfordert spezialisierte Fachkräfte, sichere Infrastruktur und Zeit. Schlecht konzipierte Vorgaben könnten die Labore verfestigen, die bereits über das meiste Kapital und die meisten Rechenressourcen verfügen.
Dieses Anliegen entkräftet Aufsicht nicht. Es bedeutet, dass Standards mit dem Risiko skalieren und gegebenenfalls gemeinsame Evaluierungsinfrastruktur bereitstellen sollten. Die Qualifikation sollte von technischer Kompetenz abhängen, nicht von der Geschäftsbeziehung eines Evaluators zum größten Entwickler.
Ein weiteres Anliegen ist regulatorische Vereinnahmung. Eine kleine Gruppe von Laboren und bevorzugten Evaluatoren könnte akzeptables Risiko ohne breitere öffentliche Beteiligung definieren. Ihre Standards könnten Einfluss gewinnen, bevor Gesetzgeber demokratische Rechenschaftspflicht schaffen.
Transparenz kann diese Gefahr verringern. Regierungen, Wissenschaftler, zivilgesellschaftliche Gruppen und betroffene Branchen sollten an der Definition von Evaluatorqualifikationen und Erwartungen an die Berichterstattung mitwirken. Veröffentlichte Meinungsverschiedenheiten würden außerdem zeigen, wo privater Konsens endet.
Der Vorschlag stößt zudem an eine geopolitische Grenze. Eine Verlangsamung, die auf ausgewählte amerikanische Unternehmen beschränkt ist, würde Entwickler anderswo nicht zwingend einschränken. Amodei argumentiert, dass demokratische Länder sich mit autoritären Regierungen koordinieren müssen, doch eine solche Überprüfung wäre schwierig.
OpenAI und Anthropic können ihre eigenen Praktiken dennoch verbessern, ohne die internationale Koordination zu lösen. Eingebettete Evaluatoren können Prozessversagen erkennen und dokumentieren, ob jedes Unternehmen seine erklärten Regeln einhält. Sie können nicht nicht offengelegte Arbeit in unabhängigen Laboren überprüfen.
Das Ergebnis ist ein nützlicher, aber begrenzter Eingriff. Unabhängige KI-Evaluatoren können die Rechenschaftspflicht innerhalb teilnehmender Unternehmen verbessern. Sie können das KI-Rennen nicht beilegen, globale Politik nicht bestimmen und nicht garantieren, dass jeder Wettbewerber dieselben Einschränkungen akzeptiert.
Leser sollten daher zwei übertriebene Interpretationen vermeiden. Der Vorschlag ist keine verbindliche Verlangsamung für die gesamte Branche. Er ist aber auch substanzieller als gewöhnliche Sicherheitskommunikation, wenn der versprochene Zugang real und dauerhaft wird.
Für Unternehmenskunden betrifft die praktische Frage die Belege. Käufer, die fortgeschrittene Systeme bewerten, sollten fragen, welche Risiken extern getestet wurden, welchen Zugang Prüfer erhielten und ob ungelöste Bedenken offengelegt wurden. Ein Sicherheitslabel ohne Evaluierungsumfang bietet wenig Orientierung.
Teams sollten bei ihren eigenen Bereitstellungen dieselbe Disziplin wahren. Sie benötigen Aufzeichnungen über Modellversionen, Prompts, Berechtigungen, Testergebnisse und Genehmigungsentscheidungen. Eine durchsuchbare Wissensdatenbank kann diesen Prüfpfad unterstützen, ohne formale Risikokontrollen zu ersetzen.
Drei Signale zeigen, ob die Verpflichtung real ist
Der nächste Test ist die Umsetzung: benannte Evaluatoren, durchsetzbare Berichterstattungsrechte und eine Übernahme über Anthropic und OpenAI hinaus.
Das erste Signal ist eine öffentliche Programmcharta. Anthropic und OpenAI sollten teilnehmende Evaluatoren benennen, arbeitnehmerähnlichen Zugang definieren und ein Umsetzungsdatum angeben. Eine Charta sollte außerdem erklären, welche Phasen der Modellentwicklung in den Geltungsbereich fallen.
Diese Veröffentlichung würde die Verpflichtung stärken, weil Außenstehende die Praxis mit definierten Zusagen vergleichen könnten. Ein vages Memorandum oder ein unbenannter Pilotversuch würde sie schwächen. Ohne Daten und Umfang können weder Mitarbeiter noch die Öffentlichkeit Verstöße erkennen.
Das zweite Signal sind Belege für unabhängige Berichterstattung. Evaluatoren sollten Methoden, Einschränkungen, wesentliche Erkenntnisse und alle ungelösten Meinungsverschiedenheiten veröffentlichen, die sicher offengelegt werden können. Berichte sollten angeben, welche Systeme und Entwicklungszeiträume sie abdeckten.
Ein Bericht, der vollständig über unternehmenseigene Kommunikationskanäle erstellt wird, bietet nur geringe Gewähr. Die Fähigkeit eines Prüfers, Meinungsverschiedenheiten zu beschreiben, ist zentral für seine Unabhängigkeit. Selbst ein sorgfältig geschwärzter Bericht kann echte Kontrolle von einer gesteuerten Befürwortung unterscheiden.
Der aufschlussreichste Test wird kommen, wenn ein Evaluator zusätzliche Arbeit oder eine Verzögerung empfiehlt. Wenn das Unternehmen seine Reaktion dokumentiert und den Widerspruch des Evaluators festhält, gewinnt die Vereinbarung an Glaubwürdigkeit. Wenn der Zugang verschwindet oder Erkenntnisse verborgen bleiben, verliert das Engagement an Wert.
Das dritte Signal ist, ob andere führende Entwickler vergleichbare Vereinbarungen übernehmen. Unterstützung von Google DeepMind, Meta, xAI oder einem anderen großen Labor würde eingebettete Evaluierung in Richtung eines Industriestandards bewegen. Eine Ablehnung würde die wettbewerblichen Grenzen freiwilliger Koordination offenlegen.
Vergleichbar bedeutet nicht, dass die Governance identisch sein muss. Verschiedene Unternehmen nutzen unterschiedliche Infrastrukturen und Entwicklungsmethoden. Es erfordert jedoch ausreichend gemeinsame Offenlegung, um Zugang, Unabhängigkeit, Berichterstattung und Befugnisse bei Vorfällen vergleichen zu können.
Eine Übernahme über zwei Unternehmen hinaus würde Amodeis Argument eines Wettlaufs nach oben stärken. Anhaltende Fragmentierung würde zeigen, dass Sicherheitskoordination strategischen Anreizen weiterhin untergeordnet bleibt. Regierungen stünden dann unter größerem Druck, Mindestanforderungen festzulegen.
Die kommenden drei Monate sollten erste Hinweise liefern. Beide Unternehmen können Grundsätze zum Zugang veröffentlichen, ohne auf Gesetze oder internationale Verhandlungen zu warten. Evaluatororganisationen können ebenfalls die Bedingungen benennen, die sie vor der Annahme einer eingebetteten Rolle verlangen.
Entwickler und Unternehmenskäufer sollten die Formulierungen genau beobachten. „Beratung“, „Modellzugang“ und „mitarbeiterähnlicher Zugang“ sind nicht austauschbar. Das Erste kann Beratung bedeuten, das Zweite eine zeitlich begrenzte Schnittstelle, und das Dritte sollte fortlaufende operative Einblicke bedeuten.
Sie sollten auch nach negativen Indizien suchen. Fehlende Starttermine, nicht offengelegte Identitäten der Evaluatoren, weit gefasste Vertraulichkeitsklauseln oder vom Unternehmen kontrollierte Zusammenfassungen würden den Wert des Vorschlags mindern. Unabhängige Aufsicht wird durch Rechte glaubwürdig, die Meinungsverschiedenheiten überdauern.
Anthropics unabhängige KI-Evaluatoren erhalten nun ungewöhnlich sichtbare Unterstützung von OpenAI. Diese Vereinbarung erhöht die Erwartungen, beantwortet jedoch nicht, wer Zugang erhält oder was offengelegt werden darf. Die entscheidenden Belege werden aus dem ersten strittigen Befund hervorgehen, nicht aus der ersten kooperativen Ankündigung.
Für alle, die fortschrittliche KI auswählen oder einsetzen, ist dies der Zeitpunkt, anspruchsvollere Governance-Fragen zu stellen. Wer hat das System getestet, worauf hatte diese Person oder Organisation Zugriff, und welche Einschränkungen bleiben ungelöst? Wenn Labore erwarten, dass Kunden eingebetteter Aufsicht vertrauen, sollten diese Kunden dann nicht ausreichend Offenlegung verlangen, um die Evaluatoren selbst beurteilen zu können?



