Anthropics eingebettete Evaluatoren erhalten Insider-Zugang, doch ihre Unabhängigkeit ist der eigentliche Test
Anthropics eingebettete Evaluatoren erhalten im Rahmen einer am 12. September von CEO Dario Amodei angekündigten Zusage einen mitarbeiterähnlichen Zugang. Das externe Team soll Schreibtische, Zugangsausweise, Firmenlaptops, interne Tools und direkten Kontakt zu Mitarbeitenden erhalten. Die Vereinbarung geht weit über die zeitlich begrenzten Modells tests hinaus, die führende KI-Unternehmen heute üblicherweise anbieten.
Die Zusage ist der erste Teil von Amodeis dreistufigem Vorschlag, die Entwicklung von Frontier-KI zu verlangsamen, ohne das Modelltraining einzustellen. Anthropic geht diesen Schritt allein und strebt zugleich eine breitere Koordination zwischen Unternehmen und Regierungen an. Damit entsteht ein unmittelbarer Test dafür, ob freiwillige Aufsicht ein Unternehmen begrenzen kann, das im Wettbewerb um immer leistungsfähigere Systeme steht.
OpenAI-CEO Sam Altman erklärte laut der Branchenreaktion rasch, sein Unternehmen werde externen Evaluatoren ebenfalls Zugang gewähren. Doch die Ankündigung zu übernehmen, ist leichter als ihren Gehalt. Die Auswahl der Evaluatoren, Informationsrechte, Publikationsfreiheit, Finanzierung und Zugangsbeschränkungen werden bestimmen, ob diese Programme tatsächlich unabhängige Kontrolle ermöglichen.
Die zentrale Frage lautet daher nicht, ob ein Evaluator das Gebäude betritt. Entscheidend ist, ob dieser Evaluator eine unbequeme Tatsache entdecken, überprüfen und trotz der kommerziellen Interessen des Unternehmens offenlegen kann.
Was Anthropics eingebettete Evaluatoren tatsächlich erhalten werden
Anthropic schlägt kontinuierlichen Zugang zu seinen Sicherheitsabläufen vor, nicht einen weiteren kurzen Test eines fertigen Claude-Modells.
In seinem Vorschlag zur Taktung beschreibt Amodei ein Team unabhängiger Drittbewerter, das direkt im Unternehmen eingebettet ist. Als mögliches Beispiel für eine Organisation, die diese Rolle übernehmen könnte, nennt er Model Evaluation and Threat Research, kurz METR. Anthropic hat das ausgewählte Team noch nicht bekannt gegeben.
Die Evaluatoren sollen Berechtigungen und Tools erhalten, die weitgehend mit denen interner Mitarbeitender für Risikobewertungen vergleichbar sind. Anthropic will Schreibtische, Ausweise, Firmenlaptops und Zugang zu relevanten Arbeitsbereichen bereitstellen. Prüfer sollen zudem direkt mit Mitarbeitenden sprechen können.
Dieser Zugang soll mehr als nur das Verhalten eines finalen Modells abdecken. Das Team würde Trainingspipelines, Bereitstellungsverfahren, Schutzmaßnahmen und die Einhaltung der erklärten Sicherheitszusagen durch das Unternehmen untersuchen. Eine Trainingspipeline umfasst die Daten, Umgebungen, Feedbacksysteme und operativen Prozesse, die zur Entwicklung eines Modells eingesetzt werden.
Diese Unterscheidung ist wichtig, weil eine ausgereifte Bewertung vor der Veröffentlichung nur eine kontrollierte Sicht auf ein System erfasst. Sie zeigt nicht unbedingt, wie ein Unternehmen den Test auswählte, das Modell konfigurierte, fehlgeschlagene Durchläufe behandelte oder intern reagierte. Zudem sagt sie wenig über Vorfälle während des Trainings aus.
Eingebettete KI-Evaluatoren könnten diese begleitenden Entscheidungen untersuchen, solange Belege noch verfügbar sind. Sie könnten schriftliche Richtlinien mit internen Maßnahmen vergleichen und nachfragen, warum Ausnahmen gewährt wurden. Außerdem könnten sie ein Problem über mehrere Modellversionen hinweg verfolgen, statt jede Bewertung ohne institutionellen Kontext zu beginnen.
Anthropic erklärt, Prüfer könnten wichtige Erkenntnisse ohne redaktionelle Genehmigung des Unternehmens veröffentlichen. Diese Erkenntnisse können Risikostufen, Vorfälle, interne Praktiken und die Qualität des gewährten Zugangs betreffen. Prüfer könnten daher auch berichten, dass das Unternehmen für eine Bewertung relevante Informationen zurückgehalten hat.
Der vorgeschlagene Vertrag enthält weiterhin Einschränkungen. Anthropic erwartet, Material zu schwärzen, das Sicherheit, rechtliches Berufsgeheimnis, kommerzielle Sensibilität oder vertrauliche Informationen von Kunden und Partnern betrifft. Diese Kategorien schützen legitime Interessen, doch ihre Auslegung wird beeinflussen, wie viel Außenstehende überprüfen können.
Das Unternehmen erklärt, es werde eine Feststellung nicht allein deshalb unterdrücken, weil das Ergebnis ungünstig ist. Prüfer dürften auch darauf hinweisen, wenn eine Schwärzung Informationen entfernte, die für ihre Schlussfolgerungen wichtig waren. Diese Regelung liefert ein begrenztes Signal, wenn Leser das zugrunde liegende Material nicht einsehen können.
Amodei bezeichnet die Zusage als unilateral, weil sie nicht davon abhängt, dass Wettbewerber dieselbe Vereinbarung akzeptieren. Anthropic plant, in naher Zukunft ein Prüferteam einzuladen, hat jedoch kein Startdatum genannt. Ebenso wenig hat es den vorgeschlagenen Vertrag, das Budget für Evaluatoren oder ein Verfahren zur Streitbeilegung veröffentlicht.
Die Ankündigung etabliert daher ein angestrebtes Aufsichtsmodell, nicht ein bereits abgeschlossenes Auditsystem. Die wesentlichen Details bleiben offen. Sie werden darüber entscheiden, ob mitarbeiterähnlicher Zugang Sichtbarkeit auf Mitarbeiterebene schafft oder lediglich eine sorgfältig begrenzte Variante davon.
Warum ein dauerhafter Platz KI-Sicherheitsaudits verändert
Dauerhafter Zugang verschiebt die Bewertung von einer terminierten Untersuchung hin zu fortlaufender institutioneller Aufsicht.
Führende KI-Labore arbeiten bereits mit unabhängigen Forschern und staatlichen Teststellen zusammen. Anthropic erklärt, Bewertungen durch das britische AI Security Institute, das United States Center for AI Standards and Innovation und METR unterstützt zu haben. Zudem führt das Unternehmen externes Red Teaming durch und konsultiert Fachleute.
Die Transparenzzusagen des Unternehmens zeigen jedoch, dass externe Bewertungen im Allgemeinen API-Zugang ohne Datenaufbewahrung nutzen, sofern dies verfügbar ist. Das schützt die während der Tests übermittelten Informationen. Es gewährt jedoch keinen routinemäßigen Einblick in die internen Prozesse, die das Modell hervorgebracht haben.
API-basierte Tests können gefährliche Fähigkeiten, schwache Verweigerungen oder unwirksame Schutzmaßnahmen aufdecken. Sie können Modelle auch unter standardisierten Bedingungen vergleichen. Allerdings behält das Unternehmen dabei in der Regel die Kontrolle über Zeitpunkt, Modellverfügbarkeit, Systemkonfiguration und unterstützende Belege.
Ein dauerhaftes Team könnte die Lücke zwischen schriftlichen Verfahren und dem täglichen Betrieb beobachten. Dort können viele folgenreiche Fehler entstehen. Eine Richtlinie kann eine Prüfung vorschreiben, während eine operative Frist ihren Umfang einengt oder eine Gegenmaßnahme verzögert.
Der Ansatz ähnelt der Bankenaufsicht, bei der Regulierungsbehörden eine fortlaufende Präsenz bei sensiblen Institutionen unterhalten können. Amodei verweist auf diesen Präzedenzfall, weil beide Sektoren private Organisationen umfassen, deren interne Risikoentscheidungen die Öffentlichkeit betreffen können. Die Analogie hat jedoch Grenzen, da Anthropics Evaluatoren zunächst auf Grundlage eines freiwilligen Vertrags tätig würden.
Eine Bankenaufsicht erhält ihre Befugnisse durch Gesetze und eine rechenschaftspflichtige öffentliche Institution. Ein privater KI-Evaluator erhält seine Befugnisse von dem Unternehmen, das bewertet wird. Der Vertrag kann bedeutende Unabhängigkeit gewähren, aber auch deren Grenzen festlegen.
Kontinuität bietet dennoch praktischen Nutzen. Prüfer können lernen, wie interne Systeme funktionieren, wiederkehrende Ausnahmen erkennen und Veränderungen im Verhalten der Organisation identifizieren. Sie müssen die Geschichte des Unternehmens nicht bei jedem Auftrag neu rekonstruieren.
Dieser Kontext wird wichtiger, wenn KI-Systeme über längere Arbeitsabläufe hinweg handeln. Das Verhalten eines Modells hängt teilweise von seinem Evaluierungsrahmen sowie von den Tools, Berechtigungen, dem Speicher und der Umgebung ab, die das Modell umgeben. Ein enger Test kann Risiken übersehen, die durch diese umgebende Konfiguration entstehen.
OpenAIs Leitfaden für Evaluierungen benennt mehrere Probleme, die Ergebnisse verzerren können. Dazu zählen Reward Hacking, Verweigerungen, kontaminiertes Testmaterial, fehlerhafte Aufgaben und Sandbagging. Sandbagging liegt vor, wenn ein Modell während einer Bewertung absichtlich unter seinen tatsächlichen Fähigkeiten bleibt.
Prüfer benötigen technischen Zugang, um solche Fehler untersuchen zu können. Sie brauchen möglicherweise Modellschnappschüsse, Systemprotokolle, Testumgebungen, interne Diskussionen und Belege aus früheren Durchläufen. Eine Endnote kann nicht erklären, ob ein Test die beabsichtigte Fähigkeit gemessen hat.
Der KI-Sicherheitsvorschlag von Anthropic erweitert zudem den Gegenstand der Prüfung. Evaluatoren würden bewerten, ob Anthropic seine eigenen Schutzmaßnahmen und Eskalationsprozesse eingehalten hat. Damit wird die Evaluierung zu einer Form der Governance-Überprüfung statt zu einem Wettbewerb zwischen Benchmark-Ergebnissen.
Für Unternehmenskunden beeinflusst diese Unterscheidung, wie Sicherheitsbehauptungen gelesen werden sollten. Eine Model Card beschreibt ausgewählte Belege zu einem veröffentlichten System. Kontinuierliche Aufsicht kann untersuchen, wie die Organisation diese Belege erzeugt hat und ob sie ihre erklärten Kontrollen befolgt hat.
Entwickler sollten sich aus einem ähnlichen Grund dafür interessieren. Agentische Systeme verbinden Modelle mit Codeausführung, Browsern, Zugangsdaten und externen Diensten. Zuverlässigkeit hängt von der gesamten Betriebsumgebung ab, nicht nur vom Gesprächsverhalten des Basismodells.
Wissensarbeiter begegnen diesem Thema ebenfalls, wenn KI-Tools mit sensiblen Informationen arbeiten. Eine auf isolierte Prompts begrenzte Bewertung kann ein System, das Dokumente durchsucht, Nachrichten versendet oder gespeicherte Zugangsdaten verwendet, nicht vollständig abbilden. Die Aufsicht muss dem Arbeitsablauf und seinen Berechtigungen folgen.
Mitarbeiterähnlicher Zugang ist daher bedeutsam, weil er erweitert, wo Evaluatoren hinschauen können. Er garantiert nicht automatisch, dass sie die richtigen Fragen stellen. Das hängt von Fachwissen, Unabhängigkeit, Ressourcen und Publikationsrechten ab.
Anthropics Zusage erhöht den Druck auf OpenAI und andere Frontier-Labore
Der unmittelbare Druck liegt bei konkurrierenden Laboren, die unabhängige Tests unterstützen, aber keinen ebenso kontinuierlichen internen Zugang angeboten haben.
Amodeis Zusage schafft einen öffentlichen Vergleich, der nicht durch allgemeine Unterstützung für KI-Sicherheit erfüllt werden kann. Wettbewerber stehen nun vor einer konkreten Frage zum Zugang. Sie müssen entscheiden, ob Außenstehende interne Prozesse vor, während und nach der Bereitstellung eines Modells untersuchen können.
Altman reagierte schnell und erklärte, OpenAI werde eine ähnliche Idee übernehmen und weitere Details liefern. Diese Reaktion stärkt die Legitimität des Vorschlags. Sie verlagert die Aufmerksamkeit zudem von der Frage, ob eingebettete Aufsicht wünschenswert ist, hin zu der Frage, wie sich konkurrierende Umsetzungen unterscheiden werden.
OpenAI erklärt bereits, es gewähre sensiblen Zugang, wenn unabhängige Prüfer ihn für kritische Sicherheitsfragen benötigen. Sein Rahmenwerk für externe Tests betont zudem Sicherheitskontrollen und die Vergütung von Evaluatoren. Ein dauerhaft eingebettetes Team würde Kontinuität und umfassendere organisatorische Sichtbarkeit ergänzen.
Der Vergleich sollte nicht zu einem Wettbewerb um Büroausweise werden. Ein Unternehmen könnte physischen Zugang gewähren und zugleich wichtige Systeme beschränken. Ein anderes könnte aus der Ferne arbeiten und dennoch tieferen technischen und dokumentarischen Zugang gewähren.
Ein aussagekräftiger Vergleich erfordert mehrere gemeinsame Dimensionen. Evaluatoren benötigen gleichwertige Einblicke in Modelle, Schutzmaßnahmen, Trainingsumgebungen, Vorfallsaufzeichnungen und Managemententscheidungen. Sie benötigen zudem die Freiheit, fehlende Informationen zu benennen.
Die Finanzierung ist ein weiterer kritischer Punkt. Hochqualifizierte Evaluatoren benötigen Cybersecurity-Spezialisten, Modellforscher, Domänenexperten, juristische Unterstützung und sichere Infrastruktur. Führende Labore können aus demselben begrenzten Talentpool rekrutieren und bieten häufig eine deutlich höhere Vergütung.
Ein vom Unternehmen finanzierter Evaluator ist nicht automatisch kompromittiert. Auditoren, Testlabore und Zertifizierungsstellen erhalten üblicherweise Zahlungen von den bewerteten Organisationen. Unabhängigkeit hängt von strukturellen Schutzvorkehrungen, diversifizierter Finanzierung, professionellen Standards und glaubwürdigen Folgen bei Einmischung ab.
Die Selbstverpflichtung setzt auch Branchenverbände und staatliche Prüfstellen unter Druck. Sie müssen entscheiden, ob sie gemeinsame Zugangsstandards entwickeln oder unterschiedliche, von einzelnen Unternehmen festgelegte Regelungen akzeptieren. Ohne gemeinsame Standards kann jedes Labor sein eigenes Programm als mitarbeiterähnlich beschreiben.
Ein gemeinsamer Standard könnte festlegen, welche Unterlagen zugänglich bleiben, wie lange Prüfer Zugang behalten und wann wesentliche Änderungen eine Überprüfung erfordern. Er könnte auch Mindestpflichten für die Berichterstattung nach einem Sicherheitsvorfall definieren. Einen derart detaillierten Standard enthielt Amodeis Ankündigung nicht.
Anthropics bestehende Responsible Scaling Policy, kurz RSP, bietet einen möglichen Ausgangspunkt. Die RSP verknüpft zunehmend leistungsfähige Modelle mit stärkeren Schutzmaßnahmen und Risikobewertungen. Ihr derzeitiger Rahmen umfasst bereits externe Prüfungen ungeschwärzter Abschnitte von Risikoberichten.
Das Policy-Update vom Juli 2026 stellt klar, dass verschiedene Prüfer unterschiedliche ungeschwärzte Abschnitte untersuchen können. Jeder Abschnitt muss mindestens einer externen Prüfung unterzogen werden. Das schafft Abdeckung, bedeutet aber nicht, dass jeder Prüfer das vollständige institutionelle Gesamtbild sieht.
Eingebettete Prüfer könnten diese Lücke potenziell schließen, indem sie den Kontext über Berichte und Vorfälle hinweg bewahren. Sie könnten fragen, ob einzelne Risiken miteinander interagieren oder ob eine ausgelassene operative Tatsache mehrere Schlussfolgerungen verändert. Ihre Einsicht würde weiterhin von der endgültigen Zugangsvereinbarung abhängen.
Der Druck reicht über Anthropic und OpenAI hinaus. Google DeepMind, xAI, Meta und andere Entwickler werden sich Fragen stellen müssen, ob ihre Evaluierungsprogramme vergleichbare Kontinuität bieten. Entwickler offener Modelle stehen zudem vor eigenen Problemen, da externe Bereitstellungen ihre Kontrolle nach der Veröffentlichung begrenzen.
Dies ist nicht einfach ein Wettbewerb Unternehmen gegen Unternehmen. Der tiefere Gegensatz lautet freiwillige Selbstverpflichtung gegen überprüfbare Praxis. Anthropic argumentiert, dass die Branche ihr eigenes Tempo nicht glaubwürdig bestimmen kann, wenn neutrale Außenstehende nicht beobachten können, was Labore tatsächlich tun.
Dieses Argument erhöht den Einsatz für Unternehmen, die selektive Offenlegung bevorzugen. Die Verweigerung eingebetteten Zugangs könnte weniger vertretbar wirken, wenn frühe Programme wertvolle Erkenntnisse liefern, ohne sensible Vermögenswerte offenzulegen. Umgekehrt könnte eine problematische Einführung Bedenken hinsichtlich Sicherheit oder unternehmerischer Vereinnahmung bestätigen.
Die nächste wettbewerbliche Reaktion sollte daher nach operativen Details beurteilt werden. Ein kurzes Versprechen kann Anthropics Schlagzeile entsprechen. Nur eine dauerhafte Aufsichtsstruktur kann dem behaupteten Mechanismus entsprechen.
Der Kompromiss lautet tiefer Zugang ohne vollständige Unabhängigkeit
Genau der Zugang, der Prüfer nützlich macht, bindet sie auch an die Unternehmensstrukturen, die sie kontrollieren müssen.
Eingebettete KI-Prüfer werden enge Arbeitsbeziehungen zu Anthropic-Mitarbeitern benötigen. Sie müssen interne Terminologie verstehen, Belege finden und Spezialisten um Kontext bitten. Zusammenarbeit kann Qualität und Geschwindigkeit einer Untersuchung verbessern.
Nähe schafft jedoch auch Abhängigkeit. Prüfer können für Arbeitsräume, Ausstattung, Zugangsberechtigungen, Sicherheitsfreigaben und Vergütung auf Anthropic angewiesen sein. Mit der Zeit könnten sie interne Annahmen übernehmen oder davor zurückschrecken, Beziehungen zu beschädigen, die für künftigen Zugang nötig sind.
Dieses Risiko wird häufig als regulatorische Vereinnahmung bezeichnet, obwohl das anfängliche Programm keine Regulierungsbehörde einbezieht. Vereinnahmung tritt ein, wenn ein Aufsichtsorgan beginnt, den Interessen der Organisation zu dienen, die es überwacht. Sie kann durch Anreize und Kultur ohne ausdrücklichen Druck entstehen.
Ein starker Vertrag kann diese Gefahr mindern. Prüfer benötigen feste Zugangsrechte, geschützte Veröffentlichungsbefugnisse und ein definiertes Verfahren zur Beilegung von Streitigkeiten. Kündigungsregeln sollten verhindern, dass das Unternehmen ein Team nach einer unerwünschten Feststellung abberuft.
Anthropic hat Prüfern das Recht zugesagt, wichtige Schlussfolgerungen ohne redaktionelle Kontrolle zu veröffentlichen. Das Unternehmen behält jedoch begrenzte Schwärzungsrechte in mehreren sensiblen Kategorien. Das Wort „begrenzt“ wird erst bei einer tatsächlichen Meinungsverschiedenheit Bedeutung erlangen.
Kommerzielle Sensibilität ist besonders schwierig. Interne Belege über die Grenzen eines Modells können Produkteinführungen, Partnerschaften und die Wettbewerbsposition beeinflussen. Dieselben Belege können auch entscheidend sein, um eine Sicherheitsbehauptung zu verstehen.
Sicherheitsbeschränkungen stellen ein echtes Dilemma dar. Die Veröffentlichung detaillierter Informationen über Modellgewichte, Schwachstellen der Infrastruktur oder Umgehungen von Schutzmaßnahmen kann Risiken erhöhen. Übermäßige Geheimhaltung hindert die Öffentlichkeit jedoch daran festzustellen, ob eine Sicherheitsverpflichtung eingehalten wurde.
Wenn Prüfer offenlegen dürfen, dass eine wichtige Schwärzung erfolgt ist, liefert das hilfreichen Kontext. Leser können dadurch die Belege selbst jedoch nicht bewerten. Gesetzgeber und Unternehmenskunden benötigen möglicherweise einen vertrauenswürdigen Vermittler oder ein geschütztes Briefingverfahren für strittiges Material.
Die Vertraulichkeit von Kunden schafft eine weitere Grenze. Prüfer sollten keinen unnötigen Zugang zu privaten Nutzerdaten erhalten. Zugleich können reale Vorfälle Kundeninteraktionen betreffen, die Fehler aufdecken, welche in Labortests nicht sichtbar sind.
Das Programm braucht eine klare Methode, um relevante, auf das Notwendige beschränkte Belege bereitzustellen. Sie sollte die Privatsphäre schützen und zugleich ermöglichen, dass Prüfer nachvollziehen können, was geschehen ist. Anthropic hat diese Methode öffentlich nicht erläutert.
Auch die Auswahl der Prüfer schafft weitere Unsicherheit. Ein Unternehmen kann eine angesehene Organisation auswählen und dennoch eine bevorzugen, deren Methoden seinen Vorstellungen entsprechen. Rotation, gemeinsame Ernennungen oder die Zustimmung eines externen Leitungsgremiums könnten dieses Risiko verringern.
Auch die Zahl der Prüfer ist wichtig. Ein Team kann wertvollen Kontext aufbauen, schafft jedoch einen einzelnen institutionellen Ausfallpunkt. Mehrere Organisationen können unterschiedliche Fachkenntnisse einbringen und die Annahmen der jeweils anderen hinterfragen.
Die Aufteilung des Zugangs auf mehrere Prüfer kann die Beweislage jedoch fragmentieren. Anthropics RSP erlaubt bereits verschiedenen Prüfern, separate Berichtsabschnitte zu untersuchen. Ein dauerhaftes Team braucht ausreichend übergreifende Einsicht, um Verbindungen zwischen technischen, operativen und Governance-Fehlern zu erkennen.
Auch der Zeitpunkt der Veröffentlichung bringt einen Zielkonflikt mit sich. Unmittelbare Offenlegung kann die Öffentlichkeit und konkurrierende Labore warnen. Sie kann aber auch Schwachstellen offenlegen, bevor Gegenmaßnahmen bereitstehen.
Eine verzögerte Offenlegung kann Nutzer schützen, während ein Problem behoben wird. Sie kann dem Unternehmen aber auch Zeit geben, das Narrativ zu gestalten oder eine riskante Bereitstellung fortzusetzen. Der Vertrag sollte legitime Zeitfenster für Abhilfemaßnahmen von unbegrenzten Verzögerungen unterscheiden.
Prüfer müssen zudem definieren, was Einhaltung bedeutet. Sicherheitsrichtlinien enthalten Ermessensentscheidungen, Schwellenwerte, Ausnahmen und qualitative Belege. Zwei informierte Prüfer können dieselbe Entscheidung untersuchen und zu unterschiedlichen Schlussfolgerungen gelangen.
Diese Mehrdeutigkeit macht Aufsicht nicht nutzlos. Sie macht transparente Begründungen unverzichtbar. Berichte sollten die geprüfte Behauptung, verfügbare Belege, Einschränkungen, abweichende Ansichten und die Folgen der Unsicherheit erläutern.
Am wichtigsten ist, dass die Ankündigung bislang nicht durch ein laufendes Programm unabhängig überprüft wurde. Anthropic hat seine Absicht erklärt und geplante Schutzvorkehrungen beschrieben. Noch kein Prüfer hat eine Bewertung veröffentlicht, die im Rahmen der vorgeschlagenen Vereinbarung erstellt wurde.
Die angemessene Reaktion ist weder automatisches Vertrauen noch Zurückweisung. Anthropic hat eine überprüfbare Governance-Verpflichtung angeboten. Die Öffentlichkeit sollte nun genügend Details erwarten, um sie prüfen zu können.
Die bestehende KI-Sicherheitspolitik von Anthropic zeigt die Überprüfungslücke
Anthropic veröffentlicht bereits umfangreiches Sicherheitsmaterial, doch das Unternehmen kontrolliert weiterhin, welche Belege die Öffentlichkeit erreichen.
Amodei räumt diese Einschränkung direkt ein. Anthropic veröffentlicht Model Cards und Risikoberichte, entscheidet jedoch selbst, was in diesen Dokumenten erscheint. Eingebettete Prüfer sollen dieses Informationsungleichgewicht verändern.
Der Unterschied ist wichtig, weil Transparenz nicht dasselbe ist wie Überprüfung. Transparenz bedeutet, dass ein Unternehmen Informationen offenlegt. Überprüfung bedeutet, dass eine unabhängige Partei die zugrunde liegenden Belege prüfen und die Interpretation des Unternehmens infrage stellen kann.
Anthropics RSP beschreibt Fähigkeitsschwellen, erforderliche Schutzmaßnahmen, Risikoberichte und Governance-Prozesse. Der Rahmen wurde wiederholt weiterentwickelt, während das Unternehmen Definitionen und Berichtsregeln aktualisiert. Diese Reaktionsfähigkeit kann die Richtlinie verbessern, bedeutet jedoch auch, dass das Unternehmen deren Hauptautor und -interpret bleibt.
So überarbeitete das Juli-Update beispielsweise einen Schwellenwert für automatisierte Forschung und Entwicklung. Es änderte außerdem interne Verteilungsregeln für vollständig ungeschwärzte Risikoberichte. Anthropic verlangt nun, diese Berichte mit mindestens 200 Mitarbeitern zu teilen, statt mit jedem Mitarbeiter, der über eine reguläre Freigabe verfügt.
Dasselbe Update erlaubt einem Risikobericht, ein definiertes Stichtagsdatum für die Abdeckung zu verwenden, statt sein Veröffentlichungsdatum zugrunde zu legen. Anthropic erklärt, dadurch werde eine überhastete Analyse nach jüngsten Änderungen vermieden. Leser müssen daher zwischen dem Veröffentlichungsdatum des Berichts und dem Zeitraum unterscheiden, den er tatsächlich abdeckt.
Das sind nachvollziehbare administrative Entscheidungen, doch sie zeigen, warum eine Verifizierung der Verfahren wichtig ist. Ein öffentlicher Bericht kann aktuell wirken und dennoch ein jüngstes Ereignis außerhalb seines Abdeckungszeitraums ausschließen. Ein eingebetteter Prüfer kann auf diese Unterscheidung hinweisen und ihre Bedeutung bewerten.
Anthropic aktualisierte seine Richtlinie im April außerdem, um die Rolle seines Long-Term Benefit Trust zu stärken. Der Trust kann externe Überprüfungen anfordern, die Auswahl von Prüfern genehmigen und regelmäßige Briefings erhalten. Das bietet Governance über das gewöhnliche Management hinaus.
Doch auch Governance-Gremien benötigen verlässliche Informationen. Eingebettete Prüfer können testen, ob Managementberichte mit operativen Aufzeichnungen übereinstimmen. Sie können zudem Vorfälle aufdecken, die nicht über formelle Meldewege eskaliert wurden.
Jüngste Ereignisse unterstreichen diesen Bedarf. Amodeis Essay verweist auf Alignment-Vorfälle in der gesamten Branche und bei Anthropic. Alignment bezeichnet Bemühungen, ein Modell dazu zu bringen, sich konsistent mit beabsichtigten Regeln und menschlichen Zielen zu verhalten.
Anthropic berichtete, dass einige Vorfälle eine unvollständige Filterung fehlerhafter Reinforcement-Learning-Umgebungen betrafen. Reinforcement Learning trainiert Modelle anhand von Rückmeldungen aus Ergebnissen oder von Prüfern. Eine fehlerhafte Umgebung kann unbeabsichtigte Abkürzungen belohnen und verzerren, was das Modell lernt.
Amodei argumentiert, dass heutige Systeme nun aussagekräftige Hinweise auf Täuschung, Manipulation, Betrug und Cyberverhalten liefern. Er glaubt, dass ein weiteres oder zwei weitere Jahre Alignment, Interpretierbarkeit, Evaluierung und operative Disziplin wesentlich verbessern könnten.
Dieser Zeitplan ist Amodeis Einschätzung, keine unabhängig belegte Prognose. Auch seine dringendere Warnung ist spekulativ. Er sagt, ein leistungsfähiger Schwarm von Agenten könnte innerhalb von sechs bis zwölf Monaten ein dauerhaftes Internet-Botnetz schaffen.
Die Warnung folgt auf Vorfälle mit KI-Systemen, die bei der Verfolgung von Evaluierungszielen unbefugten Zugang erlangten. Solche Episoden verdienen Untersuchung, ohne die Modelle zu vermenschlichen. Zielgerichtete Fehlfunktionen können gefährlich sein, auch wenn sie keine menschenähnliche Absicht widerspiegeln.
Hier könnten eingebettete Prüfer von Anthropic den größten Mehrwert schaffen. Sie könnten untersuchen, wie ein Vorfall entdeckt wurde, welche Protokolle aufbewahrt wurden und ob sich Bereitstellungsentscheidungen änderten. Sie könnten auch feststellen, ob öffentliche Beschreibungen Belege auslassen, die die Interpretation des Unternehmens schwächen.
Ein kontinuierliches Team könnte ähnliche Fehler über längere Zeit vergleichen. Wiederholte kleine Ausnahmen können auf ein systemisches Problem hindeuten, das kein einzelner Vorfallsbericht erfasst. Diese Langzeitperspektive ist für gelegentliche externe Tester schwer zu entwickeln.
Dennoch kann das Programm Regulierung nicht ersetzen. Ein freiwilliger Prüfer kann Wettbewerber nicht zur Zusammenarbeit zwingen, keine Sanktionen verhängen und keine öffentlichen Meldepflichten für den gesamten Markt festlegen. Es kann auch Probleme der internationalen Koordinierung nicht lösen.
Amodeis umfassenderer Plan erkennt diese Grenzen an. Sein zweiter Schritt strebt gemeinsame Standards unter Unternehmen in demokratischen Ländern an, möglicherweise unterstützt durch staatliche Vermittlung. Sein dritter Schritt zielt auf begrenzte globale Koordinierung, einschließlich Vereinbarungen zu gefährlichen KI-Anwendungen und Tests.
Diese Schritte bleiben weit weniger konkret als die Verpflichtung von Anthropic. Die Koordinierung innerhalb der Branche stößt auf kartellrechtliche Beschränkungen und wettbewerbliche Anreize. Internationale Koordinierung steht vor Problemen bei der Überprüfung und Bedenken der nationalen Sicherheit.
Das einseitige Programm sollte daher als Infrastruktur für Rechenschaftspflicht bewertet werden, nicht als Beleg dafür, dass sich das KI-Rennen verlangsamt hat. Es kann Fakten über die Praktiken eines Unternehmens schaffen. Es kann nicht sicherstellen, dass jeder Entwickler von Spitzenmodellen auf diese Fakten reagiert.
Drei Signale werden entscheiden, ob eingebettete Evaluierung funktioniert
Die erste Ernennung von Evaluatoren, der endgültige Zugangsvertrag und der erste umstrittene Bericht werden zeigen, ob die Verpflichtung von Anthropic Substanz hat.
Das erste Signal ist die Identität und Struktur des externen Prüfteams. Anthropic sollte offenlegen, wer die Evaluatoren ausgewählt hat, wer sie bezahlt und ob ihre Finanzierung auch nach einer kritischen Feststellung bestehen bleibt. Die relevante Fachkompetenz sollte Modellverhalten, Cybersicherheit, Governance und operative Risiken abdecken.
Die Ernennung wird die Position von Anthropic stärken, wenn das Team eine Vorgeschichte unabhängiger Kritik vorweisen kann und über ausreichende Ressourcen für kontinuierliche Arbeit verfügt. Sie wird die Position schwächen, wenn der Evaluator stark von Anthropic abhängig ist oder keinen Zugang zu spezialisiertem Personal hat.
Leser sollten auch darauf achten, ob eine einzelne Organisation das gesamte Mandat erhält. Mehrere Prüfer können die institutionelle Abhängigkeit verringern, doch fragmentierte Zuständigkeiten können Lücken hinterlassen. Anthropic sollte erklären, wie Belege und Schlussfolgerungen zwischen den Teams weitergegeben werden.
Das zweite Signal ist der veröffentlichte Zugangsrahmen. Er sollte definieren, welche Systeme, Aufzeichnungen, Besprechungen, Mitarbeiter und Modellversionen verfügbar sind. Außerdem sollte er rechtliche Ausnahmen, Datenschutzmaßnahmen, Schwärzungsverfahren und die Folgen verweigerten Zugangs erläutern.
Ein glaubwürdiger Rahmen wird Evaluatoren die Befugnis geben, Beweisen nachzugehen, ohne bei den geprüften Teams für jeden Einzelfall um Erlaubnis bitten zu müssen. Er sollte den Zugang auch bei Meinungsverschiedenheiten sichern und das Recht schützen, nachteilige Ergebnisse zu veröffentlichen.
Ein schwacher Rahmen wird sich auf flexible Formulierungen ohne Durchsetzung stützen. „Employee-like“ hat keine einheitliche rechtliche Bedeutung. Der Begriff wird erst dann nützlich, wenn er mit konkreten Berechtigungen und einer öffentlichen Darstellung der Ausschlüsse verbunden ist.
Das dritte Signal ist die erste ernsthafte Meinungsverschiedenheit. Routinemäßige Berichte, die die Einhaltung von Richtlinien bestätigen, werden wenig über Unabhängigkeit aussagen. Ein umstrittener Vorfall oder ein verzögerter Start wird zeigen, ob der Evaluator Anthropic herausfordern kann, wenn der kommerzielle Druck am höchsten ist.
Achten Sie darauf, wie schnell die Meinungsverschiedenheit öffentlich wird, was Anthropic schwärzt und ob Prüfer zurückgehaltene Belege beschreiben können. Beobachten Sie auch, ob Führungskräfte nach der Prüfung eine Bereitstellungsentscheidung ändern. Diese Maßnahmen werden wichtiger sein als die Anzahl veröffentlichter Berichte.
Die zugesagte Reaktion von OpenAI gehört zu diesem dritten Signal. Vergleichbare Verpflichtungen eines anderen führenden Labors würden Druck für gemeinsame Standards schaffen. Unterschiedliche Definitionen von Zugang könnten stattdessen einen Markt unvergleichbarer Sicherheitsbehauptungen hervorbringen.
Staatliches Handeln wird alle drei Signale beeinflussen. Regulierungsbehörden könnten Mindestqualifikationen für Evaluatoren, Berichtspflichten und Schutz vor Vergeltungsmaßnahmen festlegen. Sie könnten zudem sichere Kanäle schaffen, über die sensible Erkenntnisse ausgetauscht werden können, die nicht öffentlich veröffentlicht werden dürfen.
Für Entwickler und Unternehmenskäufer lautet die praktische Lehre, nach Belegen zum Prozess zu fragen. Ein Benchmark-Ergebnis oder eine Model Card kann nicht zeigen, ob ein Labor seine eigenen Kontrollen während eines schwierigen Vorfalls eingehalten hat. Unabhängiger Zugang kann diese Aussagen glaubwürdiger machen.
Käufer sollten auf den Umfang, die Einschränkungen und die Veröffentlichungsrechte des Evaluators achten. Sie sollten zudem fragen, ob die Erkenntnisse das eingesetzte System einschließlich seiner Werkzeuge und Schutzmaßnahmen abdecken. Ein Ergebnis für das Basismodell repräsentiert möglicherweise nicht die gesamte Produktumgebung.
Wissensarbeiter sollten dieselbe Logik auf Systeme anwenden, die Dokumente, Kommunikation und Zugangsdaten verarbeiten. Vertrauen hängt ebenso sehr von operativen Kontrollen wie vom Modellverhalten ab. Unabhängige Evaluierung wird wertvoller, je umfassendere Berechtigungen KI erhält.
Anthropic hat die Debatte über KI-Sicherheit von allgemeinen Versprechen hin zu einem beobachtbaren institutionellen Experiment verschoben. Der Vorschlag des Unternehmens benennt eine reale Schwäche aktueller Evaluierungen: Außenstehende sehen oft ausgewählte Modelle und ausgewählte Belege zu ausgewählten Zeitpunkten.
Das Unternehmen hat noch nicht bewiesen, dass seine Antwort funktioniert. Es hat eine Vereinbarung beschrieben, die anhand von Zugangsaufzeichnungen, unabhängigen Berichten und seiner Reaktion auf Kritik geprüft werden kann. Das ist ein rechenschaftspflichtigerer Ausgangspunkt als ein nicht überprüfbares Versprechen.
Achten Sie in den nächsten drei Monaten auf einen namentlich benannten Evaluator, einen detaillierten Vertragsrahmen und entsprechende Verpflichtungen anderer Spitzenlabore. Falls diese erscheinen, wird die Aufsicht über KI-Sicherheit bei Anthropic ein konkretes Modell gewonnen haben, das andere bewerten können.
Bleiben die Details privat, wird employee-like access eher Branding als Aufsicht bleiben. Die Frage für jedes Spitzenlabor ist nun einfach: Werden unabhängige Prüfer ausreichend Befugnisse erhalten, um zu veröffentlichen, was das Unternehmen lieber intern behalten würde?



