Anthropic-KI-Entwicklungsmetriken zeigen den Wettlauf zwischen Automatisierung und Aufsicht
Anthropic hat drei Kennzahlen zur KI-Entwicklung veröffentlicht, nachdem das Unternehmen festgestellt hatte, dass Claude inzwischen 26 % der gemessenen Forschungs- und Entwicklungsarbeit an seinen Modellen anführt. Im Februar 2026 lag dieser Anteil laut Unternehmen noch unter 1 %. Der Anstieg wirft eine schwierige Frage auf: Kann sich die Aufsicht ebenso schnell verbessern wie die Systeme, die die Forschung durchführen?
Das neue Framework misst KI-gestützte Forschung, die Überwachung interner Agenten und die Verteilung von Rechenkapazitäten. Anthropic veröffentlichte zudem eine interne Momentaufnahme für jede Kategorie. Das Unternehmen stellt diese Messgrößen als Möglichkeit dar, Außenstehenden Einblick in Aktivitäten zu geben, die in Frontier-Laboren normalerweise verborgen bleiben.
Dies ist kein Beleg dafür, dass Claude seinen Nachfolger autonom entwerfen und bereitstellen kann. Anthropic zufolge bleibt Claude in allen gemessenen Forschungskategorien unterhalb vollständiger Autonomie. Die Daten deuten jedoch darauf hin, dass beaufsichtigte KI inzwischen wesentliche Teile der Arbeit übernimmt, die für leistungsfähigere Modelle nötig sind.
Der Zeitpunkt ist relevant. Anthropic-CEO Dario Amodei hat koordinierte Maßnahmen gefordert, um das Tempo der Frontier-Entwicklung zu kontrollieren. Zugleich stehen Wettbewerber vor demselben Anreiz, Forschung zu automatisieren, ohne offenzulegen, wie stark ihre internen Modelle diesen Prozess prägen.
Anthropic-KI-Entwicklungsmetriken machen interne Automatisierung nachvollziehbar
Anthropic hat die interne KI-Nutzung zu einem messbaren Entwicklungsfaktor gemacht, statt sie als informelle Produktivitätsgeschichte zu behandeln.
Das Messframework des Unternehmens umfasst drei Bereiche der Frontier-Modellentwicklung. Der erste schätzt, wie viel Forschung Claude übernimmt. Der zweite verfolgt, ob Anthropic seine internen Agenten beobachten und unterbrechen kann. Der dritte untersucht, wie das Unternehmen Rechenkapazitäten zwischen Sicherheit und anderer Forschung aufteilt.
Die zentrale Zahl stammt aus dem Anthropic R&D Automation Index. Anthropic erstellte den Index, indem es die Aufgaben katalogisierte, die bei der Entwicklung seiner Modelle anfallen. Anschließend ordnete das Unternehmen jeder Aufgabe einen Automatisierungsgrad zu und gewichtete sie anhand der geschätzten Arbeitszeit von Mitarbeitenden.
Anthropic zufolge führte Claude im August 2026 26 % seiner gemessenen KI-Forschungs- und Entwicklungsarbeit an. „Anführen“ bedeutet, dass ein Modell den Großteil einer Aufgabe auf Grundlage einer übergeordneten Anweisung erledigt, während ein Mensch das Ergebnis überwacht und freigibt.
Mehr als 90 % der gemessenen Arbeit erreichten mindestens die Stufe „arbeitet zusammen“. Auf dieser Stufe erledigt Claude große Teile einer Aufgabe unter enger menschlicher Anleitung. Keine gemessene Kategorie erreichte vollständige Autonomie, bei der Menschen aus dem operativen Kreislauf entfernt wären.
Der Index verwendet eine sechsstufige Skala, die von Epoch AI vorgeschlagen wurde. Die Automatisierungsskala reicht von keiner KI-Beteiligung über Unterstützung, Zusammenarbeit und Führung bis zur vollständigen Autonomie. Epoch warnt, dass solche Bewertungen subjektiv bleiben und bessere Bewertungsmethoden erfordern.
Anthropic erstellte seinen Aufgabenkatalog anhand von Slack-Aufzeichnungen und interner Dokumentation. In jeder Woche im Juli zog das Unternehmen eine Stichprobe von 20 % der Mitarbeitenden aus Abteilungen, die an der Modellentwicklung beteiligt waren. Claude-Agenten extrahierten aus diesen Aufzeichnungen rund 15.000 detaillierte Aufgaben.
Das Unternehmen organisierte diese Aufgaben in einem Baum mit 542 Knoten. Davon waren 378 einzelne Aufgabenkategorien. Beispiele umfassten die Diagnose von Fehlern auf Evaluierungsplattformen, die Verwaltung von Netzwerk-Richtlinien für Reinforcement Learning und die Überprüfung von Serving-Vorfällen.
Diese Breite ist bedeutsam, weil Software-Benchmarks nur ausgewählte Fähigkeiten unter kontrollierten Bedingungen messen. Anthropics Index fragt stattdessen, an welchen Stellen KI am tatsächlichen Produktionsprozess neuer Modelle beteiligt ist.
Ein internes Beispiel zeigt, was „anführen“ in der Praxis bedeutet. Wenn eine nächtliche Datenpipeline ausfällt, kann Claude Protokolle untersuchen, die Ursache identifizieren, eine Fehlerbehebung erstellen, Tests ausführen und seine Arbeit dokumentieren. Ein Mensch prüft die Änderung weiterhin und entscheidet, ob sie bereitgestellt wird.
Das unterscheidet sich wesentlich von autonomer Forschung. Das Modell entscheidet nicht eigenständig, welche Systeme Aufmerksamkeit benötigen, legt nicht die Forschungsagenda fest und autorisiert keine Änderungen in der Produktion. Die Zahl von 26 % misst delegierte Ausführung unter Aufsicht, nicht unabhängige Kontrolle über Anthropics Labor.
Dennoch verdient der Sprung von unter 1 % auf 26 % innerhalb von sechs Monaten genaue Prüfung. Er deutet darauf hin, dass KI-gestützte Entwicklung sich von punktueller Programmierunterstützung hin zu End-to-End-Verantwortung für Aufgaben bewegt. Zudem liefert er Regierungen und konkurrierenden Laboren eine konkrete Kennzahl, die sie hinterfragen oder reproduzieren können.
Die Zahlen erhöhen den Druck auf andere Frontier-Labore
Anthropics Offenlegung setzt Wettbewerber unter Druck, zu erklären, wie ihre eigenen internen Modelle die Entwicklung beschleunigen und wie diese Systeme kontrolliert werden.
Frontier-Labore veröffentlichen häufig Fähigkeitsbewertungen für öffentliche Modelle. Diese Berichte beschreiben, was ein Modell nach seiner Entwicklung leisten kann. Sie verraten deutlich weniger darüber, wie fortgeschrittene Systeme vor der Veröffentlichung im Labor eingesetzt wurden.
Diese Unterscheidung schafft eine Transparenzlücke. Ein Unternehmen kann sein stärkstes Modell intern für Forschung, Programmierung, Evaluierung und Datenarbeit einsetzen, bevor Außenstehende es testen können. Das interne System kann seinen Nachfolger beeinflussen und zugleich in herkömmlichen öffentlichen Benchmarks fehlen.
Forschende haben argumentiert, dass die interne Nutzung von Modellen eigene Berichtspflichten verdient. Eine Studie aus dem Jahr 2026 über interne Risikoberichterstattung stellte fest, dass Frontier-Unternehmen fortgeschrittene Systeme Wochen oder Monate vor ihrer öffentlichen Veröffentlichung intern betreiben können. In diesem Zeitraum können Risiken entstehen, die externe Evaluierende nicht beobachten können.
Anthropics Framework bietet darauf eine Antwort. Statt nur zu fragen, ob ein Modell einen Benchmark besteht, misst der Index seine Rolle in einer funktionierenden Forschungsorganisation. Aufsichtsmetriken fragen anschließend, ob die Überwachungsabdeckung mit dieser Rolle Schritt hält.
Der unmittelbare Druck trifft OpenAI, Google DeepMind, xAI, Meta und andere Entwickler fortgeschrittener Modelle. Jedes Unternehmen nutzt unterschiedliche interne Systeme und Organisationsstrukturen. Direkte Vergleiche blieben ohne gemeinsame Definitionen, Stichprobenverfahren und unabhängige Überprüfung schwierig.
Dennoch sendet auch die Verweigerung einer Berichterstattung ein Signal. Sobald ein Labor den Anteil der von KI angeführten Forschung veröffentlicht, wird Schweigen andernorts auffälliger. Politische Entscheidungsträger können fragen, warum vergleichbare Kennzahlen von Unternehmen fehlen, die ähnliche Systeme entwickeln.
Das Framework erschwert zudem Behauptungen über eine KI-„Selbstverbesserungsschleife“. Anthropics Zahlen zeigen bedeutende Automatisierung, ohne rekursive Selbstverbesserung zu belegen, die voraussetzen würde, dass ein Modell autonom einen leistungsstärkeren Nachfolger entwickelt.
Der Großteil der gemessenen Arbeit beinhaltet weiterhin menschliche Anleitung oder Freigabe. Anthropics Risikobewertung vom August erklärte zudem, das Unternehmen habe nicht beobachtet, dass KI eine anhaltende Verdopplung des Entwicklungstempos verursacht habe. Seine Modelle seien nicht annähernd in der Lage gewesen, die Forschungswissenschaftler und Ingenieure des Unternehmens zu ersetzen.
Der Unterschied ist für die öffentliche Debatte wichtig. „Claude hilft beim Aufbau von Claude“ ist im Großen und Ganzen zutreffend, fasst jedoch mehrere Automatisierungsstufen in einer Aussage zusammen. Ein System, das unter Aufsicht Pipelines repariert, birgt andere Risiken als eines, das Forschungsrichtungen auswählt und Änderungen eigenständig bereitstellt.
Anthropics Offenlegung erhöht daher den Evidenzstandard für alle, auch für Anthropic selbst. Wenn Labore wollen, dass politische Entscheidungsträger auf interne Beschleunigung reagieren, benötigen sie wiederholbare Messungen statt dramatischer Beschreibungen.
Eine gemeinsame Berichterstattung würde zudem offenlegen, ob Labore Erfolg unterschiedlich definieren. Ein Unternehmen könnte KI-generierten Code als automatisierte Arbeit zählen. Ein anderes könnte nur Aufgaben zählen, die ohne kontinuierliches menschliches Eingreifen abgeschlossen werden. Diese Entscheidungen können zu nicht vergleichbaren Prozentwerten führen.
Ein gemeinsames Framework würde Entwickler dazu zwingen, den Nenner zu benennen. Es würde klären, ob Messungen Engineering, Forschungsplanung, das Design von Evaluierungen, Bereitstellung oder nur leicht instrumentierbare Aufgaben abdecken.
Bis dahin eignet sich Anthropics Zahl von 26 % am besten als Basiswert innerhalb eines Unternehmens. Ihr größter Wert liegt darin, Veränderungen unter einer stabilen Methode sichtbar zu machen, nicht darin, eine voreilige Rangliste zu stützen.
Der Anthropic R&D Automation Index misst Arbeit, nicht Intelligenz
Der Index verfolgt Veränderungen in einem Produktionsprozess, kann aufgrund seines Designs jedoch nicht feststellen, wie intelligent oder autonom Claude geworden ist.
Anthropic hat einen Aufgabenbestand der Forschung eingefroren, um die Automatisierung im Zeitverlauf vergleichen zu können. Dieser Ansatz ähnelt einem Preisindex, bei dem ein konsistenter Satz von Positionen Veränderungen leichter interpretierbar macht. Er schafft jedoch auch ein bekanntes Messproblem, wenn sich die zugrunde liegende Arbeit verändert.
Wenn Forschende keine Routinetätigkeiten mehr ausführen und zu schwierigeren Aufgaben übergehen, kann die Automatisierung steigen, ohne einen gleichwertigen Anteil des gesamten Forschungswerts zu ersetzen. Ein fester Aufgabenbestand erfasst das Verschwinden alter Arbeit zuverlässiger als die Entstehung neuer Arbeit.
Anthropic untersuchte dieses Problem, indem es Aufgabenstrukturen aus Januar und Juli 2026 verglich. Das Unternehmen erklärt, die Analyse habe auf der gewählten Detailstufe kein Wachstum neuer Aufgabenkategorien ergeben. Dennoch plant es, den Aufgabenbestand regelmäßig neu aufzubauen und zu versionieren.
Die Gewichtung stellt eine weitere Herausforderung dar. Anthropic nutzt die Arbeitszeit von Mitarbeitenden als Näherungswert für die Bedeutung einer Aufgabe. Dadurch erhalten Tätigkeiten mit höherem Zeitaufwand mehr Gewicht, doch Zeit und wissenschaftlicher Wert sind nicht gleichzusetzen.
Eine kurze Entscheidung über die Forschungsrichtung kann wichtiger sein als Wochen der Umsetzung. Interviews von Epoch AI ergaben, dass Planung und Hypothesenbildung weniger Zeit beanspruchen können, zugleich aber entscheidend für den Projekterfolg bleiben. Engineering und Fehlersuche dauern länger und scheinen besser automatisierbar zu sein.
Dieses Muster kann einen Automatisierungsindex erhöhen, bevor KI die folgenreichsten Entscheidungen kontrolliert. Claude könnte Experimente ausführen, Infrastruktur reparieren und Ergebnisse analysieren, während Menschen weiterhin entscheiden, welche Fragen es wert sind, gestellt zu werden.
Der Bewertungsprozess fügt eine weitere Unsicherheitsebene hinzu. Claude-Agenten sammelten Belege zu internen Aufgaben, und ein separater Claude-Richter ordnete Automatisierungsstufen zu. Der Einsatz verwandter Modelle zur Bewertung der Modellbeteiligung birgt das Risiko korrelierter Fehler.
Anthropic verglich diese Urteile mit Bewertungen von Mitarbeitenden, die für die jeweilige Arbeit verantwortlich waren. Das Unternehmen berichtet in 59 % der Fälle eine exakte Übereinstimmung zwischen Modell und Menschen. Zwei menschliche Bewertende stimmten nur in 35 % der Fälle exakt überein.
Modell- und menschliche Bewertungen lagen in 97 % der Fälle höchstens eine Automatisierungsstufe auseinander. Diese Ergebnisse deuten darauf hin, dass die Skala grobe Unterschiede erfassen kann. Sie zeigen zugleich erhebliche Unklarheiten an der Grenze zwischen Zusammenarbeit und Führung.
Diese Grenze bestimmt die Schlagzeile. Wenn eine Aufgabe von Stufe drei auf Stufe vier wechselt, wird aus KI-Zusammenarbeit KI-Führung. Beide Stufen beinhalten jedoch weiterhin eine erhebliche menschliche Beteiligung.
Der Index hängt außerdem von sensiblen internen Aufzeichnungen ab. Unabhängige Prüfer bräuchten Zugang zu Arbeitsergebnissen von Mitarbeitenden, Agenten-Transkripten, Aufgabendefinitionen und Gewichtungsentscheidungen. Dieser Zugang wirft Fragen zu Privatsphäre, Sicherheit und Wettbewerb auf.
Anthropic plant, externe Evaluierende mit einem Zugang auszustatten, der mit dem interner Risikoteams vergleichbar ist. Diese Zusage ist folgenreicher als die bloße Veröffentlichung einer Methodik. Externe Evaluierende benötigen genügend Zugang, um Klassifizierungen zu reproduzieren und ausgelassene Arbeitslasten zu prüfen.
Für Engineering-Organisationen unterstreicht das Framework zudem eine praktische Herausforderung bei der Dokumentation. Automatisierte Arbeit lässt sich nur schwer auditieren, wenn Entscheidungen über Nachrichten, Code-Reviews, Agentenprotokolle und Experiment-Logs verteilt bleiben.
Eine durchsuchbare Engineering-Wissensdatenbank kann Teams helfen, menschliche Entscheidungen neben KI-generierten Artefakten zu bewahren. Diese Dokumentation löst das Problem der unabhängigen Verifizierung nicht, macht interne Rechenschaftspflicht jedoch praktikabler.
Der Index sollte daher als operativer Indikator verstanden werden. Er misst, wie Anthropic Arbeit derzeit zwischen Menschen und Claude aufteilt. Er misst weder Bewusstsein noch allgemeine Intelligenz oder einen unvermeidlichen Weg zur autonomen Selbstverbesserung.
Dreißigtausend Agenten machen Aufsicht zu einem Durchsatzproblem
Anthropics interne Agentenskala bedeutet, dass Sicherheit von Überwachungssystemen abhängt, die enorme Aktivitätsmengen filtern können, ohne seltene, folgenschwere Fehler zu übersehen.
Anthropic berichtet, dass im August zu jedem Zeitpunkt etwa 30.000 Agenten Forschungs- und Engineering-Arbeit auf seiner meistgenutzten internen Plattform erledigten. Die Messungen beziehen sich auf diese Plattform, nicht auf jedes im Unternehmen eingesetzte Agentensystem.
Jede Aktion auf der gemessenen Plattform durchläuft laut Anthropic vor ihrer Ausführung einen Online-Monitor. Ein Online-Monitor bewertet eine Aktion in Echtzeit und kann sie blockieren oder den Agenten umleiten. Anthropic zufolge dauert dieser Prozess üblicherweise Sekunden.
Das Unternehmen speist zudem jede Aktion in ein Offline-Monitoring-System ein. Das Offline-Monitoring untersucht abgeschlossene Aktivitäten auf Muster, die sich langsam entwickeln, einschließlich möglicher Fehlanpassungen über längere Sequenzen hinweg.
Diese beiden Ebenen adressieren unterschiedliche Fehlermodi. Ein Online-System kann einen schnellen Versuch stoppen, Modellgewichte zu kopieren. Ein Offline-System kann Verhalten untersuchen, das erst nach mehreren Aktionen oder Interaktionen verdächtig wird.
Anthropic analysierte im August mehr als eine Milliarde Agentenentscheidungen. Sein Online-Monitor blockierte 0,002 % davon, also etwa eine von 47.000 Entscheidungen.
Diese niedrige Rate lässt zwei Deutungen zu. Die Agenten könnten nur selten gefährliche Aktionen versuchen, oder der Monitor könnte nur eine enge Teilmenge problematischen Verhaltens erkennen. Die Zahl allein kann diese Erklärungen nicht voneinander unterscheiden.
Das Offline-Monitoring markiert etwa ein oder zwei Transkripte pro Tausend zur weiteren Prüfung. Anthropic zufolge gelangen wöchentlich rund 100.000 Transkripte in eine zusätzliche automatisierte Überprüfung. Etwa 50 Fälle mit hoher Priorität erreichen menschliche Prüfer.
Die Reduktion von 100.000 maschinellen Markierungen auf etwa 50 an Menschen eskalierte Fälle zeigt, weshalb Aufsicht ein Durchsatzproblem ist. Menschen können bei dieser Größenordnung nicht jede Agentenaktion manuell prüfen. Sie sind auf Klassifikatoren angewiesen, die entscheiden, was Aufmerksamkeit verdient.
Abdeckung ist daher notwendig, aber nicht ausreichend. Ein Monitor kann technisch 100 % der Aktionen prüfen und dennoch unbekannte Angriffsstrategien übersehen. Die wichtigste Frage ist deshalb der Recall: Wie oft erkennt das System bekanntes und neu entwickeltes gefährliches Verhalten?
Anthropic räumt ein, diese Form der Überwachung seit Monaten, nicht seit Jahren zu betreiben. Das Unternehmen sagt zudem, dass sich die Wissenschaft der Beaufsichtigung großer Agentenpopulationen erheblich verändern werde.
Unabhängige Untersuchungen liefern einige Hinweise darauf, dass externe Prüfung helfen kann. METR verbrachte Anfang 2026 drei Wochen damit, Agenten-Monitore per Red Team zu testen. Die Untersuchung fand mehrere neuartige Schwachstellen, von denen Anthropic einige später behob.
METR erklärte, die Ergebnisse hätten die zentralen Aussagen des betreffenden Anthropic-Risikoberichts nicht schwerwiegend beeinträchtigt. Öffentlich wurde jedoch nur eine geschwärzte Zusammenfassung. Das begrenzt die externe Bewertung der Angriffe, Abwehrmaßnahmen und verbleibenden Schwächen.
Anthropics Identitätssystem weist jedem Agenten über Modell-Upgrades hinweg eine dauerhafte Identität zu. Die internen Agenten des Unternehmens kommunizieren über gemeinsame, zuordenbare Nachrichten statt über private Kanäle. Diese Designentscheidungen ermöglichen es Monitoren, Aktionen und Behauptungen einzelnen Agenten zurückzuverfolgen.
Eine dauerhafte Identität hilft Agenten außerdem, Nachrichten anderer Agenten als Behauptungen zu behandeln, die verifiziert werden müssen. Sie verringert die Wahrscheinlichkeit, dass in einer Gruppe zirkulierende Informationen nicht mehr vom eigenen Schlussfolgern eines Agenten zu unterscheiden sind.
Offene Kommunikation schafft einen umfassenderen Prüfpfad, garantiert aber kein unabhängiges Verhalten. Agenten, die von ähnlichen Modellen angetrieben werden, können blinde Flecken teilen. Auch ein Überwachungsmodell aus derselben Familie kann jene Denkfehler reproduzieren, die es erkennen soll.
Das ist der zentrale Konflikt in Anthropics System. Das Unternehmen benötigt Automatisierung zur Überwachung von Automatisierung, weil menschliche Prüfung mit dem Volumen nicht mithalten kann. Doch jede automatisierte Ebene schafft ein weiteres modellabhängiges Urteil, das validiert werden muss.
Compute-Allokation bietet Transparenz mit begrenztem Blickfeld
Compute lässt sich leichter zählen als Forschungsqualität, doch Anthropics einwöchige Momentaufnahme kann nicht belegen, ob die Sicherheitsinvestitionen Schritt halten.
Anthropic untersuchte sämtliche Rechenkapazität, die vom 13. bis 20. Juli 2026 genutzt wurde. Das Unternehmen klassifizierte Workloads in mehrere Kategorien und maß, wie viel KI-Forschungs-Compute Sicherheitsarbeit unterstützte.
Das Unternehmen stellte fest, dass etwa 6 % des für KI-Forschung und -Entwicklung zugewiesenen Compute auf Sicherheit entfielen. Innerhalb KI-gestützter KI-Forschung erreichte der Sicherheitsanteil etwa 12 %.
Anthropic beschreibt beide Werte als konservativ. Arbeit, die Sicherheit und Fähigkeiten gleichermaßen voranbrachte, wurde als allgemeine KI-Forschung gezählt. Separate Schutzklassifikatoren wurden ebenfalls aus dem gemeldeten Sicherheitsanteil ausgeschlossen.
Das Unternehmen zog eine Stichprobe von etwa 14 % aus knapp 10.000 Forschungs-, Trainings- und Evaluierungsläufen. Die Stichprobe wurde zugunsten von Workloads gewichtet, die mehr Compute verbrauchten. Ein Klassifikator untersuchte Metadaten und Code, bevor jeder Lauf Sicherheit oder anderer Forschung zugeordnet wurde.
Anthropic zufolge stimmten maschinelle Klassifikationen mit menschlichen Prüfern bis auf ein oder zwei Prozentpunkte überein. Einige Fälle blieben selbst nach mehreren Stunden menschlicher Analyse schwierig.
Diese Mehrdeutigkeit ist unvermeidbar, weil Sicherheits- und Fähigkeitenforschung sich häufig überschneiden. Bessere Interpretierbarkeit kann gefährliches Modellverhalten sichtbar machen, aber auch Ingenieuren helfen, die Leistung zu verbessern. Skalierbarere Aufsicht kann Risiken verringern und zugleich die Bereitstellung von Agentenprodukten erleichtern.
Der Nenner ist ebenso wichtig wie der Prozentsatz. Ein großer Frontier-Trainingslauf verbraucht weit mehr Rechenkapazität als viele Sicherheitsexperimente. Sicherheitsforschung hängt oft von Arbeitszeit der Forschenden, Evaluierungsdesign und Analyse ab, nicht von riesigen Accelerator-Clustern.
Ein sinkender Sicherheitsanteil könnte effizientere Sicherheitstools statt schwächerer Investitionen widerspiegeln. Umgekehrt könnte ein steigender Anteil aus teuren Experimenten resultieren, die wenig nützlichen Schutz liefern. Compute misst Inputs, nicht Ergebnisse.
Der Zeitraum von einer Woche schafft eine weitere Einschränkung. Anthropic verwaltet Compute dynamisch, sodass sich Zuweisungen mit Trainingsläufen, Produktnachfrage und verfügbarer Kapazität verschieben. Eine einzelne Woche kann keinen belastbaren Trend belegen.
Regelmäßige Berichterstattung würde die Kennzahl nützlicher machen. Eine stabile Quartalsreihe könnte zeigen, ob Sicherheits-Compute parallel zu automatisierter Forschung, Modelltraining und dem Einsatz interner Agenten wächst.
Vergleichbare Berichterstattung würde weiterhin gemeinsame Definitionen erfordern. Labore haben Anreize, Dual-Use-Projekte als Sicherheitsarbeit zu klassifizieren. Anthropic argumentiert, dass Entwickler die Beweislast tragen sollten, dass ein Workload in die Sicherheitskategorie gehört.
Unabhängige Verifizierung kann Kennzeichnungen und Gesamtsummen prüfen, doch Auditoren benötigen Zugang zu sensiblem Code und Experiment-Metadaten. Regierungen oder vertrauenswürdige Evaluatoren bräuchten zudem Verfahren, die proprietäre Forschung schützen.
Anthropics Scaling Policy verknüpft stärkere Modellfähigkeiten bereits mit stärkeren Schutzmaßnahmen. Die neue Compute-Kennzahl ergänzt eine Ressourcenperspektive und zeigt, wohin Kapazität fließt, bevor ein Fähigkeitsschwellenwert überschritten wird.
Die Zuweisung von Ressourcen belegt jedoch keine wirksame Kontrolle. Der entscheidende Test ist, ob Sicherheitssysteme Fehler erkennen, adversarialem Druck standhalten und Bereitstellungen bei Bedarf stoppen.
Die Compute-Allokation funktioniert am besten als Teil eines größeren Evidenzpakets. Sie kann Prioritäten und Trends sichtbar machen, während Fähigkeitsbewertungen, Vorfälle, Red-Team-Ergebnisse und die Leistung des Monitorings Ergebnisse offenlegen.
Der nächste Test lautet, ob Berichterstattung verifizierbar wird
Anthropic hat eine nützliche Ausgangsbasis veröffentlicht, doch das Framework zählt nur, wenn wiederholte Messungen ungünstige Veränderungen ebenso leicht sichtbar machen wie günstige.
Das erste zu beobachtende Signal ist das nächste Update des R&D Automation Index. Ein weiterer Anstieg von Arbeit auf Stufe vier würde die These stützen, dass beaufsichtigte Agenten Verantwortung für vollständige Forschungsaufgaben übernehmen.
Die Zusammensetzung dieses Anstiegs wird entscheidend sein. Wachstum, das sich auf Debugging und Infrastruktur konzentriert, würde auf tiefere Engineering-Automatisierung hindeuten. Wachstum bei Hypothesenerstellung, Experimentauswahl oder Forschungspriorisierung wäre eine folgenschwerere Verschiebung.
Ein stabiler Aufgabenkorb wird den Trend ebenfalls leichter interpretierbar machen. Wenn Anthropic Kategorien, Gewichtungen oder Schwellenwerte ändert, sollte das Unternehmen sowohl alte als auch überarbeitete Ergebnisse veröffentlichen. Ohne versionierte Daten können methodische Änderungen wie Fortschritte bei den Fähigkeiten wirken.
Das zweite Signal ist unabhängige Replikation. Anthropic erklärt, es plane, Evaluatoren mehrerer Organisationen einzubetten und Zugang zu gewähren, der mit dem interner Risikoteams vergleichbar ist. Ihre Fähigkeit, den Wert von 26 % zu reproduzieren, wird testen, ob der Index externe Rechenschaftspflicht unterstützen kann.
Die Verifizierung sollte mehr als die finalen Prozentsätze prüfen. Evaluatoren müssen Stichproben von Aufgabenaufzeichnungen, Automatisierungsbewertungen, Workload-Abdeckung, Monitoring-Recall und Compute-Klassifikationen testen. Sie sollten zudem wichtige Einschränkungen offenlegen, ohne gefährliche oder proprietäre Details preiszugeben.
Externe Tests werden besonders für die Kennzahlen zur Agentenaufsicht wichtig. Eine von 47.000 Entscheidungen zu blockieren, bedeutet wenig ohne adversariale Tests, die abschätzen, was das System übersieht.
Künftige Berichte sollten Erkennungsraten für bekanntes Fehlverhalten und neu entwickelte Angriffe enthalten. Sie sollten erklären, wie schnell kritische Fälle Menschen erreichen und welche Maßnahmen auf eine Eskalation folgen.
Das dritte Signal ist die Übernahme durch andere Labore. Vergleichbare Offenlegungen von OpenAI, Google DeepMind, xAI oder Meta würden Anthropics Framework zu einem Brancheninstrument statt zu einer unternehmensspezifischen Erzählung machen.
Wettbewerber benötigen keine identischen internen Plattformen. Sie brauchen jedoch gemeinsame Definitionen für überwachte Aktionen, Prüfverzögerung, Eskalation, Forschungsautomatisierung und sicherheitsbezogenen Compute.
Eine Übernahme würde das Framework stärken, weil Unterschiede zwischen Laboren methodische Schwächen sichtbar machen würden. Eine Weigerung zur Teilnahme würde Behauptungen schwächen, wonach freiwillige Transparenz formelle Anforderungen ersetzen kann.
Das Framework steht auch innerhalb von Anthropic vor einer Glaubwürdigkeitsprüfung. Künftige Berichte müssen Phasen einschließen, in denen sich das Monitoring verschlechtert, die Sicherheitsallokation sinkt oder Automatisierung operative Probleme verursacht. Selektive Offenlegung würde das Projekt gerade dann weniger aussagekräftig machen, wenn Prüfung am wichtigsten ist.
Für Entwickler lautet die unmittelbare Lehre nicht, dass autonome Forschung bereits angekommen ist. Sie lautet, dass KI inzwischen genug interne Arbeit übernimmt, um Instrumentierung auf Organisationsebene zu erfordern.
Für Unternehmenskäufer bieten diese Kennzahlen bessere Fragen für die Beschaffung. Käufer können fragen, ob Agenten dauerhafte Identitäten haben, ob jede Aktion protokolliert wird, wie schnell Warnungen Menschen erreichen und ob externe Tester die Kontrollen prüfen können.
Für politische Entscheidungsträger benennt das Framework messbare Eingaben, ohne die Frage der Governance zu klären. Regierungen müssen weiterhin entscheiden, ob die Berichterstattung freiwillig bleibt, standardisiert wird oder bei festgelegten Schwellenwerten strengere Prüfungen auslöst.
Die AI-Entwicklungsmetriken von Anthropic liefern bislang den klarsten öffentlichen Einblick darin, wie ein führendes KI-Labor KI einsetzt, um KI zu entwickeln. Sie zeigen zugleich, wie stark vieles weiterhin von internen Definitionen, automatisierten Bewertungen und begrenztem externem Zugang abhängt.
Die nächsten Berichte werden entscheiden, ob daraus eine dauerhafte Infrastruktur für Rechenschaftspflicht wird oder eine einmalige Transparenzübung bleibt. Leser sollten – in dieser Reihenfolge – den Automatisierungstrend, die unabhängige Überprüfung und die Übernahme durch Wettbewerber beobachten. Diese Signale werden zeigen, ob die Aufsicht tatsächlich mit dem Entwicklungstempo Schritt hält.



