top of page

Anthropic Cyber Verification Program erweitert Zugang, entfernt jedoch zentrale Claude-Sicherheitsvorkehrungen

vor 6 Stunden
14 Min. Lesezeit

Anthropic hat den Zugang zu drei fortschrittlichen Claude-Modellen erweitert, obwohl diese komplexe offensive Cybersicherheitsaufgaben ausführen können, wenn die üblichen Sicherheitsvorkehrungen entfernt werden. Das Anthropic Cyber Verification Program umfasst nun Claude Opus 5.5, Claude Sonnet 5.5, Claude Mythos 5.1 und künftige Modelle. Zugelassene Organisationen können sie für Arbeiten nutzen, die für gewöhnliche Claude-Nutzer blockiert würden.

Die Änderung eröffnet einen kontrollierten Weg zu KI-Fähigkeiten, die Anthropic bewusst dem allgemeinen Zugang vorenthalten hat. Sicherheitsteams können Malware untersuchen, Schwachstellen finden und autorisierte Penetrationstests durchführen. Eine kleinere Gruppe kann Systeme testen, die mit Stromnetzen, Flugbetrieb, Telekommunikation, Banken und staatlichen Dienstleistungen verbunden sind.

Dies ist mehr als eine Ankündigung zum Produktzugang. Anthropic testet, ob Identitätsprüfungen, organisatorische Kontrollen, Überwachung und staatliche Prüfung Beschränkungen ersetzen können, die bislang in das Modellerlebnis integriert sind. OpenAI verfolgt einen eigenen gestuften Zugang zu fortschrittlichen Cybermodellen, während US-Behörden eine größere Rolle bei der Entscheidung übernommen haben, wer Frontier-Systeme nutzen darf.

Die zentrale Frage lautet nicht mehr, ob KI Cyberverteidiger unterstützen kann. Anthropic zufolge fanden seine früheren Partner mit Claude-Modellen und zugehörigen Scan-Arbeiten mehr als 134.000 verifizierte Schwachstellen. Die schwierigere Frage ist, ob ein Anbieter Schutzvorkehrungen selektiv entfernen kann, ohne einen privilegierten Zugangspfad zu schaffen, den Angreifer letztlich ausnutzen.

Anthropic Cyber Verification Program eröffnet drei Zugangsstufen

Anthropic ersetzt eine breite Sicherheitsgrenze durch drei zunehmend freizügigere Zugangsstufen.

Das erweiterte Verifizierungsprogramm unterteilt zugelassene Nutzer in Defense Access, Red Team Access und Specialized Access. Jede Stufe erlaubt ein anderes Spektrum an Aktivitäten und stellt unterschiedliche Anforderungen an die Berechtigung.

Defense Access unterstützt Arbeiten wie Incident Response, Security Operations, Malware-Analyse, Schwachstellenvalidierung und defensive Forschung. Zu den berechtigten Antragstellern können Unternehmen, Universitäten, gemeinnützige Organisationen, Behörden, Open-Source-Maintainer und einzelne Forscher mit glaubwürdiger Offenlegungshistorie gehören.

Das Programm umfasst auch Betreiber kritischer Infrastruktur unterschiedlicher Größe. Anthropic nennt ausdrücklich Organisationen wie regionale Krankenhäuser und kommunale Versorger. Das Unternehmen erklärt, es rechne damit, dass sich viele legitime defensive Teams qualifizieren, und wolle diese Anträge innerhalb weniger Tage beantworten.

Red Team Access geht weiter. Er erlaubt autorisierte Penetrationstests und adversariale Übungen gegen Systeme, die eine Organisation besitzt oder für deren Test sie eine Genehmigung hat. Interne Red Teams, Regierungsteams, Sicherheitsberatungen und Penetrationstest-Firmen können sich bewerben.

Organisationen auf dieser Stufe müssen zusätzliche Berechtigungsprüfungen und Sicherheitskontrollen erfüllen. Anthropic erwartet, dass die Prüfungen mehrere Wochen dauern. Antragsteller können Defense Access erhalten, während das Unternehmen ihre Anfragen für die freizügigere Stufe prüft.

Auch Red Team Access hat Grenzen. Claude soll Aktivitäten blockieren, die mit körperlichem Schaden oder weitreichenden Störungen verbunden sind. Anthropic nennt die Bereitstellung von Ransomware, Schäden an physischen Systemen und Tests sicherheitskritischer Hochrisikosysteme als eingeschränkte Aktivitäten.

Specialized Access entfernt die größte Zahl an Cyberbeschränkungen. Er ist Organisationen vorbehalten, die zum Testen von Systemen autorisiert sind, bei deren Ausfall Menschen gefährdet oder wichtige Märkte gestört werden könnten.

Zu diesen Zielen gehören Flugbetriebssysteme, Stromnetze, Telekommunikationsnetze, Infrastruktur für Interbankenüberweisungen und staatliche Verwaltungssysteme. Anthropic erklärt, jede Specialized-Access-Organisation gemeinsam mit der US-Regierung eingehend zu prüfen.

Bestehende Mitglieder von Project Glasswing wechseln ohne erneute Genehmigung für aktuelle Modelle in diese Stufe. Project Glasswing ist Anthropics kontrollierte Initiative, ausgewählten Infrastrukturbetreibern und Sicherheitsorganisationen Zugang zu seinen stärksten Cyberfähigkeiten zu geben.

Das Programm stützt sich daher auf mehr als eine verifizierte E-Mail-Adresse oder einen Standardvertrag für Unternehmen. Es verknüpft Modellzugang mit der Identität des Antragstellers, seiner institutionellen Rolle, Testbefugnis, technischen Kontrollen und den beabsichtigten Zielen.

Organisationen müssen außerdem Überwachungsbedingungen akzeptieren. Anthropic verlangt in der Regel eine Datenaufbewahrung, damit es möglichen Missbrauch erkennen kann. Bestehende Nutzer von Fable 5.1 oder Mythos 5.1 mit Vereinbarungen zur Datenaufbewahrung von null können diese Schutzmaßnahmen beim Eintritt in das Programm vorübergehend beibehalten.

Anthropic plant eine weitere Option namens Enterprise Frontier Safeguards. Nach Angaben des Unternehmens wird dieses System Maßnahmen gegen Missbrauch mit Cloud-Speicher kombinieren, der von der teilnehmenden Organisation verwaltet wird. Bis dieses System verfügbar ist, bleibt Data Governance ein bedeutsamer Zielkonflikt für Teams, die mit sensiblem Code oder Beweisen aus Sicherheitsvorfällen arbeiten.

Der wichtigste Unterschied ist die Autorisierung. Dieselbe technische Handlung kann je nach Ziel und Berechtigung des Akteurs eine defensive Validierung oder einen rechtswidrigen Eindringversuch darstellen. Das Programm versucht, diesen Kontext festzustellen, bevor es Claudes Beschränkungen lockert.

Dieses Design erzeugt die zentrale Spannung des Artikels. Anthropic behauptet nicht, dass risikoreiches Cyberverhalten für alle sicher geworden sei. Das Unternehmen behauptet, dass verifizierte Institutionen unter einem kontrollierten Zugangssystem stärkere Fähigkeiten erhalten können.

Claudes Cyberfähigkeiten liefern bereits Ergebnisse

Der Ausbau folgt auf Hinweise, dass fortschrittliche Claude-Modelle monatelange Schwachstellenarbeit auf deutlich kürzere Untersuchungen verdichten können.

Anthropic zufolge fanden Partner von Project Glasswing zwischen April und Juli 2026 mindestens 129.000 verifizierte Softwareschwachstellen. Separate Open-Source-Scan-Arbeiten identifizierten zwischen April und Oktober weitere 5.500 verifizierte Schwachstellen.

Mehr als 33.000 dieser Befunde erhielten Bewertungen als kritisch oder hochgradig schwerwiegend. Das Unternehmen erklärt, die Gesamtzahl unterschätze die Wirkung des Programms wahrscheinlich, weil sie Berichte von nur 33 Partnern umfasse.

Die Daten haben zudem wichtige Einschränkungen. Teilnehmer nutzten unterschiedliche Methoden, um Befunde zu bestätigen und zu kategorisieren. Weniger als die Hälfte legte offen, wie viele Schwachstellen gepatcht worden waren, oft weil die Behebung noch lief.

Eine Schwachstelle zu finden, ist nicht gleichbedeutend damit, sie zu beheben. Sicherheitsteams müssen das Problem reproduzieren, seinen Schweregrad bewerten, betroffene Software identifizieren, Maintainer informieren, einen Patch erstellen, die Reparatur testen und sie sicher bereitstellen.

Ein Modell kann die Entdeckung beschleunigen und zugleich die späteren Phasen schwieriger beherrschbar machen. Wenn automatisierte Systeme schneller Befunde erzeugen, als Menschen sie verifizieren können, sehen sich Sicherheitsteams mit einer größeren Triage-Warteschlange und einem längeren Zeitraum ungelöster Gefährdung konfrontiert.

Anthropic räumte diesen Engpass bei seiner früheren Glasswing-Erweiterung ein. Das Unternehmen erklärte, Verifizierung, Offenlegung und Patchen seien stärker limitierend geworden als die anfängliche Entdeckung von Schwachstellen.

Dieser Druck hilft, das breitere Zugangsprogramm zu erklären. Eine kleine, zentral verwaltete Gruppe kann nicht jedes Krankenhausnetzwerk, jedes Open-Source-Paket, Zahlungssystem, jede Versorgungsplattform oder Regierungsanwendung untersuchen. Betreiber benötigen direkten Zugang, weil sie ihre eigenen Umgebungen verstehen und realistische Tests autorisieren können.

Die potenziellen Vorteile reichen über Software-Scans hinaus. Fortschrittliche Modelle können Angriffspfade rekonstruieren, unbekannte Malware analysieren, potenzielle Patches generieren und Tests wiederholen, nachdem Verteidiger ein System geändert haben.

Eine Zusammenarbeit mit dem Pacific Northwest National Laboratory veranschaulicht den Mechanismus. Forscher entwickelten ein Agent-Gerüst, also einen Satz von Tools und Anweisungen, der Claude kontrollierte Aktionen in einer Netzwerkumgebung ermöglichte.

Das Team nutzte es, um Angriffe gegen ein cyberphysisches Modell einer Wasseraufbereitungsanlage zu emulieren. Laut Anthropics Infrastrukturforschung rekonstruierte das System einen Angriff in drei Stunden statt in mehreren Wochen.

Der Test verwendete Claude Sonnet 4, ein älteres Modell. Während eines Durchlaufs scheiterte eine vorbereitete Methode zum Umgehen der Windows User Account Control. Claude erkannte den Fehlschlag und wählte eine andere bekannte Technik, um den simulierten Angriff fortzusetzen.

Diese Anpassungsfähigkeit ist für Verteidiger wertvoll, weil reale Umgebungen selten genau wie ein schriftliches Verfahren funktionieren. Sie ist zugleich der Grund, weshalb der Zugang gefährlich wird. Ein Modell, das sich von fehlgeschlagenen Schritten erholen kann, kann einem Angreifer helfen, über statische Anweisungen hinauszugehen.

Das neue Programm soll legitimen Teams genügend Freiheit geben, dieses Verhalten zu reproduzieren. Grundlegende Code-Überprüfung und Patch-Erstellung bleiben über allgemein zugängliche Claude-Modelle verfügbar. Interaktivere, mehrstufige Operationen erfordern eine Verifizierung, weil sie realen Eindringaktivitäten ähneln.

Diese Grenze wird schwer zu definieren bleiben. Schwachstellenanalyse beginnt häufig als harmlose Code-Inspektion und entwickelt sich zu einer Exploit-Kette. Ein Incident Responder muss möglicherweise die Technik eines Angreifers reproduzieren, bevor er sie blockieren kann.

Anthropics Antwort besteht darin, den Akteur und das Ziel zu bewerten, statt jede Anfrage ausschließlich anhand ihres Textes zu beurteilen. Diese Verschiebung stellt Identität, Governance und rechtliche Autorisierung neben dem Filtern auf Modellebene als zentrale Sicherheitsmechanismen.

Das Entfernen von Cyberschutzvorkehrungen verändert, was Claude abschließen kann

Anthropics eigene Tests zeigen, dass Zugangsstufen nicht lediglich Unannehmlichkeiten verringern; sie bestimmen, ob Claude offensive Operationen abschließen kann.

Das Unternehmen bewertete Claude Opus 5.5 mit CyScenarioBench, einem Benchmark für die Planung und Durchführung mehrstufiger Cyberoperationen unter realistischen Einschränkungen. Es führte auf jeder Zugangsstufe fünf Versuche für jede von zehn Herausforderungen durch.

Ohne Programmzugang blockierte Claude jede Aufgabe bereits beim ersten Prompt. Das allgemein verfügbare Erlebnis verhinderte daher den Fortschritt der Bewertung, unabhängig davon, ob der Akteur gutartige Absichten hatte.

Defense Access erlaubte etwas mehr Aktivität, doch Schutzvorkehrungen stoppten weiterhin 46 der 50 Durchläufe vor dem Abschluss. Vier Aufgaben waren erfolgreich. Dieses Verhalten passt zu einer Stufe, die für Untersuchung, Reaktion und Schwachstellenarbeit statt für vollständige Angriffssimulationen konzipiert ist.

Red Team Access führte zu einem anderen Ergebnis. Es gab keine durch Schutzvorkehrungen verursachten Blockierungen, und Claude schloss 34 von 50 Durchläufen ab. Seine Abschlussquote von 68 Prozent war faktisch identisch mit dem Ergebnis von 67,6 Prozent ohne Schutzvorkehrungen.

Diese Zahlen verdeutlichen, was Anthropic gewährt. Zugelassene Red Teams erhalten nicht das Standarderlebnis von Claude mit einem größeren Anfragekontingent. Sie erhalten Zugang zu Modellverhalten, das bei dieser Bewertung seiner uneingeschränkten Leistung sehr nahekommt.

Specialized Access geht weiter, indem er autorisierte Tests sicherheitssensibler Systeme ermöglicht. Er ist für Szenarien gedacht, in denen selbst gewöhnlicher Red-Team-Zugang Beschränkungen beibehalten würde, weil ein fehlgeschlagener Test physische Abläufe, öffentliche Dienste oder Finanzmärkte beeinträchtigen könnte.

Diese Struktur ist ein kalkulierter Zielkonflikt. Starke universelle Filter können vor Missbrauch schützen, aber sie können Verteidiger auch daran hindern, die Angriffe zu üben, denen sie standhalten müssen. Eine breite Entfernung dieser Filter würde den Zugang für beide Gruppen erweitern.

Anthropic setzt darauf, dass institutionelle Verifizierung den Unterschied ausmachen kann. Nutzer im Verteidigungsbereich erhalten breite Zugangsberechtigung mit fortbestehenden Beschränkungen. Red Teams durchlaufen eine gründlichere Prüfung, erhalten jedoch weniger Blockierungen. Eine kleine Gruppe von Organisationen erhält durch eine gemeinsame Prüfung mit der Regierung spezialisierten Zugang.

Sicherheitsklassifikatoren bleiben zentral für das System. Ein Klassifikator ist ein separates Modell oder eine Kontrollschicht, die Anfragen und Antworten auf verbotenes Verhalten prüft. Er kann eine Interaktion unterbrechen, selbst wenn das zugrunde liegende Claude-Modell fortfahren könnte.

Anthropic hat beschrieben, wie diese Kontrollen Cyber-Anfragen in Kategorien einteilen, darunter eindeutig verbotene Aktivitäten, risikoreiche Dual-Use-Arbeit, weniger risikoreiche Dual-Use-Arbeit und gewöhnliche defensive Aufgaben. Sein veröffentlichtes Klassifikator-Framework erkennt zudem an, dass böswillige und defensive Akteure bisweilen nahezu identische Techniken einsetzen.

Diese Mehrdeutigkeit begrenzt, was automatisierte Filter aus einem Prompt ableiten können. Eine Anfrage, Persistenz zu etablieren, Zugangsdaten zu extrahieren oder Erkennung zu umgehen, wirkt ohne verlässliche Informationen über Ziel und Autorisierung gefährlich.

Das Verifizierungsprogramm liefert diesen fehlenden Kontext, bevor eine Sitzung beginnt. Es verknüpft einen Nutzer mit einer zugelassenen Organisation, einer Zugriffsstufe, vertraglichen Verpflichtungen, Überwachung und einem definierten Bereich erlaubter Systeme.

Allerdings beseitigt Verifizierung das technische Risiko nicht. Konten können kompromittiert werden. Beschäftigte können ihre Befugnisse überschreiten. Auftragnehmer können den Zugang verlieren, ohne dass Berechtigungen unverzüglich angepasst werden. Autorisierte Infrastruktur kann mit nicht zugelassenen Systemen verbunden werden.

Überwachung kann verdächtige Nutzung erkennen, doch die Erkennung kann erst erfolgen, nachdem ein Modell einen brauchbaren Angriffsweg generiert hat. Ratenbegrenzungen und Zielkontrollen können die Gefährdung eingrenzen, doch erfahrene Akteure verteilen ihre Arbeit häufig auf Tools und Konten.

Der Benchmark bewertet zudem nur eine Stichprobe strukturierter Szenarien. Eine Abschlussquote von 68 Prozent belegt nicht, wie Claude bei unbekannter Software, kundenspezifischer Industrieausrüstung oder verketteten Angriffen mit Social Engineering reagieren wird.

Die Evidenz von Anthropic stützt eine engere Schlussfolgerung. Zugriffskontrollen können zwischen Stufen deutlich unterschiedliches Verhalten bewirken, und fortgeschrittene Claude-Modelle können viele Cyber-Aufgaben erledigen, wenn Beschränkungen gelockert werden.

Ob diese Kontrollen im großen Maßstab verlässlich bleiben, ist nicht belegt. Diese Frage wird wichtiger, wenn der Bewerberkreis über die ursprüngliche Glasswing-Kohorte hinauswächst.

Staatliche Prüfung erhöht die Sicherheit und konzentriert Macht

Die US-Regierung wird Teil des Zugangskontrollsystems für fortschrittliche Cyber-Modelle und ist nicht mehr nur eine externe Regulierungsinstanz.

Anthropic erklärt, bei der Prüfung jeder Specialized-Access-Organisation mit der Regierung zusammenzuarbeiten. Diese Vereinbarung gibt öffentlichen Stellen eine Rolle bei der Entscheidung, welche Institutionen Claude gegen Flugsysteme, Stromnetze, Banken-Infrastruktur und andere sensible Ziele einsetzen dürfen.

Die Partnerschaft folgt einer praktischen Logik. Regierungsbehörden kennen klassifizierte Bedrohungen, nationale Infrastruktur, Exportkontrollen und die operativen Folgen von Angriffen auf regulierte Systeme. Sie können außerdem rechtliche Befugnisse bestätigen, die ein privater Modellanbieter allein nicht beurteilen kann.

Jüngste Ereignisse zeigen, wie weit sich diese Beziehung entwickelt hat. Berichten zufolge arbeitete Anthropic mit US-Geheimdiensten zusammen, um ein Mythos-Modell gegen klassifizierte Regierungssysteme zu testen.

Ein Beamter sagte der Associated Press, das Modell habe innerhalb weniger Stunden einige Schwachstellen identifiziert. Der Beamte betonte, dass die Identifizierung einer Schwachstelle nicht bedeute, dass Mythos sie im selben Zeitraum ausgenutzt habe.

Senator Mark Warner beschrieb das Ergebnis bei einer Anhörung im Juni dramatischer. Er sagte, das System sei innerhalb weniger Stunden in fast alle getesteten klassifizierten Umgebungen eingedrungen, und führte diese Darstellung auf den Leiter der National Security Agency und des U.S. Cyber Command zurück.

Die NSA und Anthropic lehnten es ab, Details zu den klassifizierten Tests zu bestätigen. Die Lücke zwischen den öffentlichen Darstellungen ist ein Grund, weitreichende Behauptungen vorsichtig zu behandeln.

Die Beteiligung der Regierung hat auch Konflikte hervorgebracht. Im Juni unterzog die Trump-Regierung Veröffentlichungen von Frontier-Modellen einer nationalen Sicherheitsprüfung und beschränkte den Zugang zu einigen Anthropic-Systemen.

Anthropic zog Fable 5 und Mythos 5 nach einer Richtlinie zum Zugang ausländischer Staatsangehöriger vorübergehend zurück. Später genehmigte die Regierung Mythos für eine begrenzte Bereitstellung bei ausgewählten Cyber-Verteidigern und Infrastrukturanbietern.

OpenAI wurde für GPT-5.6 Sol einer ähnlichen Prüfung unterzogen. Beide Unternehmen beschränkten ihre neuesten Systeme zunächst auf kleine Gruppen und machten den Zugang zu kommerziellen KI-Modellen damit zu einer Frage der nationalen Sicherheitspolitik.

Befürworter können argumentieren, dass außergewöhnlich leistungsfähige Cyber-Systeme außergewöhnlich sorgfältige Freigabeprozesse erfordern. Modellanbieter haben keinen vollständigen Einblick in Nachrichtendienstbedrohungen, während Regierungen nicht jedes relevante Frontier-Modell eigenständig entwickeln können.

Kritiker sehen eine weniger rechenschaftspflichtige Vereinbarung. Abgeordnete Lori Trahan argumentierte, politische Ernannte entschieden Unternehmen für Unternehmen, wer Zugang erhält, ohne ein klares Gesetz, Verfahren oder Aufsichtsmodell.

Diese Kritik gilt auch für das erweiterte Anthropic Cyber Verification Program. Die Einbindung der Regierung kann die Prüfung sensibler Ziele verbessern, konzentriert jedoch auch Macht in einem Verfahren, dessen Kriterien nicht vollständig öffentlich sind.

Organisationen außerhalb der Vereinigten Staaten sehen sich einer weiteren Sorge gegenüber. Anthropic hatte Glasswing zuvor auf Partner in mehr als 15 Ländern ausgeweitet, von denen viele Bevölkerungsgruppen über ihre Heimatmärkte hinaus bedienten.

Kritische Software ist global. Maintainer von Open Source, Cloud-Anbieter, Chiphersteller, Telekommunikationsanbieter und Finanznetzwerke überschreiten regelmäßig nationale Grenzen. Ein System, das stark von den Sicherheitsprioritäten einer Regierung geprägt wird, kann ungleichen Zugang schaffen.

Die leistungsstärksten Cyber-Modelle könnten daher zu strategischen Ressourcen werden, die über geopolitische Beziehungen verteilt werden. Das würde Organisationen unter Druck setzen, sowohl die Regeln eines privaten Anbieters als auch die Anforderungen einer Regierung an die nationale Sicherheit zu erfüllen.

Das Programm benötigt klare Einspruchsmöglichkeiten, konsistente Standards, überprüfbare Verfahren zum Entzug von Zugriffsrechten und transparente Berichte über Ausschlüsse. Ohne diese Elemente droht Verifizierung zu einem intransparenten Lizenzierungssystem für eine zunehmend wichtige defensive Technologie zu werden.

Anthropic hat das Programm nicht als dauerhafte öffentliche Politik dargestellt. Das Unternehmen beschreibt kontrollierten Zugang als Übergangslösung, während stärkere Schutzmaßnahmen entwickelt werden. Dennoch schaffen temporäre Systeme oft operative Präzedenzfälle, die später schwer zu ersetzen sind.

Der defensive Vorteil hängt vom Patchen ab, nicht von der Entdeckung

Claude kann Verteidigern nur dann einen Vorteil verschaffen, wenn Organisationen Schwachstellen beheben, bevor Angreifer dieselben Erkenntnisse reproduzieren.

Das erklärte Ziel von Anthropic ist es, das Gleichgewicht zugunsten der Verteidigung zu verschieben. Dieses Ziel klingt plausibel, weil Infrastrukturbetreiber ihre eigenen Systeme untersuchen, Patches bereitstellen und die Reaktion auf Vorfälle koordinieren können, bevor sie technische Details veröffentlichen.

Angreifer haben andere Vorteile. Sie können das schwächste Ziel auswählen, erfolgreiche Techniken wiederverwenden, über Rechtsordnungen hinweg agieren und sich schneller bewegen als institutionelle Genehmigungsverfahren.

Fortgeschrittene Modelle können beide Seiten verstärken. Ein Verteidiger kann Millionen Codezeilen analysieren und gefährliche Fehler priorisieren. Ein Angreifer kann ähnliche Schlussfolgerungen nutzen, um einen übersehenen Weg in einen exponierten Dienst zu finden.

Die zeitliche Lücke entscheidet darüber, wer profitiert. Eine privat entdeckte und schnell behobene Schwachstelle verbessert die Sicherheit. Ein Fehler, der in einer monatelangen Behebungswarteschlange gemeldet wird, bleibt für Angreifer nützlich, selbst wenn Verteidiger ihn zuerst gefunden haben.

Die Schwachstellenzahlen von Anthropic messen daher Entdeckung, nicht ein vollständiges defensives Ergebnis. Mehr als 134.000 verifizierte Funde stellen eine erhebliche Forschungsleistung dar. Sie zeigen jedoch nicht, wie viele betroffene Systeme weiterhin exponiert sind.

Das Unternehmen erklärt, weniger als die Hälfte der teilnehmenden Partner habe Patch-Zahlen offengelegt. Dieser fehlende Nenner verhindert eine unabhängige Bewertung, ob die Entdeckung schneller voranschreitet als die Behebung.

Ein hohes Volumen automatisierter Funde kann auch operative Probleme verursachen. Maintainer benötigen genügend Belege, um einen Fehler zu reproduzieren, seine Auswirkungen zu verstehen und ein ausnutzbares Problem von einer theoretischen Schwäche zu unterscheiden.

Schlecht priorisierte Berichte können ehrenamtliche Open-Source-Projekte überfordern. Detaillierte Exploit-Informationen können das Offenlegungsrisiko erhöhen, wenn sie zu viele Organisationen durchlaufen, bevor ein Fix existiert.

Das erweiterte Programm überträgt Antragstellern mehr Verantwortung. Sicherheitsteams benötigen Prozesse für das Schwachstellenmanagement, isolierte Testumgebungen, Zugriffsprotokollierung, klare Eskalationswege und die Befugnis, Reparaturen bereitzustellen.

Sie benötigen außerdem dauerhafte Aufzeichnungen. KI-gestützte Untersuchungen können lange Ketten aus Hypothesen, Tool-Ausgaben, Codeänderungen und Entscheidungen erzeugen. Eine durchsuchbare Engineering-Wissensdatenbank kann Teams helfen, diesen Kontext zu bewahren, ohne die Schlussfolgerungen des Modells als verifizierte Tatsachen zu behandeln.

Menschliche Prüfung bleibt notwendig. Modelle können Systemgrenzen missverstehen, unsichere Korrekturen vorschlagen oder Muster identifizieren, die unter realen Betriebsbedingungen nicht bestehen. Industriesysteme bringen physische Einschränkungen mit sich, die gewöhnliche Software-Benchmarks nicht erfassen.

Specialized Access erhöht diese Risiken. Eine fehlerhafte Aktion gegen eine Flugsteuerungsumgebung, ein Netzmanagementsystem oder ein Interbanken-Netzwerk kann Folgen haben, die über Datenverlust hinausgehen.

Anthropic erklärt, dass Echtzeitbeschränkungen auf niedrigeren Ebenen für Aktivitäten bestehen bleiben, die körperlichen Schaden oder großflächige Störungen verursachen könnten. Spezialisierte Nutzer erhalten gerade deshalb weniger Blockierungen, weil ihre Arbeit manchmal das Testen solcher Szenarien erfordert.

Das Programm muss daher mehr beurteilen als die Frage, ob eine Organisation legitim erscheint. Es muss bewerten, ob die Organisation Ziele isolieren, Modellaktionen begrenzen, Tests beaufsichtigen, sich von Fehlern erholen und Anomalien melden kann.

Die staatliche Prüfung kann diese Bewertung unterstützen, doch operative Disziplin bleibt lokal. Ein Modellanbieter kann nicht jeden Befehl in einem Versorgungsbetriebslabor oder einem klassifizierten Netzwerk beaufsichtigen.

Wettbewerb erhöht den Druck. OpenAI hat ebenfalls fortgeschrittene Cyber-Modelle über kontrollierte Programme verfügbar gemacht. Wenn Anbieter darum konkurrieren, welches System mehr offensive Aufgaben erledigt, können Zugangsbeschränkungen zu einem kommerziellen Nachteil werden.

Wenn sie allein über Sicherheit konkurrieren, könnten Verteidiger Modelle wählen, die weniger Blockierungen und bessere Angriffssimulationen bieten. Das schafft einen Anreiz, Kontrollen zu lockern und Verifizierung zugleich als ausgleichende Maßnahme darzustellen.

Die gestufte Struktur von Anthropic ist ein glaubwürdiger Versuch, diesen Druck zu steuern. Sie löst den zugrunde liegenden Konflikt nicht. Dieselben Fähigkeiten, die Claude gegen hochentwickelte Angreifer nützlich machen, machen jeden Fehler bei der Verifizierung folgenreicher.

Der defensive Vorteil wird sich an Behebungsergebnissen zeigen, nicht an Modell-Benchmarks. Patch-Raten, Zeit bis zur Behebung, Wiederholungsraten und verhinderte Vorfälle sind wichtiger als die reine Zahl gefundener Schwachstellen.

Drei Signale werden zeigen, ob kontrollierter Zugang funktioniert

Der nächste Test besteht darin, ob Anthropic die Beteiligung ausweiten kann, ohne die Verifizierung zu schwächen oder Verteidiger mit ungelösten Funden zu überfluten.

Das erste Signal ist die Qualität der Aufnahme. Anthropic erklärt, viele Defense-Access-Anträge innerhalb weniger Tage prüfen zu können, während Red Team Access Wochen dauern kann. Schnellere Genehmigung ist nur dann nützlich, wenn Identitäts-, Befugnis- und Sicherheitsprüfungen konsistent bleiben.

Das Unternehmen sollte aggregierte Zahlen zu Anträgen, Genehmigungsquoten, Prüfzeiten, Widerrufen und den wichtigsten Ablehnungsgründen veröffentlichen. Es muss keine sensiblen Teilnehmer identifizieren, um zu zeigen, ob das System verantwortungsvoll skaliert.

Ein starker Anstieg der Zugänge ohne entsprechende Überwachungskapazitäten würde Anthropics Argument schwächen. Stabile Prüfstandards und niedrige Missbrauchsraten würden es stärken.

Das zweite Signal ist das Verhältnis zwischen entdeckten und behobenen Schwachstellen. Die 129.000 von Partnern gemeldeten Funde und 5.500 Open-Source-Funde von Anthropic liefern eine Ausgangsbasis für die Entdeckung.

Künftige Berichte sollten bestätigte Funde von Duplikaten, strittigen Meldungen und Schwachstellen trennen, die veraltete Software betrafen. Sie sollten außerdem offenlegen, wie viele Probleme Patches erhielten und wie schnell diese Patches die eingesetzten Systeme erreichten.

Höhere Patch-Quoten würden die Behauptung stützen, dass Frontier-Modelle einen defensiven Vorteil schaffen. Ein wachsender Rückstau schwerwiegender, ungelöster Probleme würde darauf hindeuten, dass automatisierte Entdeckung einen organisatorischen Engpass aufdeckt, statt ihn zu lösen.

Das dritte Signal ist, wie Anthropic mit dem ersten schwerwiegenden Zugriffsversagen umgeht. Kein Verifizierungssystem sollte ausschließlich im Normalbetrieb bewertet werden.

Ein kompromittiertes Konto, ein nicht autorisiertes Ziel, die Umgehung eines Klassifikators oder eine unbeabsichtigte Interaktion mit einem Live-System würden die Reaktion des Programms auf die Probe stellen. Zu den wichtigen Kennzahlen würden Erkennungszeit, Eindämmung, Benachrichtigung, Widerruf und anschließend vorgenommene Änderungen gehören.

Transparente Berichte über Vorfälle würden Vertrauen schaffen, selbst wenn einige technische Details vertraulich blieben. Schweigen würde es externen Organisationen erschweren, die tatsächlichen Risiken einer Teilnahme am Programm einzuschätzen.

Enterprise Frontier Safeguards wird dieses Signal ebenfalls beeinflussen. Anthropic erklärt, das geplante System werde Datenschutz mit Schutz vor Missbrauch verbinden und berechtigten Organisationen zugleich ermöglichen, Informationen in ihren eigenen Cloud-Umgebungen zu behalten.

Diese Vereinbarung könnte Bedenken ausräumen, sensiblen Code und Vorfallsdaten an einen Modellanbieter zu übermitteln. Sie könnte jedoch auch die zentrale Überwachung erschweren, wenn Kontrollen sich in von Kunden verwalteten Umgebungen unterschiedlich verhalten.

Das Verhalten von Wettbewerbern gehört zum Hintergrund, wird jedoch Anthropics Entscheidungen prägen. Die kontrollierten Cyber-Bereitstellungen von OpenAI werden Käufern und Regulierungsbehörden ein weiteres Modell bieten, um Zugang, Aufsicht und Reaktion auf Vorfälle zu vergleichen.

Ein breiterer Zugang durch einen Wettbewerber würde Anthropic unter Druck setzen, Genehmigungen zu beschleunigen. Ein bedeutender Missbrauchsvorfall an anderer Stelle könnte das Unternehmen zu strengeren Anforderungen bewegen.

Leser sollten das Anthropic Cyber Verification Program nicht als Beweis dafür betrachten, dass Frontier-Cyberfähigkeiten nun sicher sind. Es handelt sich um ein laufendes Governance-Experiment, das auf einer schwierigen Annahme beruht: Bekannte Institutionen können weniger Beschränkungen erhalten, weil ihre Identität und Kontrollen das Risiko verringern.

Diese Annahme ist überprüfbar. Anthropic hat Benchmark-Ergebnisse veröffentlicht, die zeigen, dass seine Zugriffsstufen das Verhalten von Claude verändern. Das Unternehmen hat außerdem große Zahlen verifizierter Funde aus kontrollierten Bereitstellungen gemeldet.

Die fehlenden Belege betreffen den Betrieb im großen Maßstab. Wir wissen noch nicht, wie häufig legitime Anfragen blockiert werden, wie viele zugelassene Organisationen gegen Regeln verstoßen oder wie wirksam Anthropic ein Konto erkennt, das außerhalb seines vorgesehenen Umfangs genutzt wird.

Entwickler und Sicherheitsverantwortliche sollten das Programm beobachten, weil sich ähnliche Zugangssysteme über die Cybersicherheit hinaus verbreiten könnten. Frontier-Modelle mit biologischen, finanziellen oder autonomen Forschungskapazitäten könnten ebenfalls Berechtigungen erfordern, die an verifizierte Nutzer und genehmigte Umgebungen gebunden sind.

Unternehmenskäufer sollten fragen, was eine Zugriffsstufe technisch verändert. Sie sollten außerdem Datenaufbewahrung, Überwachung, Offenlegung von Vorfällen, Mitarbeiterautorisierung und die Verantwortung für modellgenerierte Handlungen prüfen.

Für Wissensarbeiter lautet die umfassendere Lehre, dass der Zugang zu fortgeschrittener KI nicht immer als einheitliches Produktupdate erfolgen wird. Das leistungsfähigste Verhalten könnte zunehmend davon abhängen, wer der Nutzer ist, welche Institution ihn unterstützt und welche Systeme er testen darf.

Anthropic hat diese Zukunft näher gerückt. Sein Programm verschafft mehr Verteidigern Zugang zu fortgeschrittenen Claude-Cyberfähigkeiten und bewahrt zugleich stärkere Beschränkungen für alle anderen.

Das Ergebnis wird weniger von Schlagzeilen über Schwachstellenzahlen abhängen als von konsequenter Behebung und rechenschaftspflichtiger Aufsicht. Wird Anthropic genügend Belege veröffentlichen, um zu zeigen, dass verifizierter Zugang sicherere Infrastruktur schafft, oder wird das erste große Versagen die Verifizierung als schwächste Schutzmaßnahme entlarven?

 
 

Kostenlos loslegen

Ein Local-First-KI-Assistent mit persönlichem Wissensmanagement

Für ein besseres KI-Erlebnis

unterstützt remio derzeit nur Windows 10+ (x64) und M-Chip Macs.

Ihr KI-Partner bei der Arbeit
Mehr schaffen mit remio

Planen. Erstellen. Liefern.
Alles an einem Ort.

bottom of page