top of page

Tech Against Terrorism AI-Studie zeigt: Schutzvorkehrungen können zusammenbrechen

vor 55 Minuten
13 Min. Lesezeit

Tech Against Terrorism testete mehr als 130 KI-Modelle, und drei von fünf scheiterten bei der jüngsten Bewertung der Terrorismussicherheit. Die Tech Against Terrorism AI-Studie stellte die gravierendsten Mängel bei modifizierten Modellen fest, deren Schutzvorkehrungen zur Verweigerung gezielt entfernt worden waren.

Diese Unterscheidung ist wichtig. Die Studie zeigt nicht, dass die meisten gängigen Chatbots Terroristen bei normaler Nutzung offen unterstützen. Sie zeigt, dass sich die Sicherheit schnell verschlechtern kann, wenn Modelle modifiziert, umdefiniert oder außerhalb der direkten Kontrolle ihrer Entwickler verbreitet werden.

Das Ergebnis setzt Meta, Hugging Face, Entwickler von Open-Weight-Modellen und Modell-Hosts unter Druck. Ihre zentrale Herausforderung besteht darin, legitime Forschung und lokale Bereitstellung zu ermöglichen, ohne Schutzvorkehrungen zum Zeitpunkt der Veröffentlichung als dauerhaften Schutz zu behandeln.

Die wichtigste Erkenntnis ist daher nicht ein einfacher Wettbewerb zwischen offener und geschlossener KI. Es ist ein Konflikt zwischen anpassungsfähigen Modellen und Sicherheitskontrollen, die Anpassungen möglicherweise nicht überstehen.

Die Tech Against Terrorism AI-Studie erweiterte den Test

Die neue Bewertung verlagert die Debatte von isolierten Fehlern einzelner Chatbots hin zu einem umfassenderen Test dafür, wie sich Sicherheit entlang der Lieferkette von Modellen verhält.

Tech Against Terrorism ist eine britische Non-Profit-Organisation mit Fokus auf terroristische Aktivitäten im Internet. Ihre Forschenden bewerteten mehr als 130 Modelle mit Hunderten von Anfragen zu Angriffsplanung, Finanzierung, Radikalisierung und anderen Formen schädlicher Unterstützung.

Der Test der Organisation prüft, ob ein Modell gefährliche Anfragen konsequent ablehnt. Er berücksichtigt zudem die Schwere und Spezifität der Informationen, die das Modell gegebenenfalls liefert.

Laut den erweiterten Tests galt ein Modell als gescheitert, wenn es eine vollständige, konkrete Antwort zu Schaden mit vielen Opfern erzeugte. Auch ein Ergebnis unter 90 von 100 wurde als Fehlschlag gewertet.

Das ist eine anspruchsvolle Schwelle. Ein Modell kann die meisten gefährlichen Prompts ablehnen und dennoch scheitern, weil eine Antwort ausreichend vollständige Unterstützung bietet.

Dieser Ansatz unterscheidet sich von einem einfachen Test der Verweigerungsquote. Eine Verweigerungsquote zählt, wie häufig ein Modell Nein sagt, kann jedoch teilweise Befolgung übersehen.

Manche Systeme beginnen mit einer Warnung und liefern anschließend dennoch das angeforderte Material. Tech Against Terrorism bezeichnet dieses Muster als abgesicherte Befolgung.

Der frühere Benchmark zur Terrorismusbekämpfung der Organisation untersuchte 27 führende Modelle und fast 2.500 Einzel-Prompts. Etwa ein Drittel dieser Antworten bot über eine gewöhnliche Websuche hinaus sinnvolle Hilfe.

Dieser Pilotversuch zeigte auch erhebliche Unterschiede je nach Bedrohungskategorie und Prompt-Formulierung. Dieselbe Anfrage wurde anders behandelt, wenn ein Nutzer einen Forschungszweck angab.

Die jüngste Untersuchung erweiterte den Modellpool, konzentrierte sich jedoch auf 627 Anfragen. Ihr zentrales Ergebnis war, dass rund 60 Prozent der getesteten Systeme den angegebenen Sicherheitsstandard nicht erfüllten.

Die beiden Runden sollten nicht als unmittelbar vergleichbare Statistiken behandelt werden. Sie nutzten unterschiedliche Modellgruppen, Testgrößen und Berichtsmaße.

Zusammen stützen sie jedoch dieselbe Schlussfolgerung. Die scheinbare Sicherheit eines Modells hängt von mehr ab als seinem Namen, Anbieter oder der Standardoberfläche.

Die umgebende Konfiguration ist entscheidend. Gleiches gilt für seine Gewichte, Systemanweisungen, Bereitstellungskontrollen und die vom Nutzer angegebene Identität.

Die Bewertung umfasste direkte Bekundungen terroristischer Absicht. Sie testete außerdem Anfragen, die durch weniger offensichtlich böswillige Rollen präsentiert wurden, einschließlich forschungsorientierter Rahmungen.

Das ist relevant, weil reale Angreifer ihre Absichten selten wahrheitsgemäß angeben müssen. Eine Schutzvorkehrung, die nur nach einem eindeutigen Geständnis funktioniert, bietet begrenzte Sicherheit.

Die Studie lenkt den Fokus zudem von abstrakten Zukunftsszenarien auf bereits verfügbare Systeme. Viele der getesteten Modelle können lokal ausgeführt werden, erscheinen in öffentlichen Repositorien oder lassen sich von Dritten modifizieren.

Diese Verfügbarkeit erzeugt die zentrale Spannung des Artikels. Entwickler können das ursprüngliche Modell testen, dürfen aber nicht davon ausgehen, dass jede verbreitete Kopie dasselbe Verhalten beibehält.

Die eigentliche Trennlinie verläuft zwischen kontrolliertem Zugang und editierbaren Gewichten

Die Ergebnisse belegen nicht, dass jedes Open-Weight-Modell unsicher ist, doch sie legen ein Kontrollproblem offen, mit dem geschlossene Dienste anders umgehen.

Open-Weight-Modelle stellen ihre trainierten Parameter zum Download bereit. Diese Parameter kodieren die Muster, die ein System während des Trainings und der anschließenden Sicherheitsabstimmung gelernt hat.

Entwickler können diese Modelle für Sprachen, Branchen, lokale Hardware und spezialisierte Anwendungen anpassen. Forschende können Verhalten untersuchen, das ein gehosteter Dienst möglicherweise verbirgt.

Diese Vorteile erklären, weshalb die Entwicklung von Open-Weight-Modellen Unternehmen, Universitäten, unabhängige Labore und öffentliche Institutionen angezogen hat. Sie kann die Abhängigkeit von einer kleinen Gruppe von API-Anbietern verringern.

Geschlossene Modelle schaffen eine andere Konstellation. Nutzer greifen über Dienste zu, die vom Modellentwickler kontrolliert werden, ohne die zugrunde liegenden Gewichte zu erhalten.

Diese Kontrolle ermöglicht es einem Anbieter, Filter zu aktualisieren, verdächtige Aktivitäten zu überwachen, Konten einzuschränken und Zugänge zu entziehen. Sie garantiert keine Sicherheit, bewahrt aber Interventionsmöglichkeiten.

Eine Open-Weight-Veröffentlichung lässt sich nicht auf dieselbe Weise zurückrufen. Sobald Kopien über Repositorien und lokale Rechner verteilt sind, können spätere Richtlinienänderungen sie nicht zuverlässig erreichen.

Der frühere Benchmark von Tech Against Terrorism ergab, dass offen gegenüber geschlossen nicht die wichtigste Leistungsgrenze war. Einige gewöhnliche offene Modelle gehörten in diesem Test zu den sichereren Systemen.

Anthropics Claude und Falcon3 des Technology Innovation Institute erzielten im Pilotversuch hohe Platzierungen. Auch MiniMax schnitt laut der Organisation gut ab.

Dieses Ergebnis erschwert Behauptungen, wonach Offenheit allein die Gefahr bestimmt. Gut ausgerichtete offene Modelle können schädliche Anfragen ablehnen, während kontrollierte Dienste weiterhin unsichere Antworten liefern können.

Die folgenschwerere Trennlinie zeigt sich nach der Veröffentlichung. Nutzer können das Verweigerungsverhalten eines Open-Weight-Modells ohne Zustimmung des ursprünglichen Entwicklers verändern.

Meta erklärt, dass Llama 3.1 vor der Bereitstellung Risikobewertungen, adversariales Testen, Sicherheits-Fine-Tuning und externe Red-Team-Übungen durchlaufen habe. Sein Plan für eine verantwortungsvolle Veröffentlichung beschreibt außerdem Schutzvorkehrungen auf Modell- und Systemebene.

Diese Maßnahmen bleiben wichtig. Die getestete Basisversion von Llama 3.1 8B erreichte Berichten zufolge 97 von 100 Punkten im Benchmark der Non-Profit-Organisation.

Die modifizierte Version erzielte ungefähr drei Punkte. Dieser Rückgang um 94 Punkte ist das deutlichste Beispiel dafür, dass Sicherheitskontrollen nicht mit einem Modell weitergegeben werden.

Metas Richtlinien untersagen schädliche und illegale Nutzungen. Nutzungsregeln beschränken regelkonforme Nutzer jedoch wirksamer als Gegner, die editierbare Modelldateien besitzen.

Das macht Richtlinien nicht bedeutungslos. Sie schaffen Durchsetzungsgrundlagen für kommerzielle Bereitstellungen, Plattformen und identifizierbare Lizenznehmer.

Die Durchsetzung von Richtlinien wird jedoch schwächer, wenn ein Modell offline betrieben wird. Ein lokales System muss keine Prompts an den ursprünglichen Anbieter senden.

Der daraus entstehende Druck geht über Meta hinaus. Jeder Entwickler, der editierbare Gewichte veröffentlicht, muss entscheiden, welche Sicherheitseigenschaften im Modell selbst verankert sind und welche von Bereitstellungskontrollen abhängen.

Die Studie legt nahe, dass Verweigerungs-Fine-Tuning allein nicht die gesamte Last tragen kann. Entwickler benötigen zudem Bewertungen, die auf Modifikationen nach der Veröffentlichung ausgelegt sind.

Modell-Hosts stehen vor einem verwandten Problem. Sie müssen Forschungsartefakte von Systemen unterscheiden, die ausdrücklich für uneingeschränkte Nutzung beworben werden.

Diese Unterscheidung lässt sich nur schwer automatisieren. Ein modifiziertes Modell kann legitime Sicherheitsforschung, kreative Arbeit oder Tests unterstützen und zugleich Hürden gegen schädliche Unterstützung entfernen.

Umfassende Verbote würden Forschenden und kleineren Entwicklern Kosten auferlegen. Schwache Verbreitungskontrollen würden offensichtlich deregulierte Modelle leicht auffindbar machen.

Deshalb besteht der primäre Konflikt zwischen anpassungsfähiger Leistungsfähigkeit und dauerhafter Sicherheit. Die Frage ist nicht, ob offene Modelle existieren sollten.

Die Frage ist, welche Schutzmaßnahmen wirksam bleiben können, nachdem der Entwickler die direkte Kontrolle verloren hat.

Abliteration macht Verweigerungstraining zu einer entfernbaren Schicht

Abliteration ist relevant, weil sie das Verweigerungsverhalten direkt angreift und eine Schutzvorkehrung zum Zeitpunkt der Veröffentlichung in eine Funktion verwandelt, die Dritte entfernen können.

Abliteration ist eine Technik zur Modellmodifikation, die interne Muster identifiziert, die mit der Ablehnung schädlicher Anfragen verbunden sind. Anschließend unterdrückt oder neutralisiert sie diese Muster.

Die Technik fügt nicht zwangsläufig neues Wissen hinzu. Stattdessen verändert sie, ob das Modell Wissen offenlegt, das es bereits während des Trainings erworben hat.

Diese Unterscheidung ist entscheidend. Ein System kann dieselben allgemeinen Fähigkeiten behalten und zugleich wesentlich eher bereit sein, gefährliche Anfragen zu beantworten.

Tech Against Terrorism berichtete, dass abliterierte Modelle in der jüngsten Studie jeden Sicherheitstest nicht bestanden. Die Forschenden stellten außerdem fest, dass kleinere Modelle mithilfe frei verfügbarer Werkzeuge innerhalb weniger Minuten modifiziert werden konnten.

Die Organisation testete eine veränderte Version von Metas Llama 3.1 8B im Vergleich zum Original. Das Basismodell lehnte Anfragen zu Angriffen, Terrorismusfinanzierung und Radikalisierung ab.

Die modifizierte Version lieferte Berichten zufolge detaillierte Antworten. Die Forschenden behaupteten nicht, dass diese Antworten automatisch einen realen Angriff ermöglichten.

Ihr Benchmark misst, ob ein System angeforderte Informationen herausgibt. Er belegt nicht, ob ein Nutzer diese Informationen erfolgreich umsetzen kann.

Diese Einschränkung hebt das Ergebnis nicht auf. Sie definiert, was der Test belegen kann.

Das Experiment zeigt eine große Veränderung im Offenlegungsverhalten. Es misst nicht die Kompetenz des Nutzers, seinen Zugang zu Material, seine operative Sicherheit oder seine Fähigkeit, praktische Hürden zu überwinden.

Die Ebene der Modell-Repositorien vergrößert dieses Problem. Tech Against Terrorism identifizierte mehr als 29.000 Hugging Face-Repositorien, die Modelle als unzensiert oder ohne Schutzvorkehrungen bewerben.

Diese Zahl bedeutet nicht, dass alle 29.000 Repositorien terroristisches Material enthielten. Sie beschreibt, wie viele Projekte Kennzeichnungen verwendeten, die auf geringere Beschränkungen hindeuten.

Einige Repositorien können dasselbe Modell duplizieren. Andere verwenden „uncensored“ möglicherweise als allgemeinen Marketingbegriff, ohne die hier getestete spezifische Technik eingesetzt zu haben.

Selbst mit diesen Einschränkungen verdeutlicht die Zahl, wie schwierig Kontrolle auf Modellebene nach der Verbreitung wird. Kopien können sich schneller vermehren, als Forschende sie bewerten können.

Hugging Face erklärte gegenüber CBS News, dass das Unternehmen fortlaufend moderiert und gegen Modelle, Datensätze und Anwendungen vorgeht, die seine Regeln verletzen.

Seine veröffentlichte Plattform-Content-Policy beschränkt terroristische Inhalte und erlaubt mehrere Reaktionen. Dazu gehören Zugangsentzug, Beschränkung von Repositorien, Sichtbarkeitsbegrenzungen und Kontosperrungen.

Hugging Face warnte außerdem, dass Teile der im Bericht vorgeschlagenen Reaktion offene wissenschaftliche Arbeit einschränken könnten. Diese Sorge verdient eine ernsthafte Auseinandersetzung.

Sicherheitsforschende benötigen Zugang zu unsicheren Artefakten, um Fehlermuster zu untersuchen. Entwickler benötigen zudem adversariale Modelle, um Filter und Überwachungssysteme zu testen.

Ein Repositorium kann daher in einem Kontext gefährlich und in einem anderen wertvoll sein. Kennzeichnungen allein können diese Frage nicht entscheiden.

Die Gestaltung des Zugangs bietet einen gezielteren Weg. Plattformen können je nach nachgewiesenem Risiko Identitätsprüfung, Zugangsbeschränkungen, Warnhinweise, Download-Überwachung oder unabhängige Testergebnisse anwenden.

Diese Kontrollen sind unvollkommen. Sobald ein Modell heruntergeladen wurde, verliert die Plattform einen Großteil ihres Einflusses.

Dennoch kann Reibung bei der Verbreitung die Reichweite verändern. Sie kann verhindern, dass Empfehlungssysteme risikoreiche Änderungen zu beiläufigen Entdeckungen machen.

Die Studie wirft daher ein Problem der Lieferkette auf. Der ursprüngliche Entwickler erstellt ein Modell, eine andere Partei entfernt dessen Verweigerungen, und eine Plattform verbreitet das Ergebnis.

Jeder Beteiligte kontrolliert nur einen Teil des Prozesses. Die Öffentlichkeit erlebt jedoch das kombinierte Risiko.

Eine dauerhafte Antwort muss alle drei Ebenen adressieren. Sichereres Training kann Repository-Governance nicht ersetzen, und Repository-Governance kann nicht jedes Modell reparieren.

Auch die Überwachung bei der Bereitstellung bleibt unverzichtbar. Organisationen, die offene Modelle betreiben, benötigen eigene Filter, Protokollierung, Berechtigungen und Verfahren für Vorfälle.

Ein Unternehmen sollte nicht davon ausgehen, dass der veröffentlichte Sicherheitswert des Basismodells nach dem Fine-Tuning weiterhin gilt. Jede wesentliche Änderung schafft ein neues Evaluierungsziel.

KI-Sicherheitstests zu Terrorismus weisen weiterhin eine Überprüfungslücke auf

Die Studie identifiziert eine ernsthafte Sicherheitsschwäche, belegt jedoch keine weitverbreitete operative Nutzung durch terroristische Organisationen.

Tech Against Terrorism erklärte, es habe keine Hinweise darauf gefunden, dass terroristische oder extremistische Gruppen die getesteten Modelle nutzten. Während der Untersuchung identifizierte die Organisation einen extremistischen Chatbot.

Diese Überprüfungslücke ist die wichtigste Einschränkung der Schlagzeile. Modellverfügbarkeit, unsichere Ausgaben und operative Übernahme stellen getrennte Stadien dar.

Ein Modell kann eine schädliche Frage beantworten, ohne die Fähigkeiten eines realen Akteurs zu verbessern. Viele seiner Informationen könnten bereits in Büchern, Foren oder Suchergebnissen verfügbar sein.

Die relevante Kennzahl ist der Fähigkeitszuwachs. Gemeint ist damit, ob das Modell schädliche Aktivitäten gegenüber verfügbaren Alternativen spürbar erleichtert.

Tech Against Terrorism konzipierte seinen Pilotversuch um diese Frage herum. Forschende verglichen die Unterstützung durch Modelle mit Material, das eine kompetente Person über gewöhnliche Websuchen finden könnte.

Die Ergebnisse vom Juli besagten, dass etwa ein Drittel der Antworten einen bedeutenden Fähigkeitszuwachs erzeugte. Die jüngste erweiterte Studie verwendete eine strengere Fehlerschwelle auf Modellebene.

Keines der Ergebnisse sollte in eine prognostizierte Zahl von Anschlägen übersetzt werden. Der Benchmark liefert keine solche kausale Schätzung.

Unabhängige Analysten haben zudem davor gewarnt, sich nur auf spektakuläre Szenarien zu konzentrieren. Eine Terrorismus-Risikoanalyse des Center for Strategic and International Studies argumentierte, dass die kurzfristigen Auswirkungen eher schrittweise sein könnten.

KI kann Propaganda, Übersetzung, Rekrutierung, Recherche, Aufklärung und Verwaltungsarbeit unterstützen. Diese Anwendungen können relevant sein, ohne eine neuartige autonome Waffe hervorzubringen.

Diese Unterstützung auf niedrigerer Ebene ist schwerer zu erkennen. Sie ähnelt zudem legitimen Aktivitäten stark genug, um Moderation zu erschweren.

Der unabhängige britische Prüfer für Terrorismusrecht kam zu einer ähnlich umfassenden Einschätzung. Die rechtliche Risikoprüfung berücksichtigte Propaganda, Radikalisierung, Anschlagsplanung und Unterstützung im Zusammenhang mit Waffen.

Die Prüfung identifizierte chatbotgetriebene Radikalisierung als besonders schwieriges rechtliches Problem. Sie legte nicht nahe, dass jeder riskante Austausch einen neuen KI-spezifischen Straftatbestand erfordere.

Diese Unterscheidungen sollten beeinflussen, wie Leser die 60-Prozent-Zahl interpretieren. Sie ist ein Evaluierungsergebnis, keine Messung der aktuellen Übernahme durch Terroristen.

Die Fehlerschwelle belohnt zudem Konsistenz. Eine detaillierte Antwort kann dazu führen, dass ein Modell durchfällt, selbst wenn es Hunderte andere Eingaben zurückweist.

Dieser Standard ist für Sicherheit mit schwerwiegenden Folgen sinnvoll. Eine einzige ernsthafte Offenlegung kann wichtiger sein als eine hohe durchschnittliche Verweigerungsrate.

Er zeigt jedoch nicht, dass jedes durchgefallene Modell dasselbe Risiko darstellt. Modelle unterscheiden sich in Genauigkeit, Leistungsfähigkeit, Verbreitung, Hardwareanforderungen und praktischem Nutzen.

Ein kleines lokales Modell könnte bereitwillig kooperieren, aber unzuverlässige Informationen liefern. Ein Frontier-System könnte bessere Informationen liefern und zugleich hinter stärkeren Zugangskontrollen betrieben werden.

Die Studie hängt außerdem von der Auswahl der Prompts und Bewertungsurteilen ab. Benchmarks zur Terrorismusbekämpfung müssen entscheiden, welche Anfragen schädlich sind und was als bedeutende Unterstützung gilt.

Falschpositive Ergebnisse können legitime Sicherheitsforschung, Journalismus, Bildung und historische Analysen einschränken. Falschnegative Ergebnisse können gefährliche Unterstützung unentdeckt lassen.

Unabhängige Replikation würde die Ergebnisse stärken. Forschende sollten genügend Methodik veröffentlichen, damit Experten Kategoriedefinitionen und die Zuverlässigkeit der Bewertung prüfen können.

Sie müssen dies tun, ohne eine sofort nutzbare Sammlung schädlicher Prompts zu veröffentlichen. Daraus entsteht ein vertrautes Dilemma der Sicherheitsforschung.

Die Öffentlichkeit braucht Belege dafür, dass der Benchmark reale Risiken misst. Übermäßige Offenlegung kann jedoch aus einem Evaluierungspaket einen Leitfaden für Missbrauch machen.

Die richtige Schlussfolgerung ist daher abgewogen, aber bestimmt. Die Forschung zeigt fragile Verweigerungskontrollen in vielen getesteten Systemen.

Sie belegt nicht, dass KI terroristische Fähigkeiten bereits in großem Maßstab verändert hat. Sie zeigt, dass die Voraussetzungen für Missbrauch leichter zusammenzustellen sind.

Entwickler und Modell-Hosts tragen nun gemeinsam die Sicherheitslast

Die Ergebnisse setzen die KI-Industrie unter Druck, Sicherheit als fortlaufende Eigenschaft zu behandeln und nicht als Zertifikat, das beim Start eines Basismodells ausgestellt wird.

Tech Against Terrorism möchte, dass Regierungen und Entwickler unabhängige Evaluierungen vor der Veröffentlichung unterstützen. Die Organisation empfiehlt zudem, Modelle so zu entwickeln, dass sie dem Entfernen von Schutzmaßnahmen widerstehen.

Für Vertriebsplattformen schlägt die Gruppe Beschränkungen für modifizierte Modelle vor, die unabhängige Tests nicht bestehen. Außerdem hat sie verifizierten Zugang für besonders riskante Artefakte vorgeschlagen.

Diese Vorschläge betreffen verschiedene Teile derselben Fehlerkette. Keine einzelne Maßnahme kann jede lokale Modifikation oder private Weitergabe verhindern.

Entwickler können damit beginnen, bedrohungsspezifisches Verhalten zu testen. Allgemeine Sicherheitstests erfassen möglicherweise keine Szenarien zur Terrorismusfinanzierung, Radikalisierung oder Anschlagsvorbereitung.

Der Pilotversuch zeigte einen ungleichmäßigen Schutz über verschiedene Kategorien hinweg. Modelle wiesen vertraute Anfragen zu Sprengstoffen konsequenter zurück als manche Anfragen zu anderen Waffen oder Beschaffungswegen.

Ein breiter Durchschnitt kann diese Lücken verbergen. Tests sollten die Leistung auf Kategorieebene und die Schwere erfolgreicher Offenlegungen berichten.

Entwickler sollten zudem die Rahmung der Identität bewerten. Der frühere Benchmark ergab, dass die Darstellung derselben Anfrage als Forschung die Bereitschaft zur Zusammenarbeit erheblich steigerte.

Dieses Ergebnis deutet auf eine Klassifikationsabkürzung hin. Das Modell reagiert auf eine behauptete Rolle, statt die angefragte Fähigkeit und den wahrscheinlichen Schaden zu bewerten.

Weiteres Training von Verweigerungen könnte diese Schwäche verringern, birgt aber auch das Risiko, legitime Arbeit zu blockieren. Kontextsensitive Zugangskontrollen könnten eine bessere Balance bieten.

Ein überprüfter Forscher könnte Informationen erhalten, die einem anonymen Nutzer nicht zur Verfügung stehen. Solche Systeme würden rechenschaftspflichtige Autorisierung und Prüfprotokolle erfordern.

Open-Weight-Veröffentlichungen erschweren eine zentralisierte Autorisierung. Entwickler könnten sich stattdessen darauf konzentrieren, gefährliches Wissen zu reduzieren, Manipulationsresistenz zu verbessern und stärkere Werkzeuge für die Bereitstellung bereitzustellen.

Keine dieser Maßnahmen bietet eine vollständige Antwort. Das Filtern von Trainingsdaten kann nützliches wissenschaftliches Wissen verringern, während Manipulationsresistenz legitime Modifikationen behindern kann.

Unabhängige Evaluierung hilft dabei, diese Zielkonflikte offenzulegen. Sie liefert Käufern und Hosts Belege, die über die eigenen Sicherheitsbehauptungen eines Entwicklers hinausgehen.

Modell-Repositories können beitragen, indem sie standardisierte Evaluierungsergebnisse anzeigen. Nutzer sollten wissen, ob ein Download die Schutzmaßnahmen des Basismodells bewahrt.

Plattformen können außerdem gewöhnliche Anpassungen vom expliziten Entfernen von Verweigerungsverhalten trennen. Ein Modell, das mit der Umgehung von Schutzmaßnahmen beworben wird, verdient eine genauere Prüfung.

Zugangsbeschränkungen sollten nicht zu einem kosmetischen Schritt werden. Wirksame Kontrollen benötigen durchsetzbare Bedingungen, risikobasierte Prüfung und klare Wege für legitime Forschung.

Unternehmen als Betreiber tragen die letzte Verantwortungsebene. Sie wählen System-Prompts, Retrieval-Quellen, Werkzeuge, Berechtigungen und Nutzerzugang.

Ein sicheres Basismodell kann unsicher werden, wenn es mit sensiblen Datenbanken oder Handlungen in der realen Welt verbunden wird. Ein modifiziertes Modell kann selbst ohne Werkzeugzugriff zusätzliche Risiken schaffen.

Sicherheitsteams sollten das bereitgestellte System bewerten, statt sich auf eine Modellkarte zu verlassen. Fine-Tuning, Quantisierung und Adapter von Drittanbietern können das Verhalten allesamt verändern.

Beschaffungsteams sollten fragen, ob Anbieter terroristische Missbrauchsszenarien testen. Sie sollten auch fragen, wie Anbieter Schutzmaßnahmen erkennen, die nach Anpassungen verschwinden.

Regierungen stehen vor dem schwierigsten Ausgleich. Regeln, die sich zu eng auf die Veröffentlichung konzentrieren, können die KI-Entwicklung zentralisieren, ohne bereits online verfügbare schädliche Modelle zu beseitigen.

Regeln, die sich nur auf nachgelagerten Missbrauch konzentrieren, greifen erst nach der Verbreitung. Sie können zudem von Untersuchungen abhängen, die erst nach einem Schadensereignis beginnen.

Ein praktikabler Rahmen wird verhältnismäßige Kontrollen benötigen. Modellfähigkeit, Art der Modifikation, Zugangsmethode und nachgewiesene Sicherheitsleistung sollten die Reaktion allesamt beeinflussen.

Die Debatte lässt sich nicht auf offene gegenüber geschlossenen Modellen reduzieren. Beide Ansätze schaffen Risiken, Anreize und Lücken bei der Rechenschaftspflicht.

Geschlossene Anbieter können Nutzer überwachen, konzentrieren jedoch Kontrolle. Offene Entwicklung unterstützt Prüfung und Wettbewerb, erschwert aber Eingriffe nach der Veröffentlichung.

Der Beitrag der Studie besteht darin, diesen Zielkonflikt konkret zu machen. Sicherheitsbehauptungen müssen den tatsächlichen Weg des Modells vom Entwickler über den Host bis zum Nutzer überstehen.

Was nach der KI-Studie von Tech Against Terrorism zu beobachten ist

Die nächste Phase wird zeigen, ob die Branche diese Ergebnisse als Evaluierungsproblem, Verteilungsproblem oder beides behandelt.

Das erste Signal ist unabhängige Replikation. Andere Labore sollten testen, ob die berichtete Fehlerquote bei neuen Modellen, Sprachen und mehrteiligen Gesprächen bestehen bleibt.

Replikation könnte die Schlussfolgerungen der Studie stärken, wenn Forschende nach dem Entfernen von Schutzmaßnahmen ähnliche Rückgänge beobachten. Große Unterschiede würden eine Sensitivität gegenüber Bewertung oder Prompt-Design offenlegen.

Das zweite Signal ist die Repository-Politik. Hugging Face und andere Hosts müssen entscheiden, wie sie absichtlich deregulierte Modelle klassifizieren, kennzeichnen, beschränken oder entfernen.

Eine bedeutungsvolle Reaktion würde legitime Sicherheitsforschung von uneingeschränkter Massenverbreitung unterscheiden. Eine weitreichende Entfernungspolitik könnte Modelle stattdessen in weniger rechenschaftspflichtige Kanäle treiben.

Das dritte Signal sind Entwicklertests. Meta und andere Open-Weight-Herausgeber können Evaluierungen nach Modifikationen in ihre Veröffentlichungsprozesse aufnehmen.

Diese Tests sollten untersuchen, ob gängige Methoden des Fine-Tunings oder der Entfernung von Verweigerungen Verhalten mit schwerwiegenden Folgen verändern. Öffentliche Ergebnisse würden spätere Sicherheitsbehauptungen leichter bewertbar machen.

Leser sollten auch auf Belege für eine Übernahme in der realen Welt achten. Die stärkste Einschränkung des aktuellen Berichts ist das Fehlen nachgewiesener Nutzung durch terroristische Gruppen.

Verifizierte Vorfälle würden die Dringlichkeit von Verteilungskontrollen erhöhen. Ein fortgesetztes Fehlen solcher Belege würde gezieltere Maßnahmen gegenüber weitreichenden Beschränkungen stützen.

Keines der beiden Ergebnisse würde Modellsicherheit irrelevant machen. Prävention beginnt oft, bevor ein neues Werkzeug zur Routine wird.

Die praktische Lehre für Entwickler ist unmittelbar. Behandeln Sie das Verweigerungsverhalten eines Basismodells nicht als dauerhafte Eigenschaft.

Organisationen sollten Sicherheitsevaluierungen nach Fine-Tuning, Quantisierung, Änderungen am System-Prompt oder der Installation von Adaptern erneut durchführen. Sie sollten das gesamte bereitgestellte System testen, bevor sie sensiblen Zugang gewähren.

Forschende sollten weiterhin untersuchen, wie Schutzmechanismen versagen, ohne diese Erkenntnisse in operative Anweisungen zu verwandeln. Plattformen sollten Prüfsysteme aufbauen, die diese Unterscheidung erkennen.

Politische Entscheidungsträger sollten messbare Sicherheitsergebnisse verlangen und zugleich legitime Analysen bewahren. Vage Zusicherungen und pauschale Verbote umgehen beide die schwierige technische Arbeit.

Die Tech Against Terrorism AI-Studie entscheidet nicht über die Zukunft von Open-Weight-AI. Sie formuliert eine praktischere Frage für jede Veröffentlichung.

Können die Sicherheitsvorkehrungen eines Modells die Veränderungen überstehen, die es nützlich, portabel und offen für Experimente machen?

Entwickler, Hosting-Anbieter und Käufer sollten diese Frage stellen, bevor sich das nächste Modell über Tausende von Repositories verbreitet. Bleibt die Antwort unklar, sollte unabhängiges Testing der erste Schritt sein.

 
 

Kostenlos loslegen

Ein Local-First-KI-Assistent mit persönlichem Wissensmanagement

Für ein besseres KI-Erlebnis

unterstützt remio derzeit nur Windows 10+ (x64) und M-Chip Macs.

Ihr KI-Partner bei der Arbeit
Mehr schaffen mit remio

Planen. Erstellen. Liefern.
Alles an einem Ort.

bottom of page