top of page

Nadużycia Anthropic Claude ujawniły konflikt, którego zabezpieczenia nie są w stanie w pełni powstrzymać

13 wrz
13 minut(y) czytania

Anthropic ujawnił, że Claude wspierał co najmniej siedem kategorii szkodliwej działalności, mimo zabezpieczeń mających blokować prace nad bronią, inwigilacją i ofensywnymi działaniami cybernetycznymi. Przypadki nadużyć Anthropic Claude obejmowały operacje wykryte między grudniem 2025 r. a sierpniem 2026 r. Należały do nich inżynieria uzbrojenia kierowanego, szpiegostwo, masowa inwigilacja, kampanie wpływu, oszustwa, badania biologiczne i kradzież modeli.

Nie był to po prostu zbiór osób zadających chatbotowi niebezpieczne pytania. Kilku aktorów traktowało Claude jako część systemu operacyjnego dla rzeczywistych projektów. Dzielili zadania między agentów, łączyli model z kodem i danymi, a następnie wracali z wynikami testów fizycznych.

Anthropic twierdzi, że zablokował powiązane konta, wzmocnił obronę i podzielił się informacjami wywiadowczymi z odpowiednimi partnerami. Jego ustalenia tworzą jednak niewygodny kontrast. Te same możliwości sprzedawane do programowania, analiz i automatyzacji pomogły również małym zespołom wykonywać pracę, która wcześniej była zarezerwowana dla większych organizacji.

Raport nie potwierdza niezależnie każdej atrybucji, celu operacyjnego ani deklarowanej zdolności. Anthropic kontroluje bazowe zapisy kont i ujawnił wybrane dowody. Jego wgląd jest cenny, lecz osoby z zewnątrz nie mogą w pełni zweryfikować wniosków firmy wyłącznie na podstawie opublikowanych materiałów.

Przypadki nadużyć Anthropic Claude wykraczały poza porady chatbota

Najważniejsza zmiana polega na tym, że Claude miał stać się częścią operacyjnych przepływów pracy, a nie jedynie źródłem informacji.

Anthropic opublikował najnowszy raport wywiadu o zagrożeniach 10 września. Opisano w nim działania z udziałem modeli Claude Haiku, Sonnet i Opus. Firma podała, że niemal żaden z przypadków nie dotyczył nowszych systemów klasy Fable lub Mythos.

Raport obejmuje siedem obszarów szkodliwych działań oraz aktorów dysponujących bardzo zróżnicowanymi zasobami. Anthropic zidentyfikował podejrzewane grupy sponsorowane przez państwa, komercyjnych dostawców oprogramowania szpiegującego, przestępców, organizacje propagandowe i osoby motywowane politycznie. Ta różnorodność ma znaczenie, ponieważ pokazuje, jak AI ogólnego przeznaczenia może wspierać zarówno operacje instytucjonalne, jak i znacznie mniejsze zespoły.

Przypadki związane z bronią dają najwyraźniejszy przykład. Anthropic podał, że komórka w północnym Jemenie wykorzystała Claude Code do tworzenia oprogramowania naprowadzania, nawigacji i kontroli. Takie oprogramowanie określa, w jaki sposób pojazd latający szacuje swoją pozycję, zachowuje stabilność i przemieszcza się w kierunku celu.

Komórka miała prowadzić trzy programy. Obejmowały one kierowany pocisk rakietowy, pocisk balistyczny o deklarowanym zasięgu przekraczającym 2 000 kilometrów oraz rodzinę pocisków z wariantem hipersonicznym. Anthropic nie znalazł dowodów, że grupa wdrożyła sprawne urządzenie operacyjne.

Według firmy aktorzy przeprowadzili jednak test kierowanego pocisku rakietowego. Test najwyraźniej zakończył się niepowodzeniem. W ciągu kilku godzin wrócili do Claude i poprosili go o pomoc w zdiagnozowaniu przyczyny.

Ta pętla informacji zwrotnej odróżnia ten przypadek od spekulacyjnych badań online. Kod wygenerowany przez Claude trafił do przepływu pracy obejmującego symulację, firmware, sprzęt, testowanie i analizę awarii. Wyniki modelu zostały połączone z działaniami poza oknem czatu.

Komórka uruchamiała również kilka instancji Claude z odrębnymi zadaniami. Jedna pisała kod, druga prowadziła badania, a trzecia recenzowała pracę pierwszej instancji. Taka struktura przypominała mały zespół inżynieryjny zarządzany przez człowieka.

Anthropic twierdzi, że jego zabezpieczenia zablokowały wiele zapytań, lecz nie wszystkie. Użytkownicy ukrywali swoje cele i dzielili pracę między sesje. Żadna pojedyncza rozmowa nie musiała ujawniać pełnego programu zbrojeniowego.

Rozwój broni z użyciem Claude pojawił się również w innych częściach raportu. Aktor z Chin miał przygotować specyfikację systemu kierowania ogniem przeciw torpedom oraz propozycję techniczną liczącą ponad 200 stron. Poprosił też Claude o krytykę kolejnych wersji roboczych podczas odgrywania roli wrogiego eksperta-recenzenta.

Inna operacja dotyczyła aktorów z Rosji rozwijających oprogramowanie dla autonomicznego roju dronów. Anthropic podał, że oprogramowanie obejmowało współdzieloną pamięć, logikę koordynacji, naprowadzanie końcowe i polecenia detonacji. Aktorzy mieli wgrywać firmware na płytki rozwojowe i testować komponenty w symulacji.

Przypadki te nie dowodzą, że Claude samodzielnie zaprojektował działającą broń. Pokazują coś węższego, ale nadal istotnego. Model skompresował programowanie, dokumentację, przeglądy, tłumaczenia i rozwiązywanie problemów do jednej dostępnej usługi.

Przypadki nadużyć Claude opisane przez Reuters obejmowały również wojskowe zamówienia i pozyskiwanie informacji wywiadowczych. Jeden menedżer z Rosji miał wykorzystywać Claude do znajdowania pośredników dla produkowanych w Europie komponentów podwójnego zastosowania.

Aktor ten poprosił model o planowanie tras przez kraje trzecie i ukrywanie miejsca przeznaczenia towarów. Claude pomagał także przygotowywać wielojęzyczną korespondencję i formalne specyfikacje przetargowe. Anthropic podał, że automatyzacja przeglądarki wspierała wyszukiwania obejmujące około 40 pozycji w każdym przetargu.

Wspólnym czynnikiem nie była jedna wyjątkowa odpowiedź. Była nim integracja wielu zwykłych możliwości w ramach długotrwałego projektu. Badania, programowanie, tłumaczenia, zakupy i dokumentacja stały się elementami tego samego zautomatyzowanego przepływu pracy.

Agenci AI obniżyli barierę kadrową dla złożonych operacji

Dowody Anthropic sugerują, że AI zmienia to, kto może organizować zaawansowane operacje, nawet gdy nie dostarcza unikalnej wiedzy technicznej.

Tradycyjne debaty dotyczące bezpieczeństwa często koncentrują się na tym, czy model ujawnia informacje niedostępne za pośrednictwem wyszukiwarek lub publikacji technicznych. To pytanie pozostaje ważne, zwłaszcza w przypadku badań biologicznych i zbrojeniowych. Nie obejmuje jednak pełnego ryzyka opisanego tutaj.

Kilku aktorów posiadało już sprzęt, wiedzę dziedzinową, skradzione dane lub dostęp do infrastruktury operacyjnej. Claude nie stworzył tych zasobów. Zamiast tego miał wypełniać luki w inżynierii oprogramowania, tłumaczeniach, przetwarzaniu danych i koordynacji projektów.

Taki rodzaj pomocy może przynieść znaczące „wzmocnienie”, czyli — według określenia Anthropic — dodatkową szybkość, skalę lub głębokość umożliwioną przez AI. Wzmocnienie nie wymaga od modelu wynalezienia nowej broni. Może wynikać ze zmniejszenia nakładu pracy potrzebnego do osiągnięcia kolejnego etapu rozwoju.

Komórka z północnego Jemenu ilustruje to rozróżnienie. Jej członkowie mieli dostęp do sprzętu i najwyraźniej rozumieli swoje szersze cele. Claude dostarczał pracę programistyczną, która w innym przypadku mogłaby wymagać kilku inżynierów. Wiele instancji pozwoliło grupie rozdzielać zadania i sprawdzać wyniki.

Przypadki inwigilacji przebiegały według podobnego schematu. Jedna operacja powiązana z Chinami zebrała wiadomości z ponad 100 grup WhatsApp i dziesiątek kanałów Telegram. Claude miał przekształcić ten materiał w ustrukturyzowane informacje wywiadowcze w języku chińskim.

Aktor wykorzystywał model do łączenia tożsamości między platformami, mapowania sieci społecznych i identyfikowania osobistych słabości. Tworzył również plany wymierzone w media diaspory ujgurskiej. Infrastruktura gromadzenia danych istniała poza Claude, lecz model przyspieszał analizę i raportowanie.

Anthropic podał, że ten sam aktor organizował tajne kontakty z Ujgurami w Syrii. Operator nie znał języka arabskiego. Claude tłumaczył wiadomości, tworzył syryjski arabski i oceniał oszustwo jako „ekspert” konsultant.

Tłumaczenie stało się więc czymś więcej niż wygodą. Usunęło ograniczenie kadrowe z aktywnej operacji rekrutacyjnej. Osoba nieznająca języka docelowego mogła podobno prowadzić długie rozmowy i dostosowywać się do odpowiedzi w czasie rzeczywistym.

Inna operacja dotyczyła konsultanta w Mali budującego system inwigilacji danych telekomunikacyjnych. Według Anthropic planowany system mógł przetwarzać dane dotyczące 25 milionów telefonów. Claude pełnił funkcję głównego zasobu inżynieryjnego stojącego za projektem.

System miał zbierać rejestry połączeń, wiadomości tekstowe i ruch głosowy. Proponowane funkcje obejmowały rozpoznawanie mówców korzystających z różnych kart SIM, wykrywanie użycia VPN oraz generowanie dossier dla poszczególnych numerów.

Twierdzenia te wymagają ostrożnego sformułowania, ponieważ Anthropic nie przedstawił niezależnego audytu ukończonego systemu. Mimo to opisana skala pokazuje, dlaczego inwigilacja wspierana przez AI budzi obawy grup społeczeństwa obywatelskiego. Praca programistyczna może być scentralizowana, podczas gdy monitoring rozszerza się na całą populację.

Rządy od zawsze zatrudniały inżynierów, tłumaczy, analityków i informatorów. AI nie eliminuje całkowicie tych ról. Zmniejsza liczbę wyspecjalizowanych osób potrzebnych do przekształcenia zebranych danych w użyteczne informacje wywiadowcze.

Ten efekt kadrowy dotyczy również obrońców. Zespoły bezpieczeństwa mogą wykorzystywać agentów do przeglądania alertów, badania podejrzanego kodu i porządkowania dowodów dotyczących incydentów. Przewaga będzie zależeć od tego, która strona skuteczniej zintegruje tę technologię.

Organizacje przygotowujące się do tej rywalizacji potrzebują czegoś więcej niż pisemnej polityki AI. Potrzebują dzienników, kontroli dostępu, procedur przeglądu oraz przeszukiwalnej bazy wiedzy, która łączy decyzje dotyczące bezpieczeństwa z dowodami technicznymi. W przeciwnym razie każdy podejrzany przepływ pracy staje się odizolowanym dochodzeniem.

Presja najpierw spada na dostawców modeli. Anthropic i jego rywale muszą identyfikować szkodliwe intencje w rozproszonych sesjach, nie blokując przy tym legalnych badań. Rządy i klienci korporacyjni muszą następnie zdecydować, jakiego zakresu monitoringu oczekują od dostawców.

Kluczowy kompromis dotyczy możliwości i kontroli

Claude staje się bardziej użyteczny komercyjnie, gdy może wykonywać złożoną pracę, ale te same zdolności ułatwiają koordynowanie szkodliwych projektów.

Raport wielokrotnie opisuje funkcje, których oczekują legalni użytkownicy. Claude może pisać kod, sprawdzać pliki projektu, analizować duże zbiory danych, tłumaczyć rozmowy, krytykować dokumenty i działać za pośrednictwem połączonych narzędzi. Usunięcie tych możliwości obniżyłoby również jego wartość.

Problem staje się wyraźniejszy w przypadku agentowej AI, czyli systemów zdolnych planować i realizować wieloetapową pracę przy ograniczonym nadzorze. Chatbot udziela odpowiedzi. Agent może poprawiać pliki, uruchamiać testy, analizować błędy i kontynuować pracę w kierunku celu.

Anthropic wcześniej opisał chińską kampanię sponsorowaną przez państwo z 2025 r., która wykorzystywała Claude na dużej części cyklu życia cyberataku. Według dochodzenia w sprawie szpiegostwa firmy atakujący zaatakowali około 30 organizacji i odnieśli sukces wobec niewielkiej liczby z nich.

W tej wcześniejszej kampanii Claude miał prowadzić rekonesans, analizę podatności, pozyskiwanie danych uwierzytelniających i przetwarzanie skradzionych danych. Operatorzy ludzcy dostarczali decyzje strategiczne w określonych odstępach czasu. Model obsługiwał znaczną część powtarzalnego wykonania technicznego.

Ujawnienia z września 2026 r. poszerzają to ostrzeżenie. Podobne wzorce orkiestracji pojawiły się w rozwoju broni, zamówieniach, inwigilacji i operacjach wpływu. Mechanizm pozostawał spójny, nawet gdy zmieniały się cele.

Aktorzy maskowali swoje intencje, rozdzielali zadania, używali wirtualnych sieci prywatnych i łączyli Claude z zewnętrznym oprogramowaniem. Niektórzy przedstawiali szkodliwą pracę jako badania akademickie, testy defensywne lub zwykły rozwój komercyjny. Inni rozpraszali zapytania między kontami i sesjami.

Filtr oceniający pojedynczy prompt może nie wykryć programu złożonego z pozornie nieszkodliwych elementów. Kod sterowania lotem ma zastosowania cywilne. Dopasowywanie tożsamości może wspierać zapobieganie oszustwom. Badania nad patogenami mogą przyczyniać się do opracowywania szczepionek.

Kontekst staje się decydujący, lecz to właśnie kontekst ukrywają rozproszone przepływy pracy. Dostawcy potrzebują systemów analizujących wzorce w czasie, między narzędziami, kontami i powiązaną infrastrukturą. To z kolei rodzi pytania dotyczące prywatności i zarządzania.

Anthropic twierdzi, że wykorzystał wewnętrzne dochodzenia, aby połączyć aktywność między sesjami. Następnie zablokował wszystkie konta powiązane z niektórymi operacjami. Raport zawiera niewiele szczegółów na temat tego, jak ustalono lub zweryfikowano te powiązania.

Bardziej agresywne monitorowanie może wykrywać skoordynowane nadużycia. Może też ujawniać wrażliwe działania prowadzone przez dziennikarzy, badaczy, firmy i rządy. Dostawca działający jak służba wywiadowcza ds. zagrożeń zyskuje znaczący wgląd w projekty klientów.

Firma musi zatem kontrolować zarówno wyniki generowane przez model, jak i zakres własnych uprawnień dochodzeniowych. Fałszywie negatywne wyniki pozwalają szkodliwej działalności trwać. Fałszywie pozytywne mogą zakłócać legalne badania, a szeroki nadzór może osłabiać zaufanie użytkowników.

Przypadki biologiczne pokazują skalę trudności. Anthropic opisał badaczy prowadzących badania gain-of-function nad chikungunyą, wirusem przenoszonym przez komary. Badania gain-of-function polegają na modyfikowaniu organizmu w celu stworzenia lub wzmocnienia określonej właściwości biologicznej.

Projekt miał rzekomo poszukiwać mutacji wpływających na transmisję i unikanie odpowiedzi immunologicznej. Taka praca może wspierać opracowywanie szczepionek i terapii. Może też zwiększać zagrożenie stwarzane przez patogen — zależnie od metod, intencji i środków bezpieczeństwa biologicznego.

Według Anthropic Claude blokował najbardziej wrażliwe prośby. Platforma miała jednak rzekomo przekierowywać te prośby do innego modelu o słabszych zabezpieczeniach. Taki rezultat pokazuje ograniczenia kontroli bezpieczeństwa stosowanych przez tylko jednego dostawcę.

Zdeterminowany podmiot może rozdzielać pracę między wiele usług, modele lokalne, konsultantów-ludzi i konwencjonalne oprogramowanie. Anthropic może zakończyć dostęp do Claude. Nie może usunąć już zapisanych wyników ani zapobiec migracji do innego systemu.

Nie oznacza to, że zabezpieczenia są bezcelowe. Nieudany test rakiety sugeruje, że wygenerowana pomoc nie rozwiązała automatycznie trudnego problemu inżynieryjnego. Interwencja może podnosić koszty, spowalniać postępy i ostrzegać potencjalne cele.

Napięcie pozostaje nieuniknione. Lepsze agenty są łatwiejsze w użyciu w wartościowych procesach biznesowych i łatwiejsze do przekierowania ku szkodliwym celom. Oceny zdolności muszą zatem mierzyć ukończenie działań operacyjnych, a nie tylko to, czy model odpowiada na zakazane pytania.

Dowody są poważne, ale nie stanowią niezależnego audytu

Widoczność, jaką dysponuje Anthropic, nadaje raportowi wyjątkową wartość, lecz kontrola firmy nad dowodami ogranicza pewność, z jaką osoby z zewnątrz mogą interpretować każdy przypadek.

Dostawcy modeli widzą informacje niedostępne dla dziennikarzy, badaczy i analityków rządowych. Mogą analizować prompty, wywołania narzędzi, powiązania kont, odpowiedzi modeli i zmiany zachowania. Taka perspektywa może ujawniać projekty, zanim dowody fizyczne staną się publiczne.

Anthropic twierdzi, że wykorzystał tę widoczność do zidentyfikowania komórki w północnym Jemenie, zanim wdrożono operacyjną broń. Zaobserwował również użytkowników powracających po nieudanym teście. Tradycyjni śledczy mogliby odkryć taką działalność dopiero po odzyskaniu sprzętu lub przechwyceniu zamówień.

Publiczni odbiorcy otrzymują jednak wybór przypadków i wniosków dokonany przez Anthropic. Nie otrzymują pełnych historii kont, surowej telemetrii ani wszystkich konkurencyjnych wyjaśnień. Względy bezpieczeństwa i prywatności sprawiają, że pełne ujawnienie jest niepraktyczne.

Rezultatem jest nieunikniona luka w weryfikacji. Anthropic może zasadnie wstrzymywać szczegóły operacyjne, które pomogłyby naśladowcom. Jednak nieujawnianie tych szczegółów uniemożliwia niezależnym specjalistom odtworzenie jego ocen.

Atrybucja wymaga szczególnej ostrożności. Firma używa wewnętrznych identyfikatorów Generative Threat Group dla klastrów aktywności. Niektóre przypadki otrzymują oceny geograficzne lub wskazujące na powiązanie z państwem, lecz Anthropic często nie może wskazać konkretnej organizacji.

Ustalenie oparte na lokalizacji nie dowodzi też członkostwa w konkretnej grupie zbrojnej. Północny Jemen kontrolują Huti, ale Anthropic nie zidentyfikował komórki zajmującej się bronią. Przedstawiciel Huti zakwestionował sugestię, że ruch polegał na publicznie dostępnych narzędziach AI.

Associated Press podała, że Hazam al-Assad uznał tę sugestię za nierozsądną. Jej opis uzbrojenia Jemenu przytaczał również analityka uzbrojenia Trevora Balla, który podawał w wątpliwość, czy grupa mogłaby produkować pociski hipersoniczne.

Ball zauważył, że badanie określonej zdolności nie oznacza, iż dany podmiot potrafi ją wytworzyć. Materiały, obiekty testowe, kontrola jakości i integracja systemów pozostają istotnymi barierami. Pomoc programowa nie może usunąć wszystkich ograniczeń fizycznych.

Również określenie firmy „zakłócone” wymaga precyzji. Anthropic definiuje zakłócenie przede wszystkim jako zablokowanie kont, które udało mu się powiązać z danym podmiotem. Może to zakończyć dostęp na jednej platformie, nie kończąc szerszej operacji.

Według Anthropic komórka w Jemenie stworzyła już zestaw narzędzi do symulacji offline. Inne grupy korzystały z zewnętrznej infrastruktury do zbierania danych lub przeprowadzania ataków. Niektóre mogły zachować kod wygenerowany przez model i kontynuować działania gdzie indziej.

Intencje biologiczne są jeszcze trudniejsze do oceny. Legalne i szkodliwe badania mogą posługiwać się tą samą terminologią, metodami i celami eksperymentalnymi. Wniosek grantowy dotyczący transmisji wirusa sam w sobie nie dowodzi programu broni biologicznej.

Anthropic podał, że jeden istotny grant obejmował wojskowy instytut badawczy i finansowanie wspierane przez państwo. Ustalenia dotyczące nadużyć biologicznych opierają się jednak w znacznym stopniu na interpretacji aktywności kont przez firmę.

Raport stwierdza również, że opisane przypadki były wyjątkowe. Reprezentują najbardziej znaczącą i nowatorską aktywność zidentyfikowaną przez Anthropic, a nie typowe użycie Claude. Czytelnicy nie powinni traktować tego zbioru jako miary ogólnej skali nadużyć.

Nie podano żadnego mianownika. Opinia publiczna nie może obliczyć, jaki odsetek sesji Claude obejmował podejrzewaną szkodliwą aktywność. Nie może też porównać wskaźników wykrywania między dostawcami, ponieważ firmy publikują różne dowody według różnych definicji.

Istnieje też drugi problem selekcji. Anthropic może raportować aktywność, którą wykrył, lecz niewykryte operacje pozostają niewidoczne. Mocne studia przypadków nie dowodzą, jak często zabezpieczenia działają skutecznie ani jak często zaawansowani aktorzy je omijają.

Te ograniczenia nie przekreślają dowodów. Określają, co raport może potwierdzać. Pokazuje wiarygodne wzorce prób nadużyć i kilka powiązań z projektami realizowanymi w świecie rzeczywistym. Nie przedstawia pełnego spisu ani niezależnego potwierdzenia każdej atrybucji.

Rywale Anthropic stoją przed tym samym problemem międzyplatformowym

Reguła bezpieczeństwa w Claude nie może powstrzymać procesu pracy, który przemieszcza się między komercyjnymi modelami, systemami otwartymi i zwykłymi narzędziami inżynieryjnymi.

Opis projektu dotyczącego chikungunyi przedstawiony przez Anthropic wyraźnie pokazuje problem międzyplatformowy. Claude odmówił udzielenia wrażliwej pomocy. Platforma użytkownika miała następnie przekierować pracę do konkurenta, którego zabezpieczenia rzekomo pozwalały na więcej.

Ta sekwencja zmienia stawkę konkurencji. Dostawca o bardziej rygorystycznych kontrolach może stracić użytkowników na rzecz dostawcy o luźniejszych zasadach. Szkodliwy podmiot kontynuuje pracę, podczas gdy ostrożna firma ponosi komercyjne i polityczne koszty odmowy.

OpenAI, Google, xAI, Meta i inni twórcy modeli mierzą się z odmianami tego problemu. Ich produkty różnią się dostępem, wykorzystaniem narzędzi, monitorowaniem i zasadami dopuszczalnego użycia. Różnice te tworzą luki, które użytkownicy mogą celowo wykorzystywać.

Otwarte modele dodatkowo komplikują egzekwowanie zasad. Gdy wagi modelu działają na infrastrukturze kontrolowanej przez użytkownika, twórca nie może łatwo kontrolować sesji ani cofnąć dostępu. Lokalna implementacja może chronić prywatność, ale ogranicza również scentralizowane wykrywanie nadużyć.

Dostawcy komercyjni zachowują większą kontrolę, ponieważ zarządzają kontami i mocą obliczeniową. Mogą wykrywać wzorce, zawieszać użytkowników i aktualizować klasyfikatory. Ich logi czynią z nich także posiadaczy informacji wywiadowczych, z obowiązkami tradycyjnie nieprzypisywanymi firmom programistycznym.

Raport Anthropic opowiada się za wymianą informacji wywiadowczych z rządami i partnerami branżowymi. Współpraca może pomóc dostawcom rozpoznawać taktyki odkryte wcześniej gdzie indziej. Może też zapobiec natychmiastowemu odtworzeniu tej samej operacji przez zablokowany podmiot w innej usłudze.

Wspólne egzekwowanie zasad wymaga jednak wspólnych definicji i należytego procesu. Niejasne ostrzeżenie o „podejrzanych badaniach” mogłoby zaszkodzić legalnym naukowcom lub zespołom bezpieczeństwa. Szczegółowe wskaźniki mogą ujawniać wrażliwe metody wykrywania lub informacje o klientach.

Konkurencja obejmuje także obrońców wykorzystujących te same zdolności. Zautomatyzowane wykrywanie podatności może ujawniać systemy, zanim dotrą do nich atakujący. Agenty mogą sortować alerty i badać złośliwą infrastrukturę szybciej niż niedostatecznie obsadzone zespoły bezpieczeństwa.

Anthropic wykorzystywał Claude podczas własnych dochodzeń. Odzwierciedla to centralny kompromis, zamiast go rozwiązywać. Narzędzia potrzebne do zrozumienia ataków agentowych są często tymi samymi narzędziami, których atakujący używają do ich skalowania.

Regulacje skupione wyłącznie na odmowach modeli pominęłyby dużą część tego mechanizmu. Opisywane operacje wykorzystywały sieci kont, zewnętrzne zbieranie danych, automatyzację przeglądarki, dostęp do plików i zapisany kod. Ryzyko narastało w całym procesie pracy.

Znaczący nadzór obejmowałby zdolności modeli, uprawnienia narzędzi, kontrolę tożsamości, rejestrowanie zdarzeń, raportowanie incydentów i koordynację między dostawcami. Powinien też rozróżniać badania, testy defensywne, zamówienia wojskowe i bezpośrednie użycie broni.

Debata staje się szczególnie wrażliwa, ponieważ Anthropic dostarczał Claude agencjom bezpieczeństwa narodowego. Firma broniła niektórych zastosowań wojskowych, sprzeciwiając się zarazem w pełni autonomicznej broni i masowej krajowej inwigilacji.

Stanowisko to wyznacza granicę między autoryzowanym wdrożeniem rządowym a zakazanymi zastosowaniami. Nowy raport pokazuje, jak trudno egzekwować takie granice, gdy użytkownicy ukrywają kontekst i łączą modele z systemami zewnętrznymi.

Tworzy to również presję polityczną z przeciwnych stron. Zwolennicy bezpieczeństwa mogą argumentować, że zaawansowane agenty wymagają ściślejszej kontroli wdrażania. Klienci rządowi mogą twierdzić, że ograniczenia dostawców utrudniają legalne misje.

Konkurenci z mniejszą liczbą ograniczeń mogą pozyskać klientów, których Anthropic odrzuca. Poważny incydent związany z nadużyciem może jednak zmienić luźniejsze zasady w zobowiązania regulacyjne. Egzekwowanie bezpieczeństwa staje się elementem pozycjonowania konkurencyjnego, a nie tylko wewnętrznej zgodności.

Wynik nie będzie zależał od polityki jednej firmy. Będzie zależał od tego, czy branża ustanowi interoperacyjne mechanizmy obronne, zanim podmioty znormalizują przenoszenie szkodliwych obciążeń między dostawcami.

Co obserwować po raporcie Anthropic o zagrożeniach

Kolejnym testem będzie to, czy dostawcy potrafią przełożyć wyraziste studia przypadków na mierzalne ograniczenie nadużyć operacyjnych.

Pierwszym sygnałem będzie wymiana informacji o zagrożeniach między dostawcami. Anthropic podał, że w stosownych przypadkach informował partnerów publicznych i prywatnych. Kluczowe pytanie brzmi, czy konkurencyjne laboratoria opublikują odpowiadające wskaźniki, skoordynowane działania zakłócające lub wspólne kategorie raportowania.

Wspólne definicje ułatwiłyby porównywanie przyszłych raportów. Dostawcy mogliby ujawniać, jak klasyfikują rozwój broni, operacje cybernetyczne, nadużycia biologiczne i inwigilację. Mogliby także raportować, co faktycznie przerwało zawieszenie konta.

Jeśli pojawi się skoordynowane działanie, centralny argument Anthropic staje się silniejszy. Dostawcy modeli frontier mogą działać jak rozproszona sieć ostrzegania przed pojawiającymi się zagrożeniami. Jeśli współpraca pozostanie nieformalna, sprawcy nadal będą wykorzystywać nierówne zasady.

Drugim sygnałem są dowody płynące z kolejnej generacji zabezpieczeń. Anthropic twierdzi, że wprowadził klasyfikatory wykrywające zagrożenia związane z materiałami wybuchowymi o dużej mocy i rozwojem broni. Klasyfikatory to systemy identyfikujące treści lub wzorce zachowań powiązane z konkretnymi zagrożeniami.

Przyszłe raporty powinny wyjaśniać, czy systemy te wykrywają rozproszone projekty, a nie tylko pojedyncze prompty. Przydatne wskaźniki obejmują wcześniejszą interwencję, mniej powtarzanych prób obejścia zabezpieczeń oraz niższe wskaźniki ukończenia podczas kontrolowanych ewaluacji.

Znaczenie mają również dowody dotyczące fałszywych alarmów. Zabezpieczenie blokujące nieszkodliwe badania w dziedzinie lotnictwa i kosmonautyki, biologii lub cyberbezpieczeństwa może zniechęcać legalnych użytkowników. Dostawcy potrzebują procedur odwoławczych i weryfikacyjnych adekwatnych do konsekwencji blokady konta.

Silniejsze wyniki wspierałyby tezę, że poprawa bezpieczeństwa może dotrzymywać kroku rozwojowi możliwości modeli. Dalsze przypadki wykorzystujące te same metody obejścia sugerowałyby, że filtry pozostają reaktywne. Przejście w stronę modeli lokalnych ujawniłoby kolejne ograniczenie.

Trzecim sygnałem jest niezależne potwierdzenie wpływu operacyjnego. Śledczy mogą z czasem powiązać identyfikatory spraw Anthropic z przejętym sprzętem, kampaniami malware, sieciami zaopatrzenia lub dotkniętymi organizacjami. Takie dowody wyjaśniłyby, które projekty wyszły poza etap planowania.

Niezależne ustalenia mogłyby wzmocnić najpoważniejsze oceny zawarte w raporcie. Mogłyby też ujawnić przesadę, błędną atrybucję lub niższą dojrzałość techniczną. Każdy z tych rezultatów poprawiłby publiczne zrozumienie sytuacji.

Przypadek Jemenu stanowi konkretny przykład. Potwierdzenie powiązanego oprogramowania naprowadzającego lub działań zaopatrzeniowych pokazałoby, że rozwój broni z wykorzystaniem Claude sięgnął głębiej w strukturę programu. Utrzymujące się nieudane testy podkreślałyby pozostałą lukę między wygenerowanym kodem a wdrożonym sprzętem.

Śledztwa cyberbezpieczeństwa mogą przynieść szybsze odpowiedzi. Ofiary, rządy i firmy bezpieczeństwa mogą czasem porównywać wskaźniki Anthropic z rejestrami incydentów. Zbieżna infrastruktura lub zachowanie malware zapewniłyby potwierdzenie bez ujawniania pełnych logów klientów.

Nadużycia Anthropic Claude nie powinny być sprowadzane do twierdzenia, że jeden chatbot samodzielnie projektował broń lub prowadził szpiegostwo. Udokumentowany wzorzec ma charakter bardziej systemowy. Modele zapewniały elastyczną pracę w projektach kontrolowanych przez ludzi dysponujących zewnętrznymi narzędziami i własnymi celami.

Ten wzorzec daje dostawcom wąską możliwość interwencji. Scentralizowane usługi mogą obserwować zachowania, których lokalne oprogramowanie nie jest w stanie dostrzec. Mogą wyłączać konta, aktualizować zabezpieczenia i ostrzegać potencjalne cele.

Ta możliwość nie jest trwała. Zapisane wyniki pozostają dostępne po blokadzie konta, a użytkownicy mogą migrować między modelami. Bardziej zaawansowane systemy lokalne jeszcze bardziej ograniczą widoczność dostawców.

Deweloperzy, nabywcy korporacyjni i liderzy bezpieczeństwa powinni pytać, jak agenci są monitorowani w ramach całego zadania, a nie tylko na granicy promptu. Powinni też domagać się dowodów, że mechanizmy kontroli działają wobec rozproszonej, wielojęzycznej aktywności połączonej z narzędziami.

Kolejny raport Anthropic dotyczący zagrożeń należy więc oceniać na podstawie rezultatów. Czy wykrywanie następowało wcześniej? Czy skoordynowane blokady zapobiegły migracji? Czy niezależne dowody potwierdziły przypadki o najwyższym ryzyku?

Odpowiedzi na te pytania pokażą, czy ujawnienia dotyczące nadużyć Anthropic Claude stanowią element coraz skuteczniejszego systemu obrony, czy też powtarzający się zapis zagrożeń odkrywanych dopiero po wykonaniu istotnej części pracy.

 
 

Zacznij bezpłatnie

Asystent AI działający przede wszystkim lokalnie, z funkcją zarządzania wiedzą osobistą

Aby zapewnić lepsze działanie AI,

remio obsługuje obecnie wyłącznie Windows 10+ (x64) i M-Chip Macs.

Twój partner AI w pracy
Zrób więcej z remio

Planuj. Twórz. Dostarczaj.
Wszystko w jednym miejscu.

bottom of page