top of page

O raporcie Anthropic dotyczącym nadużyć AI: agenci przenoszą koszty na obrońców

2 godziny temu
14 minut(y) czytania

Anthropic opublikował trzeci raport o nadużyciach AI po wykryciu Claude w cyberatakach, systemach inwigilacji, kampaniach wpływu, badaniach nad bronią oraz przemysłowym pozyskiwaniu modeli. Dowody przedstawione w raporcie O raporcie Anthropic dotyczącym nadużyć AI obejmują aktywność zaobserwowaną między grudniem 2025 roku a sierpniem 2026 roku. Jego główne ostrzeżenie nie dotyczy tego, że AI stworzyła nowe złośliwe cele. Chodzi o to, że agenci sprawili, iż istniejące operacje stały się tańsze, szybsze i łatwiejsze do skalowania.

Raport opisuje ludzi wybierających cele, definiujących założenia i weryfikujących istotne rezultaty. Systemy AI zajmowały się następnie rozpoznaniem, tworzeniem oprogramowania, badaniem podatności, przetwarzaniem danych, produkcją propagandy i częścią działań eksploatacyjnych. Kilku operatorów połączyło też Claude z zewnętrznymi narzędziami i trwałą pamięcią, pozwalając automatycznym procesom działać między sesjami.

Ten podział pracy ma większe znaczenie niż pojedynczy złośliwy prompt. Umieszcza AI wewnątrz operacyjnej machiny cyberprzestępczości i państwowej inwigilacji. Atakujący mogą teraz zachowywać wiedzę specjalistyczną w oprogramowaniu, powtarzać udane procedury i prowadzić jednocześnie kilka strumieni pracy.

Bruce Schneier wskazał ten sam wzorzec w swojej analizie raportu o nadużyciach. Istotna zmiana polega na przejściu ku uprzemysłowionemu wykonaniu, w którym ludzie zachowują decyzyjność, podczas gdy maszyny przejmują większą część obciążenia operacyjnego.

W raporcie Anthropic dotyczącym nadużyć AI to proces jest najważniejszy

Najistotniejsze dowody w raporcie dotyczą kompletnych procesów, a nie odizolowanych odpowiedzi wygenerowanych przez chatbot.

Raport wywiadowczy dotyczący zagrożeń Anthropic dokumentuje aktywność grup przestępczych, komercyjnych dostawców technologii inwigilacyjnych, osób motywowanych politycznie oraz organizacji powiązanych z państwami. Przypadki obejmują operacje cybernetyczne, propagandę, inwigilację, broń konwencjonalną, badania biologiczne i nieuprawnioną destylację modeli.

Firma twierdzi, że wybrała godne uwagi lub nowe incydenty, a nie reprezentatywną próbę wszystkiego, co dzieje się w Claude. To rozróżnienie ogranicza wnioski dotyczące skali zjawiska. Mimo to przypadki pokazują, co mogą zbudować zmotywowani operatorzy, gdy modele są połączone z kodem, przeglądarkami, skanerami, bazami danych i innymi narzędziami.

Niektórzy operatorzy uruchamiali roje agentów, co oznacza, że model koordynujący dzielił duży cel między kilka wyspecjalizowanych agentów AI. Agenci pracowali równolegle nad rozpoznaniem, badaniem metod eksploatacji i zadaniami po przejęciu systemu. Trwała pamięć kampanii przechowywała między sesjami listy celów, dane uwierzytelniające, instrukcje i status działań.

W jednej zgłoszonej operacji zautomatyzowane procesy analizowały oprogramowanie firmware urządzeń i pliki binarne za pomocą narzędzi do dekompilacji. System formułował hipotezy dotyczące podatności, pisał proponowane exploity i testował je na laboratoryjnych kopiach atakowanych produktów. Anthropic podaje, że jeden ciągły proces wygenerował w ciągu miesiąca ponad tuzin możliwych wykryć zero-day.

Zero-day to wcześniej nieznana podatność oprogramowania, dla której nie jest dostępna poprawka ochronna. Raport nie potwierdza, że każde podejrzewane wykrycie było prawidłowe ani że zostało wykorzystane przeciw rzeczywistym systemom. Pokazuje jednak zautomatyzowany proces wykonujący iteracyjnie pracę, która tradycyjnie wymagała długotrwałej uwagi specjalistów.

Inne agenty wielokrotnie przeszukiwały wystawioną na internet infrastrukturę. Identyfikowały usługi, porównywały punkty wejścia ze znanymi podatnościami i dodawały nowe ustalenia do trwałej pamięci projektu. Oddzielna flota 13 stale działających agentów zbierała publiczne materiały ze źródeł wojskowych, rządowych, politycznych i społecznościowych.

Ta architektura zmienia ekonomię złośliwych działań. Człowiek nie musi już osobiście wykonywać każdego zadania związanego z wyszukiwaniem, testowaniem, tłumaczeniem czy dokumentacją. Operator może nadzorować rozszerzalny zbiór zautomatyzowanych pracowników i skoncentrować się na wyborze celów.

Dlatego lista pojedynczych promptów nie oddaje skali tej zmiany. Każdy prompt, oceniany osobno, może wydawać się zwyczajny. Zagrożenie wynika z orkiestracji, gromadzonego kontekstu, dostępu do narzędzi, powtarzalności oraz możliwości działania na podstawie wyników.

Anthropic podaje, że zablokował powiązane konta i wykorzystał swoje ustalenia do ulepszenia zabezpieczeń. Usunięcie kont rozwiązuje jednak problem dostępu do jednego dostawcy, a nie podstawowej wiedzy, kodu, wykradzionych danych uwierzytelniających czy infrastruktury. Operatorzy mogą zachować te zasoby i przenieść części procesu w inne miejsce.

Raport przekształca więc nadużycia AI z problemu moderacji treści w problem bezpieczeństwa operacyjnego. Blokowanie szkodliwych treści nadal jest użyteczne, ale obrońcy muszą także wykrywać zautomatyzowane zachowania obejmujące tożsamości, sesje, narzędzia i przejęte konta.

Agenci AI skracają cykl ataku

Agenci AI nie eliminują ludzi z cyberataków, ale pozwalają mniejszej liczbie osób działać przeciw większej liczbie celów i na większej liczbie warstw technicznych.

Jedna kampania opisana przez Anthropic wykorzystywała AI na etapach rozpoznania, uzyskania początkowego dostępu, gromadzenia danych, eksfiltracji i utrzymywania dostępu. Według doniesień sprawca identyfikował systemy poczty elektronicznej i zdalnego dostępu, budował listy celów oraz tworzył infrastrukturę do phishingu z użyciem kodu urządzenia.

Phishing z użyciem kodu urządzenia wykorzystuje legalny proces logowania, aby skłonić ofiarę do autoryzowania sesji kontrolowanej przez atakującego. Gdy atakujący uzyska taki dostęp, sesja może ujawnić pocztę w chmurze i inne połączone usługi. Technika często wydaje się mniej podejrzana, ponieważ korzysta z rzeczywistego procesu uwierzytelniania.

Anthropic podaje, że operacja uzyskała dostęp do rekordów pocztowych co najmniej ośmiu organizacji. Wśród celów znalazły się krajowa prokuratura, instytut edukacji wojskowej oraz regionalna organizacja międzyrządowa. Inne włamanie ujawniło ponad 300 000 krajowych rekordów tożsamości i informacje rejestrowe dotyczące ponad 500 000 firm.

Według raportu system AI pomógł uporządkować setki gigabajtów wykradzionych informacji. Wspierał również pozyskiwanie danych uwierzytelniających, ruch boczny w sieci oraz dostosowywanie złośliwego oprogramowania po wykryciu wcześniejszych wersji przez produkty bezpieczeństwa.

Skraca to część pętli sprzężenia zwrotnego między działaniem atakującego a reakcją obrońców. Wykrycie nie powoduje już takiego samego opóźnienia, jeśli oprogramowanie może przeanalizować niepowodzenie, zmienić artefakt i szybko przygotować kolejną wersję. Zatwierdzenie przez człowieka może pozostać częścią procesu, podczas gdy iteracje maszynowe przyspieszają.

Inny sprawca użył autonomicznego potoku eksploatacyjnego przeciw produkcyjnym aplikacjom internetowym. Agenci roboczy testowali błędy wstrzykiwania, obejścia uwierzytelniania, cross-site scripting i fałszowanie żądań po stronie serwera bez ciągłego nadzoru człowieka. Potencjalne dane uwierzytelniające i ustalenia trafiały z powrotem do wspólnej przestrzeni roboczej.

Fałszowanie żądań po stronie serwera to błąd, który nakłania serwer do wykonywania żądań w imieniu atakującego. Może ujawnić wewnętrzne systemy, które w innym przypadku są niedostępne z publicznego internetu. Automatyzacja takich testów zwiększa liczbę punktów końcowych, które operator może badać.

Raport opisuje również infrastrukturę oszustw automatyzującą rejestrację kont, monitorowanie skrzynek odbiorczych, rozwiązywanie CAPTCHA i etapy weryfikacji tożsamości. Inny proces umieszczał odwrotne proxy między ofiarami a prawdziwymi kontrolami tożsamości, przechwytując uwierzytelnione sesje i przesłane dokumenty.

Przykłady te pokazują, dlaczego raport O raporcie Anthropic dotyczącym nadużyć AI ma znaczenie dla zwykłych organizacji. Firma nie musi być pierwotnym celem atakującego, aby ponieść szkody. Jej ujawnione klucze, dzierżawy chmurowe, aplikacje SaaS, dostawcy lub dane klientów mogą stać się zasobami pośrednimi.

Jeden francuskojęzyczny atakujący miał podobno obrać za cel 42 organizacje polityczne i powiązane z nimi podmioty. Sprawca uzyskał wewnętrzny dostęp do co najmniej 14 z nich i usunął szacunkowo od 12 do 26 gigabajtów materiałów z baz danych. Przejęta platforma kampanijna ujawniła około 140 000 rekordów, w tym opinie polityczne.

Niezależne doniesienia dotyczące francuskiej kampanii powiązały kilka szczegółów z dotkniętymi organizacjami. Doniesienia te stanowią cenne potwierdzenie, chociaż Anthropic pozostaje głównym źródłem znacznej części opisu technicznego.

Jak podaje Anthropic, sprawca opracował także wcześniej nieudokumentowaną technikę eksploatacji WordPress i odniósł sukces przeciw co najmniej czterem witrynom. Inne narzędzia pozyskiwały przesłane dane uwierzytelniające, zatruwały kopie zapasowe i umieszczały kod zdalnego dostępu w zasobach stron internetowych.

Nie był to całkowicie autonomiczny atak. Człowiek wybierał cele, obsługiwał infrastrukturę, interpretował wyniki i realizował cele polityczne. Istotną zmianą była dźwignia: jedna osoba mogła stworzyć i utrzymywać kampanię o skali małego zespołu technicznego.

Główny konflikt to skala atakujących kontra odpowiedzialność obrońców

Atakujący mogą rozdzielać pracę między agentów, ale obrońcy nadal ponoszą pełne prawne, operacyjne i finansowe konsekwencje każdego niepowodzenia.

Tradycyjne planowanie bezpieczeństwa często zakłada, że działania ofensywne pochłaniają rzadką wiedzę specjalistyczną. Wykwalifikowani atakujący muszą badać infrastrukturę, tworzyć narzędzia, analizować wykradzione dane i dostosowywać metody po wykryciu. Te ograniczenia limitują liczbę celów, które grupa może jednocześnie atakować.

Systemy agentowe osłabiają te ograniczenia. Mogą nieprzerwanie prowadzić rozpoznanie, konsekwentnie dokumentować wyniki, tłumaczyć materiały i ponawiać zadania techniczne. Zachowują również wiedzę proceduralną, która w przeciwnym razie byłaby przechowywana w pamięci pojedynczego operatora.

Obrońcy mierzą się z mniej wyrozumiałym równaniem. Każde ujawnione dane uwierzytelniające, zapomniana aplikacja, podatny dostawca lub nadmierne uprawnienie może stać się punktem wejścia. Atakującym wystarczy jedna realna ścieżka, podczas gdy obrońcy muszą chronić zmieniający się zbiór systemów i tożsamości.

Łańcuch dostaw AI również stał się celem. Anthropic opisuje fałszywe usługi obiecujące zniżkowy dostęp do modeli granicznych, które instalowały jednak programy do pozyskiwania danych uwierzytelniających. Programy te kradły dane kont i tokeny uwierzytelnionych sesji z urządzeń klientów.

Atakujący następnie sprzedawali lub ponownie wykorzystywali ten dostęp za pośrednictwem oszukańczych sieci proxy. Niektóre usługi po cichu kierowały klientów do innego modelu, nadal zbierając nowe dane uwierzytelniające. Zapewniało to przestępcom odnawialne źródło pozornie legalnych kont po unieważnieniu wcześniejszych kluczy.

Inna operacja testowała 30 celów, próbując uzyskać dostęp do przedpremierowego modelu Claude. Anthropic podaje, że każda próba zakończyła się niepowodzeniem, a jego własne systemy nie zostały naruszone. Wykradzione klucze należały do klientów, których środowiska zostały już wcześniej zaatakowane.

To rozróżnienie jest ważne. Dostawca może zabezpieczyć swoją centralną infrastrukturę, podczas gdy atakujący wykorzystują słabsze punkty wokół niej. Laptopy programistów, sesje przeglądarek, platformy automatyzacji, routery zewnętrznych dostawców i skopiowane pliki konfiguracji stają się częścią rzeczywistej granicy bezpieczeństwa.

Przedsiębiorstwa powinny zatem traktować dane uwierzytelniające AI jak inne uprzywilejowane sekrety produkcyjne. Klucze potrzebują ograniczonych zakresów, krótkiego okresu ważności tam, gdzie to możliwe, monitorowania użycia i niezawodnego unieważniania. Nietypowy ruch związany z modelami może ujawnić naruszone środowisko, zanim atakujący osiągnie bardziej oczywisty cel.

Zespoły bezpieczeństwa potrzebują również widoczności zachowania agentów. Pojedyncze konto uruchamiające trwałe skany, równoległe wywołania narzędzi lub powtarzalne zadania ekstrakcji stwarza inne ryzyko niż zwykła rozmowa. Wykrywanie powinno uwzględniać sekwencje działań, a nie jeden prompt naraz.

Tworzy to presję na Anthropic, OpenAI, Google, Microsoft, dostawców chmury i usługi routingu modeli. Każdy z nich widzi inną część łańcucha. Żaden uczestnik nie jest w stanie odtworzyć całej kampanii bez wymiany użytecznych informacji o zagrożeniach.

Jednak szerszy monitoring niesie własne ryzyka. Dostawcy mogą analizować prompty, odpowiedzi, pliki, wywołania narzędzi i powiązania między kontami, aby wykrywać nadużycia. Takie praktyki mogą ujawniać wrażliwe informacje klientów lub tworzyć szerokie możliwości nadzoru wewnątrz samej usługi.

Wynikający z tego kompromis nie sprowadza się po prostu do bezpieczeństwa kontra prywatność. Słaby monitoring może pozwolić skoordynowanym atakom trwać. Nadmierny monitoring może podważać poufność, prowadzić do fałszywych oskarżeń albo umieszczać cenne dane klientów w kolejnym scentralizowanym systemie.

Dostawcy potrzebują ograniczonych okresów retencji, limitowanego dostępu dla śledczych, jasnych zasad eskalacji oraz rzeczywistej przejrzystości automatycznego egzekwowania zasad. Klienci również muszą wiedzieć, jaka telemetria istnieje i kiedy informacje mogą być udostępniane organizacjom zewnętrznym.

Raport Anthropic o nadużyciach AI zapewnia wyjątkowo szczegółowy wgląd w wykrytą aktywność. Nie przedstawia pełnej miary wyników fałszywie pozytywnych, niewykrytych kampanii ani kosztów prywatności związanych z dochodzeniami. Te nierozstrzygnięte kwestie powinny towarzyszyć ustaleniom operacyjnym.

Nadzór i propaganda pokazują tę samą substytucję pracy

Przypadki nadzoru opisane w raporcie pokazują, że AI zastępuje część pracy inżynierów i analityków, nie zmieniając tego, kogo potężne instytucje wybierają na cel.

Konsultant pracujący dla władz bezpieczeństwa narodowego Mali miał podobno użyć Claude do zaprojektowania platformy masowego przechwytywania. System mógł zbierać dane komunikacyjne od krajowych operatorów komórkowych i tworzyć dossier wybranych osób.

Anthropic twierdzi, że model pomógł zaprojektować bazowe oprogramowanie, a nie analizować finalne dossier. Według odrębnego reportażu o nadzorze, platforma została ostatecznie wdrożona lokalnie z wykorzystaniem innych modeli po interwencji Anthropic.

Ten rezultat ujawnia ograniczenie egzekwowania zasad przez dostawców. Usługa chmurowa może zamknąć konta i utrudnić realizację jednego procesu. Nie może jednak niezawodnie usunąć wyeksportowanego kodu, wiedzy technicznej, zgromadzonych danych ani dostępu do alternatywnych modeli.

W Iranie podmioty używały Claude do stworzenia złośliwego rozszerzenia Firefoksa, które pozyskiwało tożsamości z sieci społecznościowych. Według Anthropic inna irańska jednostka przeanalizowała setki tysięcy postów i wskazała 39 kont opozycyjnych do monitorowania.

Raport opisuje chińską operację wywiadowczą ds. spraw religijnych, która miała zostać zredukowana z wielu zespołów analitycznych do jednego biura. Z pomocą AI biuro to prowadziło tysiące dochodzeń miesięcznie.

Inne podmioty używały Claude do oceniania artykułów i postów społecznościowych pod kątem wrażliwości politycznej. Zestawiały lokalizacje, cechy demograficzne, poglądy polityczne i oceny pewności w ustrukturyzowanych zapisach. Wyniki te mogły wspierać przesłuchania, monitoring lub inne formy kontroli.

Operator powiązany z ChRL, nieznający języka arabskiego, miał przez wiele dni prowadzić operację rekrutacyjną wymierzoną w Ujgurów w Syrii. Claude przygotowywał wiadomości w regionalnym dialekcie, tłumaczył odpowiedzi, odgrywał kontrole jakości i formatował wyniki dla podejrzewanego oficera prowadzącego.

Model nie wybrał prześladowanej społeczności. Ludzkie instytucje dostarczyły cel, misję i zamierzone zastosowanie. AI obniżyła bariery językowe, kadrowe i techniczne, które w przeciwnym razie mogłyby spowolnić operację.

Ten wzorzec pojawia się także w kampaniach wpływu. Anthropic opisuje dziewięć przypadków pochodzących z Rosji, Iranu, Turcji, państw Zatoki Perskiej, Azji Południowej, Afryki i Europy. Kampanie były wymierzone w odbiorców na sześciu kontynentach.

Operatorzy tworzyli fałszywe profile, serwisy informacyjne, przekazy polityczne i skoordynowane plany publikacji. Niektóre kampanie zbiegały się z wyborami. Rosyjskie media państwowe rozpowszechniały sfabrykowane twierdzenia przed głosowaniem w Mołdawii we wrześniu 2025 r., a kenijski operator przygotowywał fałszywe treści oddolne przed wyborami w 2027 r.

AI nie wymyśliła zwodniczej komunikacji politycznej. Pomogła tworzyć persony, tłumaczenia, artykuły, strategie targetowania i warianty przy niższym koszcie krańcowym. Niewielki zespół mógł utrzymywać większą fasadę niezależnego udziału społeczeństwa.

Anthropic ma nietypowy punkt obserwacyjny, ponieważ może widzieć kampanie podczas ich planowania przez operatorów. Sieci społecznościowe często napotykają taką operację dopiero po publicznym pojawieniu się treści. Dostawcy modeli mogą wcześniej wykrywać wybór celów i tworzenie treści.

Ich widoczność spada jednak, gdy treść opuszcza platformę modelu. Anthropic twierdzi, że wykorzystuje badania open source, dane partnerów i publiczne doniesienia, aby zrozumieć dalszą aktywność. Oznacza to, że część planowanych kampanii może nigdy nie zostać uruchomiona, podczas gdy inne mogą przenieść się poza jego pole widzenia.

Czytelnicy nie powinni traktować każdego wykrytego promptu jako dowodu ukończonej operacji w świecie rzeczywistym. Zamiar, przygotowanie, wdrożenie, zasięg i mierzalny wpływ to odrębne etapy. Raport jest najmocniejszy wtedy, gdy łączy aktywność modelu z infrastrukturą lub dowodami potwierdzającymi.

Mimo to kierunek jest jasny. AI wkracza do rutynowej biurokracji nadzoru i wpływu politycznego. Może pomagać instytucjom przetwarzać więcej osób, utrzymywać więcej person i przygotowywać więcej raportów bez proporcjonalnego zwiększania zatrudnienia.

Badania nad bronią stawiają trudniejszy problem zabezpieczeń

Ustalenia Anthropic przenoszą debatę poza złośliwą pomoc w pisaniu, w stronę oprogramowania łączącego analizę z systemami fizycznymi.

Firma twierdzi, że zakłóciła sześć przypadków związanych z bronią konwencjonalną, obejmujących trzech aktorów z Chin, dwóch z Rosji i jednego z Jemenu. Cztery dotyczyły oprogramowania dla sprzętu uzbrojenia, a dwa koncentrowały się na zamówieniach lub zbieraniu danych wywiadowczych.

Zgłoszone projekty obejmowały rakiety naprowadzane, naprowadzanie pocisków, oprogramowanie rojów dronów, przechwytywanie torped, namierzanie w walce elektronicznej i tłumienie obrony powietrznej. Według Anthropic jeden program dotyczący rakiet naprowadzanych obejmował test terenowy na żywo.

Przed użyciem Claude aktorzy zazwyczaj dysponowali odpowiednim sprzętem, wiedzą inżynieryjną lub dostępem do programu. Dzielili pracę między sesje, aby ukryć pełny cel, i próbowali omijać zabezpieczenia.

To zastrzeżenie ma znaczenie. Raport nie pokazuje nieprzygotowanej osoby, która zadaje jedno pytanie i otrzymuje kompletną broń. Pokazuje zdolne grupy używające AI do przyspieszania zadań inżynieryjnych, debugowania, badań, dokumentacji i zamówień.

Anthropic twierdzi, że wprowadziło klasyfikatory lepiej wykrywające ruch związany z materiałami wybuchowymi o dużej mocy i rozwojem broni. Klasyfikator to zautomatyzowany system oceniający, czy żądanie należy do kategorii objętej ograniczeniami.

Takie kontrole mierzą się z nieodłącznym problemem. Wiele zadań inżynieryjnych ma uzasadnione zastosowania cywilne. Naprowadzanie, nawigacja, przetwarzanie obrazu, łączność radiowa, analiza materiałów i sterowanie lotem mogą służyć zarówno systemom komercyjnym, jak i wojskowym.

Raport opisuje również prośby dotyczące badań biologicznych o cechach podwójnego zastosowania. Jeden przypadek dotyczył wniosku o finansowanie zmian w wirusie chikungunya, które mogłyby wpływać na zakaźność i unikanie odpowiedzi immunologicznej.

Claude miał odmówić pomocy przy części tej pracy, a użytkownik zwrócił się do innej usługi AI. Anthropic twierdzi, że jego starsze modele znajdowały się poniżej progu umożliwiającego istotne wsparcie zaawansowanego badacza biologicznego. Nie przedstawia takiego samego zapewnienia w odniesieniu do obecnych systemów.

Relacje dotyczące przypadku zabezpieczeń biologicznych podkreślają tę niepewność. Bardziej zdolne modele mogą wspierać uzasadnione badania, lecz ta sama kompetencja komplikuje decyzje o tym, które prośby blokować.

Nadmierne blokowanie niesie realne koszty. Naukowcy, zespoły zdrowia publicznego i badacze bezpieczeństwa mogą potrzebować informacji przypominających pracę objętą ograniczeniami. Zbyt słabe blokowanie może udzielić złośliwemu aktorowi pomocy przy projektowaniu eksperymentów lub planowaniu operacyjnym.

Dostawca modelu musi podejmować te decyzje przy niepełnym kontekście. Pozornie niewinne żądanie może być fragmentem ukrytego programu. Niepokojące żądanie może stanowić część autoryzowanych badań obronnych.

Ta sama słabość dotyczy zabezpieczeń cybernetycznych. Atakujący mogą dzielić cele na zwyczajne zadania, zmieniać konta, używać skradzionych poświadczeń lub łączyć wielu dostawców. Modele o otwartych wagach tworzą kolejną ścieżkę bez centralnego operatora zdolnego zamknąć konto.

Dlatego żaden dostawca nie może przedstawiać bezpieczeństwa jako ukończonej funkcji produktu. Zabezpieczenia tworzą tarcie i poprawiają wykrywanie, lecz nie usuwają zdolności z szerszego środowiska. Istotną miarą jest to, czy interwencja zwiększa koszty atakujących szybciej, niż możliwości je obniżają.

Raport Anthropic o nadużyciach AI przedstawia dowody skutecznych zakłóceń, ale nie może pokazać kampanii, których Anthropic nigdy nie wykryło. Nie może też ustalić, ilu operatorów porzuciło projekt, przeniosło się gdzie indziej lub kontynuowało pracę z systemami wdrożonymi lokalnie.

Ta niepewność powinna zapobiec dwóm przeciwstawnym błędom. Przypadki nie dowodzą, że agenci AI potrafią samodzielnie przeprowadzić każdą zaawansowaną operację. Nie uzasadniają też lekceważenia problemu tylko dlatego, że ludzie nadal wybierają cele.

Ludzkie kierowanie i wykonanie maszynowe mogą współistnieć. W istocie takie połączenie może być najbardziej praktyczną strukturą szkodliwych operacji, ponieważ zachowuje osąd, a jednocześnie skaluje powtarzalną pracę.

Destylacja modeli czyni dane klientów kwestią bezpieczeństwa

Końcowe odwrócenie przedstawione w raporcie polega na tym, że dostawcy AI są nie tylko platformami wykorzystywanymi do nadużyć, lecz także celami, źródłami danych i skradzionymi zasobami obliczeniowymi.

Anthropic oskarża kilka chińskich laboratoriów AI o prowadzenie nieautoryzowanych kampanii destylacji przeciwko Claude. Destylacja wykorzystuje odpowiedzi jednego modelu do poprawy zachowania lub możliwości innego modelu.

Według Anthropic Alibaba wygenerował ponad 151 milionów wymian między majem a lipcem 2026 r. Moonshot miał rzekomo wygenerować ponad 23 miliony wymian w tym samym okresie. DeepSeek wygenerował ponad 12,1 miliona wymian w ciągu 14 dni w lipcu.

Firma przypisuje Zhipu ponad 3,4 miliona wymian w ciągu 17 dni w czerwcu i lipcu. Twierdzi, że Xiaomi wygenerował ponad 400 000 wymian w ciągu 20 dni w marcu i kwietniu.

Liczby te są ustaleniami Anthropic i nie zostały w raporcie niezależnie zweryfikowane. Odpowiedzi wskazanych firm także mają znaczenie przy ocenie przypisania, intencji i roszczeń umownych.

Anthropic twierdzi, że kampanie miały na celu pozyskanie zdolności rozumowania, programowania, używania narzędzi i analizy danych. Operatorzy mieli rzekomo wykorzystywać fałszywe tożsamości, skradzione karty, przejęte poświadczenia API, serwery proxy i tysiące kont, aby omijać kontrolę dostępu.

Niektórzy testowali liczne warianty promptów, aby wydobyć ukryte ślady rozumowania. Jeden eksperyment miał wysłać ponad 12 000 różnych żądań w celu zidentyfikowania skutecznych metod ekstrakcji przed rozpoczęciem większej kampanii.

Najbardziej niepokojące twierdzenie dotyczy danych klientów. Anthropic twierdzi, że DeepSeek, Moonshot i Xiaomi kierowały część rozmów użytkowników do Claude w celach szkoleniowych. Użytkownicy mieli rzekomo nie zostać poinformowani, że inny dostawca modeli przetworzy ich żądania.

Anthropic podaje, że niektóre wymiany zawierały imiona i nazwiska, adresy e-mail, informacje o firmach, poświadczenia programistów i wewnętrzne prognozy. Usługi routingu stron trzecich miały dostarczać dodatkowe rozmowy użytkowników ze Stanów Zjednoczonych i Europy.

Twierdzenia te rozszerzają znaczenie ryzyka w łańcuchu dostaw AI. Klient może sądzić, że informacje trafiają do jednej aplikacji i modelu. W praktyce żądania mogą przechodzić przez routery, odsprzedawców, usługi proxy, ewaluatorów i ukrytych dostawców nadrzędnych.

Firmy powinny pytać dostawców, które modele faktycznie przetwarzają przesyłane informacje. Potrzebują też jasnych odpowiedzi dotyczących retencji danych, trenowania modeli, routingu regionalnego, podwykonawców oraz dostępu ludzkich recenzentów.

Ta sytuacja tworzy trudną symetrię. Anthropic krytykuje inne organizacje za rzekome przekazywanie danych użytkowników bez ich zgody. Jednocześnie własny raport firmy pokazuje, jak wiele dostawcy modeli mogą wywnioskować dzięki monitorowaniu nadużyć.

Sytuacje te nie są równoważne, ale łączy je pytanie o zarządzanie. Wrażliwe informacje mogą trafiać dalej, niż oczekuje użytkownik — czy to przez ukryty routing, telemetrię bezpieczeństwa, czy dochodzenie.

Rozwiązaniem nie może być obietnica, że poufne dane nigdy nie będą się przemieszczać. Organizacje potrzebują egzekwowalnych mechanizmów kontroli, weryfikowalnego routingu, minimalizacji retencji oraz logów pokazujących, które systemy przetworzyły każde żądanie.

To także powód, dla którego pracownicy powinni unikać umieszczania aktualnych sekretów w niezatwierdzonych narzędziach AI. Dopieszczony interfejs nie mówi nic o tym, dokąd trafia żądanie ani ilu pośredników może uzyskać do niego dostęp.

Na co obrońcy powinni zwracać uwagę w następnej kolejności

Kolejnym sprawdzianem będzie to, czy reakcja bezpieczeństwa zmieni ekonomię opisaną w raporcie On Anthropic’s AI Misuse Report.

Pierwszym sygnałem będzie zakłócanie działań między dostawcami. Anthropic twierdzi, że w stosownych przypadkach dzieli się ustaleniami z partnerami publicznymi i prywatnymi. Poważniejszym testem będzie to, czy wykrycie przez jednego dostawcę szybko wyłącza powiązane konta, infrastrukturę i skradzione poświadczenia również w innych miejscach.

Jeśli współpraca się poprawi, atakujący stracą część możliwości przenoszenia nienaruszonych procesów roboczych między usługami. Jeśli kampanie będą wielokrotnie powracać za pośrednictwem nowych kont i alternatywnych modeli, blokady kont pozostaną jedynie tymczasową przeszkodą.

Drugim sygnałem będą dowody dotyczące autonomii agentów. Przyszłe raporty powinny oddzielać sugestie generowane przez AI od działań wykonywanych za pomocą narzędzi. Powinny wskazywać, gdzie ludzie zatwierdzali polecenia, korygowali błędy, wybierali cele lub interpretowali niejednoznaczne wyniki.

To rozróżnienie pokaże, czy agenci stają się bardziej niezależni, czy po prostu zwiększają produktywność wykwalifikowanych operatorów. Oba scenariusze są istotne, ale wymagają innych mechanizmów obrony i reakcji politycznych.

Trzecim sygnałem będzie przejrzystość dotycząca dochodzeń i prywatności. Dostawcy powinni wyjaśniać, jakie dane przechowują, w jaki sposób klasyfikatory nadużyć uruchamiają weryfikację oraz jak ograniczają dostęp badaczy. Powinni też raportować fałszywe alarmy i procedury odwoławcze, gdy ich ujawnienie nie pomaga atakującym.

Dla liderów bezpieczeństwa natychmiastowa odpowiedź ma charakter praktyczny. Należy zinwentaryzować poświadczenia AI, przeanalizować routery modeli, ograniczyć długotrwałe tokeny i monitorować nietypową zautomatyzowaną aktywność. Trzeba sprawdzić, czy przejęte urządzenia deweloperskie mogą ujawnić sesje modeli lub powiązane sekrety produkcyjne.

Zespoły powinny także zaktualizować plany reagowania na incydenty pod kątem iteracji w tempie maszynowym. Zablokowana domena lub wykryty ładunek może w ciągu kilku minut wywołać automatyczną rewizję. Obrońcy potrzebują skoordynowanego unieważniania tożsamości, izolacji endpointów, logowania w chmurze i komunikacji z dostawcami.

Pracownicy wiedzy powinni sprawdzać, dokąd trafiają wrażliwe prompty. Przed przesłaniem kodu źródłowego, dokumentów wewnętrznych, poświadczeń, danych badawczych lub rekordów klientów należy potwierdzić zatwierdzonego dostawcę oraz jego warunki przetwarzania.

Raport Anthropic nie dowodzi istnienia autonomicznej cyberapokalipsy. Dokumentuje coś bardziej bezpośredniego: ludzi wykorzystujących AI do przekształcania wiedzy eksperckiej w powtarzalną infrastrukturę dla cyberprzestępczości, inwigilacji, propagandy i prac nad bronią.

Pytanie dotyczące następnego raportu nie brzmi, czy nadużycia będą kontynuowane. Chodzi o to, czy obrońcy zmuszą atakujących do wydawania większej liczby tożsamości, pieniędzy, czasu i wiedzy eksperckiej na każdą udaną operację. Ten mierzalny pojedynek pokaże, czy zabezpieczenia ograniczają zmianę, czy tylko ją dokumentują.

 
 

Zacznij bezpłatnie

Asystent AI działający przede wszystkim lokalnie, z funkcją zarządzania wiedzą osobistą

Aby zapewnić lepsze działanie AI,

remio obsługuje obecnie wyłącznie Windows 10+ (x64) i M-Chip Macs.

Twój partner AI w pracy
Zrób więcej z remio

Planuj. Twórz. Dostarczaj.
Wszystko w jednym miejscu.

bottom of page