Meerah Rajavel ostrzega, że otwarte modele AI mogą wyprzedzić zabezpieczenia cyberbezpieczeństwa
Meerah Rajavel wydała stanowcze ostrzeżenie: to niedrogie otwarte modele AI, a nie dzisiejsze kontrolowane systemy graniczne, stanowią największe rodzące się zagrożenie dla cyberbezpieczeństwa. Dyrektorka ds. informatyki Palo Alto Networks przedstawiła ten argument w wywiadzie z 30 sierpnia, odnalezionym za pośrednictwem Google News.
Jej obawy koncentrują się na kurczącej się luce kompetencyjnej. Rajavel twierdzi, że zaawansowane możliwości mogą trafiać do publicznie dostępnych modeli w ciągu czterech do sześciu miesięcy od pojawienia się w systemach granicznych. Atakujący potrzebują wtedy jedynie zasobów obliczeniowych i umiejętności technicznych, zamiast stałego dostępu do monitorowanej usługi komercyjnej.
To rozróżnienie zmienia debatę o bezpieczeństwie. Zamknięci dostawcy, tacy jak Google, OpenAI i Anthropic, mogą monitorować aktywność, blokować użytkowników, aktualizować zabezpieczenia i wycofywać dostęp. Gdy możliwe do pobrania wagi modeli rozpowszechnią się w prywatnych systemach, takie mechanizmy kontroli w dużej mierze znikają.
Ostrzeżenie nie jest dowodem, że otwarte modele już teraz powodują więcej cyberataków niż zamknięte. To prognoza dotycząca dostępu, ekonomii i kontroli. Sednem sporu jest zestawienie korzyści płynących z otwartego rozwoju z wartością zabezpieczeń, które można egzekwować.
Raport Google News koncentruje się na okresie od czterech do sześciu miesięcy
Główne twierdzenie Rajavel brzmi: niebezpieczne możliwości AI stają się trudniejsze do kontrolowania, gdy spada ich koszt, a dystrybucja się rozszerza.
W oryginalnym wywiadzie z Rajavel rozróżnia ona modele graniczne od tańszych systemów, które atakujący mogą obsługiwać samodzielnie. Usługi graniczne wymagają opłaty i zazwyczaj nakładają ograniczenia na zachowania wysokiego ryzyka.
Ta bariera ekonomiczna nie powstrzymuje dobrze finansowanych przestępców ani grup wspieranych przez państwa. Może jednak ograniczać eksperymentowanie mniej kompetentnych podmiotów. Usługi hostowane dają też dostawcom możliwość identyfikowania podejrzanych promptów, zamykania kont i zabezpieczania dowodów.
Rajavel argumentuje, że równowaga zmienia się, gdy porównywalne możliwości trafiają do modeli możliwych do pobrania. Atakujący może uruchamiać model prywatnie, modyfikować jego zachowanie, automatyzować wielokrotne próby i unikać systemu monitorowania nadużyć stosowanego przez dostawcę.
Jej szacunek od czterech do sześciu miesięcy jest najistotniejszym twierdzeniem wywiadu. Opisuje możliwe opóźnienie między pojawieniem się możliwości granicznej a szerokim udostępnieniem tańszej alternatywy.
Tego szacunku nie należy traktować jako uniwersalnego prawa technicznego. Poszczególne modele różnią się jakością treningu, dostępem do narzędzi, wymaganiami sprzętowymi i skutecznością w zadaniach cybernetycznych. Niektóre otwarte systemy pozostaną daleko w tyle za najsilniejszymi modelami hostowanymi.
Atakujący nie zawsze jednak potrzebują najlepszej dostępnej inteligencji. Model musi jedynie poprawić ekonomikę rozpoznania, phishingu, modyfikacji kodu, badań nad podatnościami lub kradzieży poświadczeń.
Operacje cybernetyczne składają się również z wielu mniejszych zadań. Model, który nie potrafi autonomicznie przejąć dobrze zabezpieczonej sieci, może nadal tworzyć wiadomości, analizować kod, tłumaczyć przynęty lub dostosowywać skrypty.
Tworzy to problem skali. Umiarkowana poprawa możliwości staje się istotna, gdy atakujący mogą uruchamiać tysiące prywatnych sesji bez nadzoru nad poszczególnymi żądaniami.
Terminologia wymaga ostrożności. Wiele systemów opisywanych jako AI open-source trafniej określa się jako modele z otwartymi wagami. Ich wytrenowane parametry można pobrać, lecz dane treningowe, proces rozwoju lub pełne materiały źródłowe mogą pozostawać niedostępne.
To rozróżnienie ma znaczenie dla licencjonowania i przejrzystości. Ma mniejsze znaczenie dla bezpośredniego argumentu Rajavel dotyczącego bezpieczeństwa, który dotyczy możliwości kopiowania, modyfikowania i prywatnego obsługiwania wydajnego systemu.
Jej komentarze pojawiają się w momencie, gdy agenci AI zyskują większą samodzielność. System agentowy to oprogramowanie, które pozwala modelowi planować zadania, korzystać z narzędzi i podejmować działania w kilku krokach.
Wcześniejsze chatboty generowały głównie tekst do sprawdzenia przez człowieka. Agenci mogą teraz przeglądać pliki, pisać kod, wywoływać zewnętrzne usługi i wchodzić w interakcje z systemami przedsiębiorstw.
Takie uprawnienia tworzą więcej możliwości zarówno dla legalnej automatyzacji, jak i nadużyć. Sprawiają też, że konwencjonalne filtrowanie promptów jest tylko jedną częścią problemu bezpieczeństwa.
Rajavel twierdzi, że firmy muszą analizować, gdzie system AI może wykroczyć poza swoje zamierzone granice. Obejmuje to model, jego narzędzia, podłączone dane, uprawnienia użytkowników, środowisko uruchomieniowe i zależności oprogramowania.
Nagłówek Google News oddaje prowokacyjny wniosek, lecz podstawowy argument jest szerszy. Tania zdolność ofensywna to jedno zagrożenie, a niebezpieczne wdrażanie AI w przedsiębiorstwach tworzy kolejne.
Pobrany model może pomóc atakującemu. Nienadzorowany model działający wewnątrz firmy może również ujawniać informacje, wykonywać niebezpieczne instrukcje lub dziedziczyć nadmierne uprawnienia.
Ostrzeżenie Rajavel łączy zatem dwa fronty. Organizacje muszą przygotować się na bardziej zdolnych przeciwników, jednocześnie zabezpieczając własne przyspieszające wykorzystanie AI.
Tania AI zmienia ekonomikę cyberataków
Najważniejsza zmiana nie polega na tym, że AI wymyśla całkowicie nowe przestępstwa, lecz na tym, że zmniejsza nakład pracy potrzebny do skalowania znanych ataków.
Cyberprzestępczość zawsze zależała od ekonomii. Atakujący porównują oczekiwany zwrot z kampanii z kosztem narzędzi, infrastruktury, dostępu i wykwalifikowanej pracy.
AI może obniżyć kilka z tych kosztów. Może pomagać mniej doświadczonym operatorom rozumieć nieznany kod, podsumowywać dokumentację techniczną i dostosowywać komunikaty socjotechniczne.
Prywatny model wspiera również wielokrotne eksperymentowanie. Atakujący mogą usuwać ograniczenia behawioralne, dostrajać system i integrować go ze zautomatyzowanymi przepływami pracy.
Rajavel twierdzi, że Palo Alto Networks obsługuje ponad 70 000 klientów i zatrzymuje około 30 miliardów ataków przechodzących przez jej sieć. Dane te opisują widoczność firmy, a nie całkowity globalny krajobraz zagrożeń.
Powiedziała również, że w poprzednim roku kalendarzowym firma napotkała niemal 250 milionów wcześniej niewidzianych ataków. Według jej wywiadu było to czterokrotnie więcej niż rok wcześniej.
Wcześniej niewidziane zdarzenie nie jest automatycznie atakiem wygenerowanym przez AI. Liczba nowych wykryć może rosnąć z powodu zmieniającego się zachowania atakujących, lepszych sensorów, rozszerzonego zasięgu wśród klientów lub zmienionych metod klasyfikacji.
Dane Rajavel ilustrują zatem skalę obrony, a nie dowodzą związku przyczynowego. Pokazują, dlaczego nawet niewielka poprawa produktywności atakujących może obciążać zespoły bezpieczeństwa.
Zagrożenie staje się poważniejsze, gdy AI wykracza poza generowanie tekstu. Modele z dostępem do narzędzi mogą analizować systemy, testować hipotezy, poprawiać polecenia i realizować cele wieloetapowe.
Oceny cybernetyczne Anthropic z 2025 r. cyber evaluations wykazały wyraźny postęp w identyfikowaniu podatności i złożonych łańcuchach ataków. Oceniane modele nadal miały trudności z długimi planami i nieoczekiwanymi przeszkodami.
To połączenie ma znaczenie. Obecne ograniczenia nie pozwalają na proste twierdzenia, że autonomiczna AI zastąpiła ekspertów od ataków. Jednocześnie poprawiająca się wydajność może przyspieszać pracę ekspertów i zwiększać możliwości słabszych podmiotów.
Komercyjni dostawcy mogą reagować na zaobserwowane nadużycia. Mogą aktualizować klasyfikatory, ograniczać narzędzia, redukować dostęp lub badać konta powiązane z podejrzaną aktywnością.
Otwarte wagi zmieniają tę relację. Dostawca może opublikować ulepszone wytyczne dotyczące bezpieczeństwa, lecz nie może zdalnie zaktualizować każdej pobranej kopii.
Ta sama trwałość wspiera legalnych użytkowników. Badacze mogą odtwarzać wyniki, firmy mogą przechowywać wrażliwe informacje w lokalnej infrastrukturze, a deweloperzy mogą dostosowywać modele do specjalistycznych zadań.
Dlatego konflikt nie sprowadza się po prostu do odpowiedzialnych firm przeciw nieodpowiedzialnym twórcom otwartych modeli. Otwartość tworzy rzeczywiste korzyści ekonomiczne, naukowe i związane z bezpieczeństwem.
Obrońcy wykorzystują dostępne modele do analizowania złośliwego oprogramowania, przeszukiwania logów, klasyfikowania alertów i badania ataków. Mniejsze organizacje mogą budować narzędzia ochronne bez uzależniania się od jednego dostawcy.
Asymetria ekonomiczna różni się w zależności od zadań. Obrońcy muszą stale chronić wiele systemów, podczas gdy atakujący może potrzebować tylko jednej skutecznej ścieżki.
AI może pomagać obrońcom przetwarzać ogromne wolumeny sygnałów. Może też pomagać atakującym szukać pojedynczego błędu, który przetrwa te zabezpieczenia.
Własne dane Rajavel dotyczące przedsiębiorstwa pokazują stronę obronną. Powiedziała, że Palo Alto Networks zwiększyło automatyzację operacji informatycznych z 12 procent kilka lat temu do 83 procent.
Poinformowała również, że koszty operacyjne IT spadły o niemal 72 procent w ciągu dwóch lat. Procesy związane z podróżami i wydatkami osiągnęły 90 procent automatyzacji dzięki AI i przeprojektowaniu procesów.
Są to wyniki raportowane przez firmę, a nie niezależnie zweryfikowane ustalenia przyczynowe. Mimo to pokazują wzrost produktywności, który zachęca przedsiębiorstwa do szybkiego wdrażania AI.
Napięcie wynika bezpośrednio z tego faktu. Ta sama ekonomia, która czyni automatyzację obrony atrakcyjną, obniża także koszty automatyzacji działań ofensywnych.
Prywatny otwarty model nie musi przewyższać najsilniejszego modelu komercyjnego w każdym benchmarku. Musi być wystarczająco zdolny, niedrogi i adaptowalny dla konkretnego przepływu pracy ataku.
Zespoły bezpieczeństwa powinny zatem unikać traktowania rankingów modeli jako jedynego sygnału zagrożenia. Swoboda wdrażania, integracja narzędzi i koszt działania mogą mieć równie duże znaczenie jak surowa wydajność w benchmarkach.
Otwarte modele wymieniają centralną kontrolę na elastyczność
AI z otwartymi wagami rozpowszechnia innowacje i dostęp do narzędzi obronnych, ale usuwa również centralne punkty egzekwowania zasad, które zachowują usługi hostowane.
Dostawca zamkniętego modelu kontroluje interfejs programowania aplikacji, czyli zarządzane połączenie, za pośrednictwem którego klienci przesyłają żądania. Taka kontrola wspiera uwierzytelnianie, limity szybkości, rejestrowanie aktywności i wykrywanie nadużyć.
Dostawca może także zmieniać usługę po jej wydaniu. Może załatać słabość, wzmocnić klasyfikator, ograniczyć funkcję lub usunąć model.
Środki te są niedoskonałe. Atakujący mogą tworzyć konta, ukrywać intencje, rozdzielać pracę, omijać zabezpieczenia typu jailbreak lub kraść dane dostępowe.
Zamknięte systemy również koncentrują ryzyko. Naruszenie bezpieczeństwa u dostawcy może dotknąć wielu klientów, a nieprzejrzyste praktyki szkolenia i moderacji ograniczają zewnętrzną kontrolę.
Systemy z otwartymi wagami odwracają kilka tych właściwości. Użytkownicy zyskują dostęp i możliwość dostosowania, podczas gdy pierwotny deweloper traci ciągłą kontrolę nad dalszymi kopiami.
Stanowisko Anthropic z 2026 r. w sprawie otwartych wag oddaje ten kompromis. Firma popiera otwarte modele pozbawione niebezpiecznych możliwości i sprzeciwia się całkowitym zakazom.
Jej deklarowana obawa pojawia się, gdy model osiąga niebezpieczne zdolności cybernetyczne lub biologiczne. Po udostępnieniu takich wag kopie mogą działać prywatnie, a zabezpieczenia mogą zostać usunięte.
Stanowisko to wspiera część argumentu Rajavel, ale nie dowodzi, że otwarte modele są kategorycznie największym zagrożeniem. Anthropic ma interesy komercyjne w kontrolowanym dostępie do modeli.
Deweloperzy i zwolennicy otwartych modeli przedstawiają inny argument. Zewnętrzni badacze mogą analizować zachowanie, odtwarzać testy, opracowywać środki zaradcze i dostosowywać systemy do zastosowań obronnych.
Lokalne wdrożenie wspiera również kontrolę nad danymi. Szpital, kancelaria prawna lub zespół bezpieczeństwa mogą preferować przetwarzanie wrażliwych materiałów w infrastrukturze, którą sami zarządzają.
Otwarte systemy zmniejszają zależność od polityki i dostępności dostawcy. Mogą rozszerzać dostęp dla środowisk akademickich, startupów, agencji publicznych i regionów niedostatecznie obsługiwanych przez usługi komercyjne.
Wartość bezpieczeństwa wynikająca z tej dostępności jest realna. Wiedza defensywna i narzędzia są nierówno rozpowszechnione, podobnie jak możliwości ofensywne.
Model dostępny do pobrania może pomóc niewielkiemu zespołowi bezpieczeństwa analizować podejrzane skrypty bez wysyłania zastrzeżonych danych do zewnętrznego dostawcy. Może również wspierać powtarzalne badania.
Problem polega na tym, że korzyści i szkody korzystają z tego samego kanału dystrybucji. Publiczne wydanie nie potrafi wiarygodnie odróżnić obrońcy od atakującego.
To kluczowy kompromis stojący za artykułem Google News. Centralna kontrola umożliwia interwencję, podczas gdy rozproszony dostęp pozwala na adaptację.
Żadna pojedyncza etykieta tego nie rozstrzyga. „Otwarte” nie oznacza bezpieczne, a „zamknięte” nie oznacza zabezpieczone.
Bardziej użyteczne pytanie brzmi, czy dana zdolność staje się istotnie bardziej niebezpieczna, gdy może działać bez monitorowania. Cyberbezpieczeństwo dostarcza kilku wiarygodnych przykładów.
Jednym z nich jest skalowalne wykrywanie podatności. Model, który analizuje duże bazy kodu, może pomagać obrońcom znajdować błędy, lecz atakujący mogą skierować tę samą zdolność przeciwko wystawionemu na ataki oprogramowaniu.
Kolejnym jest rozwijanie exploitów. Modele mogą wyjaśniać awarie, generować warianty i pomagać w debugowaniu, nawet jeśli nie potrafią samodzielnie ukończyć zaawansowanego exploitu.
Trzecim jest automatyzacja kampanii. AI może koordynować rozpoznanie, generowanie treści, zmiany w kodzie i decyzje operacyjne wobec wielu celów.
Mechanizmy bezpieczeństwa w zachowaniu modelu mogą ograniczać przypadkowe nadużycia. Wagi dostępne do pobrania pozwalają zdeterminowanym operatorom modyfikować lub omijać te zabezpieczenia.
Nie oznacza to, że każde otwarte wydanie wiąże się z takim samym ryzykiem. Możliwości modelu, wymagania sprzętowe, trudność dostrajania i integracja narzędzi zmieniają praktyczny poziom zagrożenia.
Mały model poprawiający klasyfikację dokumentów stwarza inne ryzyko niż system, który niezawodnie znajduje i wykorzystuje nieznane podatności.
Polityka oparta wyłącznie na otwartości pomijałaby te różnice. Oceny oparte na możliwościach oferują bardziej ukierunkowane podejście.
National Institute of Standards and Technology definiuje model podwójnego zastosowania częściowo poprzez jego potencjał do umożliwiania skutecznych ofensywnych operacji cybernetycznych. Definicja ma zastosowanie niezależnie od prób wdrożenia zabezpieczeń.
Takie ujęcie przenosi uwagę z licencji modelu na to, co faktycznie potrafi zrobić. Uznaje również, że zamknięte zabezpieczenia mogą zawieść lub zostać ominięte.
Podejście NIST nie eliminuje kwestii dystrybucji. Dwa równie zdolne modele mogą stwarzać różne ryzyka operacyjne, gdy jeden pozostaje monitorowany, a drugi rozpowszechnia się w prywatnych kopiach.
Najsilniejsza analiza polityki musi uwzględniać oba wymiary. Możliwości określają potencjalne szkody, a dystrybucja decyduje o tym, jak łatwo dostawcy lub władze mogą interweniować.
Ryzyko tkwi również w łańcuchu dostaw AI
Skupienie wyłącznie na atakujących używających otwartych modeli pomija bezpośrednie zagrożenie związane z importowaniem przez przedsiębiorstwa niezweryfikowanych modeli, bibliotek i agentów do zaufanych środowisk.
Rajavel wielokrotnie argumentowała, że bezpieczeństwa AI nie można dodawać po wdrożeniu. Firmy muszą jednocześnie zabezpieczać model, dane, aplikację, infrastrukturę i środowisko wykonawcze.
Bezpieczeństwo środowiska wykonawczego oznacza obserwowanie i kontrolowanie tego, co system AI robi podczas działania. Obejmuje to jego prompty, wyniki, wywołania narzędzi, pliki, tożsamości i połączenia sieciowe.
Potrzeba ta rośnie wraz z rozwojem agentowej AI. Agent, który jedynie tworzy szkice tekstów, ma ograniczony zasięg. Taki, który może wykonywać kod lub odpytywać rekordy klientów, wiąże się ze znacznie większym ryzykiem operacyjnym.
Przedsiębiorstwa często łączą kilka modeli zamiast korzystać z jednego dużego systemu. Model ogólnego przeznaczenia może planować zadanie, podczas gdy mniejsze modele analizują dokumenty, klasyfikują obrazy lub wyodrębniają ustrukturyzowane informacje.
Ta modułowa architektura poprawia szybkość i koszty. Tworzy jednak także zależności, których konwencjonalne inwentaryzacje oprogramowania mogą nie uchwycić.
Model pobrany z publicznego repozytorium nie jest jedynie treścią. Jego format, metadane, kod ładowania, tokenizer, środowisko wykonawcze i biblioteki pomocnicze mogą wprowadzać podatności.
Badacze Palo Alto Networks ujawnili podatności bibliotek związane z otwartymi projektami AI i uczenia maszynowego powiązanymi z badaczami NVIDIA, Salesforce i Apple. Podatne wersje mogły wykonywać złośliwy kod za pośrednictwem spreparowanych metadanych modelu.
Projektami, których dotyczył problem, były NeMo, Uni2TS i FlexTok. Badacze stwierdzili, że podatne mechanizmy ładowania mogły wykonywać dowolne polecenia podczas przetwarzania zmodyfikowanych plików modeli.
Ustalenia te nie dowodzą, że otwarte modele są z natury złośliwe. Pokazują, że artefakty AI uczestniczą w łańcuchu dostaw oprogramowania ze znanymi ryzykami związanymi z zależnościami i wykonywaniem kodu.
Wskazówki OWASP dotyczące łańcucha dostaw wskazują repozytoria modeli, pakiety, platformy danych i oprogramowanie do operacji uczenia maszynowego jako możliwe powierzchnie ataku.
Wskazówki zalecają weryfikowanie autentyczności pakietów, monitorowanie wersji i utrzymywanie zależności. Praktyki te brzmią rutynowo, lecz rozwój AI może osłabiać ich stosowanie.
Zespoły mogą pobierać modele podczas eksperymentów i wprowadzać je do produkcji bez pełnego przeglądu. Praca oparta na notebookach może zacierać granicę między badaniami a wdrożonym oprogramowaniem.
Nazwy modeli również mogą tworzyć fałszywe poczucie pewności. Popularność, znany podmiot publikujący lub wysoka liczba pobrań nie zastępują kontroli pochodzenia i integralności.
Organizacja powinna wiedzieć, kto opublikował model, której dokładnie wersji używa oraz czy artefakt uległ zmianie. Powinna również śledzić licencje i znane podatności.
Zespoły bezpieczeństwa muszą skanować pliki modeli przed ich załadowaniem. Powinny preferować bezpieczniejsze formaty serializacji i izolować każdy proces obsługujący niezaufane artefakty.
Zasada najmniejszych uprawnień pozostaje niezbędna. Agent powinien otrzymywać wyłącznie dane i narzędzia wymagane do przypisanego mu zadania, a nie szeroki dostęp dla wygody.
Ograniczenia sieciowe również mają znaczenie. Skopromitowany przepływ pracy modelu nie powinien swobodnie kontaktować się z systemami zewnętrznymi ani przemieszczać się lateralnie po infrastrukturze wewnętrznej.
Firmy powinny rejestrować wywołania narzędzi i dostęp do wrażliwych danych. Dzienniki muszą zawierać wystarczający kontekst, by odtworzyć, co agent próbował zrobić i która tożsamość to autoryzowała.
Zatwierdzenie przez człowieka powinno pozostać na granicach o dużym wpływie. Transfery finansowe, zmiany produkcyjne, eskalacja uprawnień i komunikacja zewnętrzna wymagają silniejszych kontroli niż streszczanie dokumentów.
Sceptyczne zastrzeżenie jest istotne. Palo Alto Networks sprzedaje produkty bezpieczeństwa, więc jej kierownictwo ma komercyjny powód, by podkreślać rozszerzające się powierzchnie ataku.
Ta motywacja nie unieważnia technicznego argumentu Rajavel. Oznacza jednak, że czytelnicy powinni oddzielać zweryfikowane podatności i zmierzone zachowania od szerszych prognoz dotyczących „największego” zagrożenia.
Wolumeny wykryć jej firmy nie mogą ustalić, że otwarte modele spowodowały określoną część ataków. Wywiad nie przedstawia też porównawczej częstości incydentów dla systemów otwartych i zamkniętych.
Opóźnienie możliwości wynoszące od czterech do sześciu miesięcy również wymaga powtarzanych testów. Publiczne benchmarki mogą nie odzwierciedlać rzeczywistej pracy związanej z włamaniami, gdzie znaczenie mają trwałość, skrytość i adaptacja do środowiska.
Zamknięci dostawcy mierzą się z własnymi poważnymi zagrożeniami. Kontrole kont mogą zawieść, osoby wewnątrz organizacji mogą nadużywać dostępu, a zdolne modele mogą pomagać szkodliwym użytkownikom, zanim zainterweniują systemy monitorujące.
Wagi modeli frontierowych mogą również zostać skradzione. Przewaga dystrybucyjna systemu zamkniętego znika, jeśli atakujący pozyskają jego parametry i będą obsługiwać je prywatnie.
Ostrożny wniosek jest węższy niż nagłówek. Otwarta dystrybucja może wzmacniać ryzyko cybernetyczne, gdy zdolne modele stają się tanie, modyfikowalne i trudne do monitorowania.
Ten mechanizm jest wiarygodny. Jego obecna skala pozostaje niepewna i powinna być mierzona, a nie zakładana.
Trzy sygnały sprawdzą ostrzeżenie Rajavel
Kolejna faza tej debaty będzie zależeć od dowodów dotyczących możliwości, rzeczywistych incydentów oraz egzekwowalnych praktyk bezpieczeństwa, a nie od etykiet modeli.
Pierwszym sygnałem jest niezależna ocena cybernetyczna nowo wydawanych modeli o otwartych wagach. Badacze potrzebują testów mierzących pracę wieloetapową, a nie tylko pojedyncze pytania lub zagadki programistyczne.
Przydatne oceny powinny analizować wykrywanie podatności, rozwijanie exploitów, eskalację uprawnień, utrzymywanie dostępu i adaptację po niepowodzeniu. Powinny porównywać systemy przy podobnych narzędziach i budżetach obliczeniowych.
Pogłębiająca się różnica między modelami otwartymi a frontierowymi osłabiłaby tezę o czterech do sześciu miesięcy. Wielokrotnie niewielka różnica ją wzmocniłaby.
Projektowanie ocen pozostanie kwestią sporną. Publikowanie szczegółowych testów ofensywnych może samo w sobie rozpowszechniać techniki, podczas gdy testowanie prywatne utrudnia audyt wyników.
Najlepsze programy zapewnią wystarczającą metodologię dla wiarygodności, nie publikując instrukcji operacyjnych upraszczających nadużycia. Niezależni ewaluatorzy mogą zmniejszyć zależność od twierdzeń dostawców.
Drugim sygnałem są dowody z rzeczywistych ataków. Dostawcy zabezpieczeń, dostawcy modeli, rządy i firmy reagujące na incydenty powinny dokumentować, jak AI zmienia zachowania atakujących.
Kluczowe pytanie nie brzmi, czy atakujący użył modelu w którymś momencie. Chodzi o to, czy AI umożliwiła większą skalę, szybkość, dostęp lub możliwości techniczne.
Badacze powinni rozróżniać usługi hostowane od modeli obsługiwanych prywatnie, gdy pozwalają na to dowody. Bez tego rozdzielenia szerokie twierdzenia o otwartoźródłowej AI pozostają trudne do zweryfikowania.
Powinni także odróżniać możliwości od przyczynowości. Maszyna może generować tekst phishingowy, nie decydując o targetowaniu kampanii, infrastrukturze ani monetyzacji.
Telemetria z rzeczywistego świata może ujawnić, które zadania atakujący automatyzują najpierw. Może też pokazać, gdzie ograniczenia modeli nadal wymagają ludzkiej wiedzy.
Zmianą o najwyższym ryzyku byłoby niezawodne autonomiczne wykorzystywanie podatności w nieznanych środowiskach. Wymaga to planowania, używania narzędzi, interpretowania informacji zwrotnych i odzyskiwania sprawności po błędach.
Bardziej bezpośrednia zmiana może dotyczyć orkiestracji. Operatorzy-ludzie mogą delegować modelom wiele ograniczonych zadań, zachowując kontrolę nad decyzjami strategicznymi.
Trzecim sygnałem jest to, czy rządy i deweloperzy zbiegną się wokół standardów wydawania opartych na możliwościach. Standardy te oceniałyby niebezpieczne funkcje przed dystrybucją.
NIST już promował zarządzanie cyklem życia dla modeli bazowych podwójnego zastosowania. Jego wytyczne obejmują ocenę modeli, cybernetyczne nadużycia i ryzyko w łańcuchu dostaw.
Funkcjonalne ramy miałyby zastosowanie zarówno do otwartych, jak i zamkniętych deweloperów po przekroczeniu progów możliwości. Nie zakładałyby, że jeden model dystrybucji jest uniwersalnie bezpieczny.
Otwarte wydania mogą wymagać dodatkowych środków łagodzących po przekroczeniu przez system istotnego progu. Opcje obejmują etapowy dostęp, niezależne testowanie, opóźnione wydanie lub wstrzymanie konkretnych komponentów wysokiego ryzyka.
Każda opcja wiąże się z kosztami. Ograniczenia mogą koncentrować siłę rynkową, spowalniać badania defensywne i ograniczać dostęp mniejszym organizacjom.
Całkowite zakazy miałyby również trudności w praktyce. Wagi mogą przekraczać granice, kopie mogą przetrwać bezterminowo, a mniejsze modele wciąż się poprawiają.
Dostawcy komercyjni nie powinni otrzymywać automatycznego zwolnienia. Ich systemy wymagają silnego monitorowania, przejrzystego raportowania i szybkich reakcji na zweryfikowane nadużycia.
Nabywcy korporacyjni stoją przed bardziej bezpośrednią decyzją. Powinni traktować każdy model i agenta jako zależność programistyczną z własną tożsamością, uprawnieniami, pochodzeniem i zachowaniem w środowisku wykonawczym.
Oznacza to utrzymywanie kompletnej inwentaryzacji AI. Zespoły muszą wiedzieć, których modeli używają pracownicy, jakie dane do nich trafiają i jakie działania mogą podejmować.
Przegląd bezpieczeństwa powinien podążać za ryzykiem, a nie za nowością. Lokalnie hostowany system streszczający i autonomiczny agent produkcyjny nie powinny podlegać identycznym procesom zatwierdzania.
Organizacje powinny również ocenić, co dzieje się po naruszeniu bezpieczeństwa. Ograniczenie skutków incydentu często ma większe znaczenie niż przekonanie, że prewencja zawsze zadziała.
Dobrze zaprojektowany agent może zawieść bez narażania całej sieci. Źle zaprojektowany agent może przekształcić jeden złośliwy prompt w incydent obejmujący całe przedsiębiorstwo.
Również pracownicy umysłowi mają tu swoją rolę. Powinni unikać umieszczania wrażliwych materiałów w niezatwierdzonych usługach i weryfikować istotne instrukcje wygenerowane przez AI.
Zespoły pracujące z lokalnymi dokumentami technicznymi mogą zbudować przeszukiwalną bazę wiedzy z kontrolowanymi źródłami i jasno określonymi granicami dostępu. Ta sama dyscyplina dotyczy każdego środowiska pracy z AI.
Czytelnicy trafiający z Google News powinni zatem traktować tezę Rajavela jako możliwą do sprawdzenia hipotezę dotyczącą bezpieczeństwa, a nie rozstrzygającą klasyfikację wszystkich zagrożeń związanych z AI.
Teza zyskuje na sile, jeśli otwarte modele wielokrotnie zbliżają się do czołowych możliwości cybernetycznych w ciągu kilku miesięcy i pojawiają się w udokumentowanych atakach. Słabnie, jeśli praktyczne różnice w możliwościach pozostają duże.
Słabnie również wtedy, gdy monitorowanie nie ogranicza w istotny sposób nadużyć w modelach hostowanych. Centralna kontrola zwiększa bezpieczeństwo tylko wtedy, gdy dostawcy skutecznie z niej korzystają.
Ostrzeżenie Rajavela dotyczy ostatecznie utraty możliwości interwencji. Gdy zdolne wagi modelu się rozpowszechnią, żaden deweloper nie może wycofać każdej kopii, przywrócić każdego zabezpieczenia ani skontrolować każdego zastosowania.
Ta trwałość zasługuje na poważną uwagę. Podobnie jak korzyści obronne, przejrzystość i konkurencja, które może wspierać otwarty rozwój.
Właściwą odpowiedzią nie jest ani samozadowolenie, ani odruchowy zakaz. Potrzebne są lepsze dowody, decyzje o wydaniu uwzględniające poziom możliwości, zabezpieczone łańcuchy dostaw oraz ściśle ograniczeni agenci przedsiębiorstw.
Śledź kolejne duże wydanie otwartych wag modelu, a następnie zadaj trzy konkretne pytania. Jakie zadania cybernetyczne może on wykonać, jakie mechanizmy kontroli znikają po pobraniu i jakie incydenty pokazują nadużywanie tych możliwości?
Odpowiedzi na te pytania przesądzą o tym, czy ostrzeżenie nagłośnione przez Google News stanie się kluczowym problemem bezpieczeństwa AI, czy jednym z kilku konkurujących zagrożeń.



