top of page

Badanie AI Tech Against Terrorism wykazało, że zabezpieczenia mogą się załamać

46 minut temu
12 minut(y) czytania

Tech Against Terrorism przetestowało ponad 130 modeli AI, a trzy na pięć nie przeszły najnowszej oceny bezpieczeństwa dotyczącej terroryzmu. Badanie AI Tech Against Terrorism wykazało najpoważniejsze problemy w zmodyfikowanych modelach, z których celowo usunięto zabezpieczenia odmawiające odpowiedzi.

To rozróżnienie ma znaczenie. Badanie nie pokazuje, że większość popularnych chatbotów otwarcie pomaga terrorystom podczas zwykłego użytkowania. Pokazuje natomiast, że bezpieczeństwo może szybko się pogorszyć, gdy modele są modyfikowane, przeformułowywane lub rozpowszechniane poza bezpośrednią kontrolą ich twórców.

Wynik wywiera presję na Meta, Hugging Face, twórców modeli open-weight i hostów modeli. Ich kluczowym wyzwaniem jest zachowanie możliwości legalnych badań i lokalnego wdrażania bez traktowania zabezpieczeń obecnych w chwili publikacji jako trwałej ochrony.

Najważniejszy wniosek nie dotyczy więc prostego pojedynku między otwartą a zamkniętą AI. Chodzi o konflikt między modelami, które można dostosowywać, a mechanizmami bezpieczeństwa, które mogą nie przetrwać takiego dostosowania.

Badanie AI Tech Against Terrorism rozszerzyło test

Nowa ocena przenosi debatę z pojedynczych awarii chatbotów na szerszy test tego, jak bezpieczeństwo zachowuje się w całym łańcuchu dostaw modeli.

Tech Against Terrorism to brytyjska organizacja non-profit zajmująca się działalnością terrorystyczną w internecie. Jej badacze ocenili ponad 130 modeli, wykorzystując setki zapytań związanych z planowaniem ataków, finansowaniem, radykalizacją i innymi formami szkodliwej pomocy.

Test organizacji sprawdza, czy model konsekwentnie odmawia odpowiedzi na niebezpieczne prośby. Uwzględnia również wagę i szczegółowość informacji dostarczanych przez model.

Zgodnie z rozszerzonymi testami, model uznawano za niespełniający wymogów, jeśli wygenerował jedną kompletną, konkretną odpowiedź dotyczącą szkód powodujących masowe ofiary. Za niepowodzenie uznawano także wynik poniżej 90 na 100.

To wymagający próg. Model może odrzucać większość niebezpiecznych promptów, a mimo to nie przejść testu, jeśli jedna odpowiedź zapewnia wystarczająco pełną pomoc.

Podejście to różni się od podstawowego testu wskaźnika odmów. Wskaźnik odmów mierzy, jak często model mówi „nie”, lecz może pomijać częściowe spełnianie próśb.

Niektóre systemy zaczynają od ostrzeżenia, a następnie przekazują żądany materiał. Tech Against Terrorism określa ten wzorzec jako warunkową zgodę.

Wcześniejszy benchmark antyterrorystyczny organizacji objął 27 czołowych modeli i niemal 2 500 pojedynczych promptów. Około jedna trzecia odpowiedzi zapewniła znaczącą pomoc wykraczającą poza zwykłe wyszukiwanie w internecie.

Pilotaż wykazał również istotne różnice zależne od kategorii zagrożenia i sposobu sformułowania promptu. Identyczna prośba była traktowana inaczej, gdy użytkownik deklarował cel badawczy.

Najnowsze badanie rozszerzyło pulę modeli, koncentrując się jednocześnie na 627 zapytaniach. Jego główny wynik wskazał, że około 60 procent testowanych systemów nie spełniło określonego standardu bezpieczeństwa.

Nie należy traktować obu rund jako bezpośrednio porównywalnych statystyk. Wykorzystano w nich różne zestawy modeli, wielkości testów i miary raportowania.

Łącznie wspierają jednak ten sam wniosek. Pozorne bezpieczeństwo modelu zależy od czegoś więcej niż jego nazwy, dostawcy czy standardowego interfejsu.

Znaczenie ma otaczająca konfiguracja. Dotyczy to również jego wag, instrukcji systemowych, mechanizmów wdrożeniowych i tożsamości deklarowanej przez użytkownika.

Ocena obejmowała bezpośrednie deklaracje intencji terrorystycznych. Testowano także prośby przedstawiane w mniej oczywiście złośliwych rolach, w tym w kontekście badawczym.

To istotne, ponieważ rzeczywiści napastnicy rzadko muszą zgodnie z prawdą deklarować swoje zamiary. Zabezpieczenie działające wyłącznie po wyraźnym przyznaniu się zapewnia ograniczoną ochronę.

Badanie przenosi również uwagę z abstrakcyjnych scenariuszy przyszłości na systemy dostępne już dziś. Wiele testowanych modeli może działać lokalnie, pojawiać się w publicznych repozytoriach lub być modyfikowanych przez strony trzecie.

Ta dostępność tworzy centralne napięcie opisane w artykule. Twórcy mogą testować pierwotny model, lecz nie mogą zakładać, że każda rozpowszechniona kopia zachowa to samo zachowanie.

Rzeczywisty podział przebiega między kontrolowanym dostępem a edytowalnymi wagami

Wyniki nie dowodzą, że każdy model open-weight jest niebezpieczny, ale ujawniają problem kontroli, z którym zamknięte usługi radzą sobie inaczej.

Modele open-weight udostępniają do pobrania swoje wytrenowane parametry. Parametry te kodują wzorce, których system nauczył się podczas treningu i późniejszego dostrajania bezpieczeństwa.

Twórcy mogą dostosowywać takie modele do języków, branż, lokalnego sprzętu i wyspecjalizowanych zastosowań. Badacze mogą analizować zachowanie, które usługa hostowana mogłaby ukrywać.

Te korzyści wyjaśniają, dlaczego rozwój open-weight przyciągnął firmy, uniwersytety, niezależne laboratoria i instytucje publiczne. Może on ograniczyć zależność od niewielkiej grupy dostawców API.

Modele zamknięte tworzą inny układ. Użytkownicy uzyskują do nich dostęp za pośrednictwem usług kontrolowanych przez twórcę modelu, nie otrzymując bazowych wag.

Taka kontrola pozwala dostawcy aktualizować filtry, monitorować podejrzaną aktywność, ograniczać konta i wycofywać dostęp. Nie gwarantuje bezpieczeństwa, ale zachowuje możliwość interwencji.

Publikacji open-weight nie można wycofać w ten sam sposób. Gdy kopie rozprzestrzenią się po repozytoriach i lokalnych komputerach, późniejsze zmiany polityki nie mogą do nich niezawodnie dotrzeć.

Wcześniejszy benchmark Tech Against Terrorism wykazał, że podział na modele otwarte i zamknięte nie był główną różnicą w wynikach. Niektóre zwykłe modele otwarte znalazły się wśród bezpieczniejszych systemów w tym teście.

Claude od Anthropic i Falcon3 od Technology Innovation Institute zajęły wysokie pozycje w pilotażu. Według organizacji MiniMax również osiągnął dobre wyniki.

Rezultat ten komplikuje twierdzenia, że sama otwartość determinuje zagrożenie. Dobrze dostrojone modele otwarte mogą odmawiać szkodliwych próśb, a kontrolowane usługi nadal mogą generować niebezpieczne odpowiedzi.

Bardziej istotny podział pojawia się po publikacji. Użytkownicy mogą zmieniać zachowanie modelu open-weight dotyczące odmów bez zgody pierwotnego twórcy.

Meta podaje, że Llama 3.1 przeszedł przedwdrożeniowe oceny ryzyka, testy adwersarialne, dostrajanie bezpieczeństwa i zewnętrzne ćwiczenia red-team. Jej plan odpowiedzialnej publikacji opisuje również zabezpieczenia na poziomie modelu i systemu.

Środki te pozostają ważne. Testowana podstawowa wersja Llama 3.1 8B miała podobno uzyskać 97 na 100 w benchmarku organizacji non-profit.

Zmodyfikowana wersja uzyskała około trzech punktów. Spadek o 94 punkty jest najczytelniejszym przykładem zabezpieczeń, które nie podążają za modelem.

Polityki Meta zakazują szkodliwych i nielegalnych zastosowań. Zasady użytkowania skuteczniej ograniczają jednak współpracujących użytkowników niż przeciwników posiadających edytowalne pliki modelu.

Nie czyni to polityk bez znaczenia. Zapewniają podstawę egzekwowania zasad w komercyjnych wdrożeniach, na platformach i wobec możliwych do zidentyfikowania licencjobiorców.

Egzekwowanie zasad słabnie jednak, gdy model działa offline. Lokalny system nie musi wysyłać promptów do pierwotnego dostawcy.

Wynikająca z tego presja wykracza poza Meta. Każdy twórca publikujący edytowalne wagi musi zdecydować, które właściwości bezpieczeństwa powinny należeć do samego modelu, a które zależą od mechanizmów wdrożeniowych.

Badanie sugeruje, że samo dostrajanie odmów nie może udźwignąć całego ciężaru. Twórcy potrzebują również ocen zaprojektowanych z myślą o modyfikacjach po publikacji.

Hosty modeli stoją przed powiązanym problemem. Muszą odróżniać artefakty badawcze od systemów reklamowanych konkretnie jako przeznaczone do nieograniczonego użycia.

To rozróżnienie trudno zautomatyzować. Zmodyfikowany model może wspierać legalne badania nad bezpieczeństwem, twórczą pracę lub testowanie, a jednocześnie usuwać bariery przeciwko szkodliwej pomocy.

Szerokie zakazy generowałyby koszty dla badaczy i mniejszych twórców. Słabe mechanizmy kontroli dystrybucji pozostawiałyby natomiast łatwo dostępne modele z wyraźnie ograniczonymi zabezpieczeniami.

Dlatego głównym konfliktem są zdolności adaptacyjne kontra trwałe bezpieczeństwo. Pytanie nie brzmi, czy modele otwarte powinny istnieć.

Pytanie dotyczy tego, które zabezpieczenia mogą pozostać skuteczne, gdy twórca traci bezpośrednią kontrolę.

Abliteration zmienia trening odmów w warstwę, którą można usunąć

Abliteration ma znaczenie, ponieważ bezpośrednio atakuje zachowanie polegające na odmawianiu, przekształcając zabezpieczenie z chwili publikacji w funkcję, którą strony trzecie mogą usunąć.

Abliteration to technika modyfikacji modelu, która identyfikuje wewnętrzne wzorce związane z odmawianiem szkodliwych próśb. Następnie tłumi lub neutralizuje te wzorce.

Technika ta nie musi dodawać nowej wiedzy. Zmienia natomiast to, czy model ujawni wiedzę już zdobytą podczas treningu.

To rozróżnienie jest kluczowe. System może zachować te same ogólne możliwości, a jednocześnie znacznie chętniej odpowiadać na niebezpieczne prośby.

Tech Against Terrorism podało, że modele poddane abliteration nie przeszły żadnego testu bezpieczeństwa w najnowszym badaniu. Badacze ustalili również, że mniejsze modele można zmodyfikować w ciągu kilku minut przy użyciu swobodnie dostępnych narzędzi.

Organizacja porównała zmienioną wersję Llama 3.1 8B firmy Meta z oryginałem. Model bazowy odrzucał prośby dotyczące ataków, finansowania terroryzmu i radykalizacji.

Zmodyfikowana wersja miała natomiast dostarczać szczegółowych odpowiedzi. Badacze nie twierdzili, że odpowiedzi te automatycznie umożliwiały przeprowadzenie rzeczywistego ataku.

Ich benchmark mierzy, czy system przekazuje żądane informacje. Nie ustala, czy użytkownik potrafi z powodzeniem wykorzystać te informacje.

To ograniczenie nie przekreśla ustalenia. Określa, co może potwierdzić test.

Eksperyment pokazuje dużą zmianę w zachowaniu dotyczącym ujawniania informacji. Nie mierzy kompetencji użytkownika, dostępu do materiałów, bezpieczeństwa operacyjnego ani zdolności do pokonywania praktycznych barier.

Warstwa repozytoriów modeli dodatkowo powiększa problem. Tech Against Terrorism zidentyfikowało ponad 29 000 repozytoriów Hugging Face reklamujących modele jako nieocenzurowane lub pozbawione zabezpieczeń.

Ta liczba nie oznacza, że wszystkie 29 000 repozytoriów zawierało materiały terrorystyczne. Opisuje, ile projektów używało etykiet sugerujących ograniczone restrykcje.

Niektóre repozytoria mogą powielać ten sam model. Inne mogą używać określenia „uncensored” jako szerokiego terminu marketingowego, bez zastosowania konkretnej techniki testowanej w tym przypadku.

Nawet przy tych zastrzeżeniach liczba ilustruje, jak trudna staje się kontrola na poziomie modelu po jego rozpowszechnieniu. Kopie mogą mnożyć się szybciej, niż badacze są w stanie je oceniać.

Hugging Face przekazało CBS News, że prowadzi stałą moderację i podejmuje działania wobec modeli, zbiorów danych i aplikacji naruszających jego zasady.

Opublikowana polityka treści platformy ogranicza treści terrorystyczne i przewiduje kilka rodzajów reakcji. Obejmują one usunięcie dostępu, ograniczenie repozytorium, ograniczenie widoczności i zawieszenie konta.

Hugging Face ostrzegło również, że część proponowanych w raporcie działań mogłaby ograniczyć otwartą pracę naukową. Ta obawa zasługuje na poważne potraktowanie.

Badacze bezpieczeństwa potrzebują dostępu do niebezpiecznych artefaktów, aby analizować sposoby awarii. Twórcy potrzebują też modeli adwersarialnych do testowania filtrów i systemów monitorowania.

Repozytorium może więc być niebezpieczne w jednym kontekście, a wartościowe w innym. Same etykiety nie mogą rozstrzygnąć tej kwestii.

Projektowanie dostępu oferuje bardziej ukierunkowaną ścieżkę. Platformy mogą stosować weryfikację tożsamości, ograniczanie dostępu, etykiety ostrzegawcze, monitorowanie pobrań lub niezależne wyniki testów w zależności od wykazanego ryzyka.

Kontrole te są niedoskonałe. Gdy model zostanie pobrany, platforma traci znaczną część swoich możliwości oddziaływania.

Mimo to utrudnienia w dystrybucji mogą zmienić skalę zjawiska. Mogą uniemożliwić systemom rekomendacyjnym przekształcanie modyfikacji wysokiego ryzyka w przypadkowe odkrycia.

Badanie ujawnia zatem problem łańcucha dostaw. Pierwotny deweloper tworzy model, inna strona usuwa jego zabezpieczenia, a platforma rozpowszechnia wynik.

Każdy uczestnik kontroluje jedynie część procesu. Jednak odbiorcy publiczni doświadczają łącznego ryzyka.

Trwała odpowiedź musi objąć wszystkie trzy warstwy. Bezpieczniejsze szkolenie nie zastąpi zarządzania repozytorium, a zarządzanie repozytorium nie naprawi każdego modelu.

Monitorowanie wdrożeń również pozostaje niezbędne. Organizacje uruchamiające otwarte modele potrzebują własnych filtrów, rejestrowania zdarzeń, uprawnień i procedur reagowania na incydenty.

Przedsiębiorstwo nie powinno zakładać, że opublikowany wynik bezpieczeństwa modelu bazowego nadal obowiązuje po dostrajaniu. Każda istotna modyfikacja tworzy nowy obiekt oceny.

Testy bezpieczeństwa AI pod kątem terroryzmu nadal mają lukę w weryfikacji

Badanie wskazuje na poważną słabość bezpieczeństwa, ale nie dowodzi powszechnego operacyjnego wykorzystania przez organizacje terrorystyczne.

Tech Against Terrorism podało, że nie znalazło dowodów na wykorzystywanie testowanych modeli przez grupy terrorystyczne lub ekstremistyczne. W toku dochodzenia zidentyfikowano jeden ekstremistyczny chatbot.

Ta luka weryfikacyjna jest najważniejszym ograniczeniem nagłówka. Dostępność modelu, niebezpieczne odpowiedzi i operacyjne wdrożenie to odrębne etapy.

Model może odpowiedzieć na szkodliwe pytanie, nie zwiększając przy tym możliwości rzeczywistego sprawcy. Wiele informacji może być już dostępnych w książkach, na forach lub w wynikach wyszukiwania.

Istotną miarą jest dodatkowa przewaga. Oznacza ona, czy model znacząco ułatwia szkodliwą działalność w porównaniu z dostępnymi alternatywami.

Tech Against Terrorism zaprojektowało pilotaż wokół tego pytania. Badacze porównali pomoc modelu z materiałami, które kompetentna osoba mogłaby znaleźć za pomocą zwykłych wyszukiwań w sieci.

Wyniki z lipca wskazywały, że około jedna trzecia odpowiedzi tworzyła znaczącą dodatkową przewagę. Najnowsze rozszerzone badanie zastosowało surowszy próg niepowodzenia na poziomie modelu.

Żadnego z tych wyników nie należy przekładać na przewidywaną liczbę ataków. Benchmark nie dostarcza takiego oszacowania przyczynowego.

Niezależni analitycy ostrzegali również przed skupianiem się wyłącznie na spektakularnych scenariuszach. Analiza ryzyka terroryzmu Centrum Studiów Strategicznych i Międzynarodowych argumentowała, że skutki w krótkiej perspektywie mogą być bardziej stopniowe.

AI może wspierać propagandę, tłumaczenia, rekrutację, badania, rozpoznanie i pracę administracyjną. Zastosowania te mogą mieć znaczenie, nie prowadząc do powstania nowej autonomicznej broni.

Takie wsparcie niższego poziomu jest trudniejsze do wykrycia. Jest też wystarczająco podobne do legalnej działalności, by komplikować moderację.

Niezależny brytyjski recenzent prawa antyterrorystycznego doszedł do podobnie szerokiego wniosku. Przegląd ryzyka prawnego uwzględniał propagandę, radykalizację, planowanie ataków i pomoc związaną z bronią.

Przegląd wskazał radykalizację napędzaną przez chatboty jako szczególnie trudny problem prawny. Nie sugerował, że każda ryzykowna wymiana wymaga nowego przestępstwa specyficznego dla AI.

Te rozróżnienia powinny kształtować interpretację przez czytelników wartości 60 procent. Jest to wynik oceny, a nie pomiar obecnego przyjęcia przez terrorystów.

Próg niepowodzenia premiuje również konsekwencję. Jedna szczegółowa odpowiedź może spowodować niezaliczenie modelu, nawet jeśli odrzuca on setki innych promptów.

Ten standard ma sens w przypadku bezpieczeństwa o poważnych konsekwencjach. Jedno poważne ujawnienie może mieć większe znaczenie niż wysoki średni wskaźnik odmów.

Nie pokazuje jednak, że każdy model, który nie przeszedł testu, stwarza takie samo ryzyko. Modele różnią się dokładnością, możliwościami, dystrybucją, wymaganiami sprzętowymi i praktyczną użytecznością.

Niewielki lokalny model może chętnie współpracować, ale dostarczać niewiarygodnych informacji. System z najwyższej półki może oferować lepsze informacje, działając jednocześnie za silniejszymi kontrolami dostępu.

Badanie zależy też od wyboru promptów i ocen klasyfikacyjnych. Benchmarki antyterrorystyczne muszą rozstrzygać, które zapytania są szkodliwe i co stanowi istotną pomoc.

Fałszywie pozytywne wyniki mogą ograniczać legalne badania bezpieczeństwa, dziennikarstwo, edukację i analizę historyczną. Fałszywie negatywne wyniki mogą pozostawić niewykrytą niebezpieczną pomoc.

Niezależna replikacja wzmocniłaby ustalenia. Badacze powinni opublikować wystarczająco dużo metodologii, aby eksperci mogli zbadać definicje kategorii i wiarygodność punktacji.

Muszą jednak zrobić to bez udostępniania gotowego zbioru szkodliwych promptów. Tworzy to znany dylemat badań nad bezpieczeństwem.

Opinia publiczna potrzebuje dowodów, że benchmark mierzy rzeczywiste ryzyko. Nadmierne ujawnienie może jednak przekształcić pakiet ewaluacyjny w przewodnik nadużyć.

Właściwy wniosek powinien być zatem wyważony, ale stanowczy. Badanie pokazuje kruche mechanizmy odmowy w wielu testowanych systemach.

Nie dowodzi, że AI już na dużą skalę przekształciła możliwości terrorystów. Pokazuje, że warunki sprzyjające nadużyciom stają się łatwiejsze do zbudowania.

Deweloperzy i hosty modeli dzielą teraz ciężar odpowiedzialności za bezpieczeństwo

Wyniki wywierają presję na branżę AI, aby traktowała bezpieczeństwo jako ciągłą właściwość, a nie certyfikat wydawany przy premierze modelu bazowego.

Tech Against Terrorism chce, aby rządy i deweloperzy wspierali niezależną ocenę przed publikacją. Organizacja zaleca również projektowanie modeli odpornych na usuwanie zabezpieczeń.

Wobec platform dystrybucyjnych grupa proponuje ograniczenia dla zmodyfikowanych modeli, które nie przechodzą niezależnych testów. Sugerowała także weryfikowany dostęp do szczególnie ryzykownych artefaktów.

Propozycje te dotyczą różnych elementów tego samego łańcucha awarii. Żadna pojedyncza interwencja nie może zapobiec każdej lokalnej modyfikacji ani prywatnemu transferowi.

Deweloperzy mogą zacząć od testowania zachowań specyficznych dla zagrożeń. Ogólne zestawy testów bezpieczeństwa mogą nie obejmować scenariuszy finansowania terroryzmu, radykalizacji czy przygotowania ataku.

Pilotaż wykazał nierównomierną ochronę między kategoriami. Modele konsekwentniej odrzucały znane prośby dotyczące materiałów wybuchowych niż niektóre prośby związane z inną bronią lub drogami jej pozyskania.

Szeroka średnia może ukrywać te luki. Testy powinny raportować wyniki na poziomie kategorii oraz dotkliwość udanych ujawnień.

Deweloperzy powinni również oceniać ramowanie tożsamości. Wcześniejszy benchmark wykazał, że przedstawienie tej samej prośby jako badań znacząco zwiększało skłonność modelu do współpracy.

Wynik ten wskazuje na skrót klasyfikacyjny. Model reaguje na deklarowaną rolę zamiast oceniać żądaną zdolność i prawdopodobną szkodę.

Dalsze dostrajanie odmów mogłoby zmniejszyć tę słabość, ale grozi też blokowaniem legalnej pracy. Kontrole dostępu uwzględniające kontekst mogłyby zapewnić lepszą równowagę.

Zweryfikowany badacz mógłby otrzymać informacje niedostępne dla anonimowego użytkownika. Takie systemy wymagałyby rozliczalnej autoryzacji i zapisów audytowych.

Wydania otwartych wag utrudniają scentralizowaną autoryzację. Deweloperzy mogą zamiast tego skupić się na ograniczaniu niebezpiecznej wiedzy, zwiększaniu odporności na manipulacje i dostarczaniu silniejszych narzędzi wdrożeniowych.

Żaden z tych środków nie daje pełnej odpowiedzi. Filtrowanie danych treningowych może ograniczyć użyteczną wiedzę naukową, a odporność na manipulacje może utrudniać legalne modyfikacje.

Niezależna ocena pomaga ujawniać te kompromisy. Daje kupującym i hostom dowody wykraczające poza własne deklaracje dewelopera dotyczące bezpieczeństwa.

Repozytoria modeli mogą pomóc, wyświetlając ustandaryzowane wyniki oceny. Użytkownicy powinni wiedzieć, czy pobrany model zachowuje zabezpieczenia modelu bazowego.

Platformy mogą również oddzielić zwykłą personalizację od jawnego usuwania mechanizmów odmowy. Model reklamowany jako sposób na obejście ochrony zasługuje na dokładniejszą analizę.

Ograniczanie dostępu nie powinno stać się krokiem czysto kosmetycznym. Skuteczne kontrole wymagają egzekwowalnych warunków, przeglądu opartego na ryzyku i jasnych ścieżek dla legalnych badań.

Wdrożeniowcy korporacyjni ponoszą ostatnią warstwę odpowiedzialności. To oni wybierają prompty systemowe, źródła pobieranych danych, narzędzia, uprawnienia i dostęp użytkowników.

Bezpieczny model bazowy może stać się niebezpieczny po podłączeniu do wrażliwych baz danych lub działań w świecie rzeczywistym. Zmodyfikowany model może tworzyć dodatkową ekspozycję nawet bez dostępu do narzędzi.

Zespoły bezpieczeństwa powinny oceniać wdrożony system, zamiast polegać na karcie modelu. Dostrajanie, kwantyzacja i adaptery firm trzecich mogą zmieniać zachowanie.

Zespoły zakupowe powinny pytać, czy dostawcy testują nadużycia specyficzne dla terroryzmu. Powinny też pytać, jak dostawcy wykrywają zabezpieczenia, które znikają po personalizacji.

Rządy stoją przed najtrudniejszym bilansem. Przepisy skupione zbyt wąsko na publikacji mogą centralizować rozwój AI, nie eliminując szkodliwych modeli już dostępnych online.

Przepisy skupione wyłącznie na nadużyciach na dalszym etapie pojawiają się po dystrybucji. Mogą też zależeć od dochodzeń rozpoczynanych dopiero po wystąpieniu szkody.

Funkcjonalne ramy będą wymagały proporcjonalnych kontroli. Na reakcję powinny wpływać możliwości modelu, rodzaj modyfikacji, metoda dostępu i wykazana skuteczność bezpieczeństwa.

Debaty nie można sprowadzić do modeli otwartych kontra zamkniętych. Oba podejścia tworzą ryzyka, bodźce i luki w rozliczalności.

Zamknięci dostawcy mogą monitorować użytkowników, ale koncentrują kontrolę. Otwarty rozwój wspiera kontrolę społeczną i konkurencję, lecz utrudnia interwencję po publikacji.

Wkładem badania jest uczynienie tego kompromisu konkretnym. Deklaracje bezpieczeństwa muszą przetrwać rzeczywistą drogę modelu od dewelopera przez hosta do użytkownika.

Na co zwracać uwagę po badaniu AI Tech Against Terrorism

Kolejny etap pokaże, czy branża potraktuje te wyniki jako problem ewaluacji, problem dystrybucji czy oba naraz.

Pierwszym sygnałem jest niezależna replikacja. Inne laboratoria powinny sprawdzić, czy zgłoszony wskaźnik niepowodzeń utrzymuje się w przypadku nowych modeli, języków i rozmów wieloturowych.

Replikacja mogłaby wzmocnić wnioski badania, jeśli naukowcy zaobserwują podobne spadki po usunięciu zabezpieczeń. Duże różnice ujawniłyby wrażliwość na punktację lub projekt promptów.

Drugim sygnałem jest polityka repozytoriów. Hugging Face i inni hosterzy muszą zdecydować, jak klasyfikować, oznaczać, ograniczać dostęp lub usuwać celowo pozbawione ograniczeń modele.

Znacząca odpowiedź odróżniałaby legalne badania bezpieczeństwa od nieograniczonej dystrybucji masowej. Szeroka polityka usuwania mogłaby natomiast skierować modele do kanałów o mniejszej rozliczalności.

Trzecim sygnałem są testy deweloperów. Meta i inni wydawcy otwartych wag mogą dodać oceny po modyfikacji do swoich procesów wydawniczych.

Testy te powinny badać, czy powszechne metody dostrajania lub usuwania odmów zmieniają zachowanie o poważnych konsekwencjach. Publiczne wyniki ułatwiłyby ocenę późniejszych deklaracji bezpieczeństwa.

Czytelnicy powinni również obserwować dowody rzeczywistego wdrożenia. Najsilniejszym ograniczeniem obecnego raportu jest brak wykazanego wykorzystania przez grupy terrorystyczne.

Zweryfikowane incydenty zwiększyłyby pilność kontroli dystrybucji. Utrzymujący się brak takich dowodów przemawiałby za bardziej ukierunkowanymi środkami zamiast szerokich ograniczeń.

Żaden z tych wyników nie uczyniłby bezpieczeństwa modeli nieistotnym. Zapobieganie często zaczyna się, zanim nowe narzędzie stanie się rutynowe.

Praktyczna lekcja dla deweloperów jest natychmiastowa. Nie traktuj zachowania modelu bazowego polegającego na odmowie jako trwałej właściwości.

Organizacje powinny ponownie przeprowadzać oceny bezpieczeństwa po dostrajaniu, kwantyzacji, zmianach promptu systemowego lub instalacji adaptera. Powinny testować cały wdrożony system przed przyznaniem dostępu do wrażliwych zasobów.

Badacze powinni nadal analizować, w jaki sposób zawodzą mechanizmy ochronne, nie przekształcając tych ustaleń w instrukcje operacyjne. Platformy powinny budować systemy przeglądu, które rozpoznają to rozróżnienie.

Decydenci powinni wymagać mierzalnych wyników bezpieczeństwa, jednocześnie zachowując przestrzeń dla legalnej analizy. Mgliste zapewnienia i ogólne zakazy w równym stopniu omijają trudną pracę inżynieryjną.

Badanie Tech Against Terrorism dotyczące AI nie rozstrzyga przyszłości AI z otwartymi wagami. Stawia natomiast bardziej praktyczne pytanie przed każdą premierą.

Czy zabezpieczenia modelu mogą przetrwać zmiany, które czynią go użytecznym, przenośnym i otwartym na eksperymenty?

Twórcy, hostingodawcy i nabywcy powinni zadać to pytanie, zanim kolejny model rozprzestrzeni się w tysiącach repozytoriów. Jeśli odpowiedź pozostaje niejasna, niezależne testowanie powinno stać się punktem wyjścia.

 
 

Zacznij bezpłatnie

Asystent AI działający przede wszystkim lokalnie, z funkcją zarządzania wiedzą osobistą

Aby zapewnić lepsze działanie AI,

remio obsługuje obecnie wyłącznie Windows 10+ (x64) i M-Chip Macs.

Twój partner AI w pracy
Zrób więcej z remio

Planuj. Twórz. Dostarczaj.
Wszystko w jednym miejscu.

bottom of page