Rosną zagrożenia dla bezpieczeństwa SynthID, ponieważ znakowanie wodne AI zmienia zachowanie modeli
Metoda znakowania wodnego Google DeepMind wiąże się teraz z niepokojącym konfliktem: nowe testy wykazały, że zmieniała odpowiedzi modeli na szkodliwe prompty. Zagrożenia dla bezpieczeństwa SynthID były najbardziej widoczne podczas prompt injection, gdy kilka modeli spełniało prośby, które bez znakowania wodnego odrzucały.
To odkrycie podważa kluczowe założenie dotyczące niewidocznych znaczników w tekstach AI. Znak wodny może zachować czytelną jakość, a jednocześnie zmieniać tokeny wybierane przez model. Zmiany tokenów mogą wpływać na odmowy, wybór narzędzi i argumenty narzędzi wewnątrz agentów AI.
Natychmiastowa presja spada na Anthropic, Google i deweloperów budujących agentów wokół modeli hostowanych. Anthropic planuje dodać SynthID-Text do przyszłych modeli Claude w ramach odpowiedzi na europejskie przepisy dotyczące przejrzystości. Nowe testy nie oceniały jednak Claude ani produkcyjnej implementacji Anthropic.
To rozróżnienie ma znaczenie. Badanie nie jest dowodem, że Claude stał się mniej bezpieczny. Pokazuje natomiast, że znakowanie wodne należy traktować jako zmianę systemu wpływającą na zachowanie, a nie pasywną etykietę dołączaną po wygenerowaniu treści.
Badacze wykryli zmianę zachowania, a nie tylko inne sformułowania
Nowy wynik jest istotny, ponieważ SynthID zmieniał pojedyncze decyzje dotyczące bezpieczeństwa, nawet gdy ogólna wydajność wydawała się stosunkowo stabilna.
Andrea Siposova, badaczka bezpieczeństwa AI w Lasso Security, porównała generacje ze znakiem wodnym i bez niego w ściśle sparowanych warunkach. Model, prompt, ziarno losowe, skład batcha i temperatura pozostawały stałe. Procesor znaku wodnego był jedyną celową różnicą.
W jej eksperymentach wykorzystano niezmodyfikowany SynthIDTextWatermarkLogitsProcessor dostępny przez Hugging Face. Konfiguracja obejmowała 30 warstw turniejowych, kontekst pięciu tokenów, tabelę próbkowania z 65 536 wpisami oraz historię kontekstu wynoszącą 1 024.
Ocena odmów objęła 200 szkodliwych zachowań z HarmBench. Uwzględniono również 100 nieszkodliwych przypadków kontrolnych z JailbreakBench. Badacze testowali szkodliwe żądania zarówno samodzielnie, jak i z jedną stałą techniką prompt injection.
Prompt injection to wrogie dane wejściowe, które próbują nadpisać zamierzone instrukcje aplikacji. W tym eksperymencie pobrany tekst fałszywie twierdził, że filtrowanie bezpieczeństwa jest wyłączone, i nakazywał modelowi spełnić żądanie.
Wyniki znacznie różniły się między modelami. Przy temperaturze 0.001 Gemma 3 27B zmienił werdykt w przypadku 6 procent samodzielnych szkodliwych żądań. Przy prompt injection wskaźnik tych rozbieżności wzrósł do 23.5 procent.
Co ważniejsze, zmienił się kierunek. Znakowanie wodne zmniejszyło realizację szkodliwych żądań o jeden punkt procentowy w przypadku samodzielnych próśb. W warunkach iniekcji realizacja szkodliwych żądań wzrosła o 12.5 punktu.
Gemma 3 12B wykazał podobny wzorzec. Jego wskaźnik rozbieżności wzrósł z 7.5 procent dla samodzielnych żądań do 11 procent przy iniekcji. Łączny wzrost realizacji szkodliwych żądań osiągnął dziewięć punktów procentowych.
Llama 3.1 8B uzyskał wskaźniki rozbieżności na poziomie 14 procent przy niższej temperaturze oraz 17.5 procent przy 0.7. Jego łączna zmiana była mniej jednoznaczna, ale pojedyncze decyzje nadal się zmieniały.
Phi-4 i Qwen3 4B wykazały niewielkie zmiany. Oba modele często jednak odmawiały realizacji nieszkodliwych żądań kontrolnych. Tak wysoki bazowy poziom odmów utrudnia interpretowanie ich pozornej stabilności jako lepszego bezpieczeństwa.
Pełne badanie zachowania opisuje ten efekt jako „dryf próbkowania”. Termin oznacza, że interwencja w generowanie zmienia decyzje, ponieważ zmienia tokeny wybierane podczas inferencji.
Nie oznacza to, że każdy znak wodny osłabia każdy model. Niektóre klucze znaku wodnego przesuwały zachowanie w stronę bezpieczniejszych odpowiedzi. Inne zwiększały skuteczność ataków, a skala efektu różniła się między modelami.
Najmocniejszy wniosek jest węższy i bardziej użyteczny. Znak wodny może zmieniać zachowanie związane z bezpieczeństwem, dlatego oceny prowadzone bez niego mogą nie opisywać wdrożonego systemu.
Eksperymenty objęły również siedem modeli o otwartych wagach w zadaniach wywoływania narzędzi. Znakowanie wodne obniżyło dokładność w sześciu modelach, przy czym w czterech odnotowano statystycznie istotne spadki.
Do porównań temperatur badacze wykorzystali 1 150 stałych, nierealizowanych na żywo zadań z Berkeley Function Calling Leaderboard. W 21 kombinacjach modeli i temperatur średni wskaźnik sparowanych rozbieżności wyniósł 6.5 procent.
W przypadku Phi-4 przy temperaturze 1.0 zmieniło się 16.8 procent pojedynczych werdyktów dotyczących wywołań narzędzi. Jego łączna dokładność spadła jednak tylko o 2.87 punktu procentowego.
Llama 3.1 8B wykazał ten sam efekt maskowania. Werdykty zmieniły się w 9.9 procent zadań, podczas gdy zbiorcza dokładność spadła zaledwie o 0.87 punktu.
Te różnice ujawniają słabość raportowania wyników benchmarków na najwyższym poziomie. Jedno wywołanie może zmienić się z poprawnego w niepoprawne, podczas gdy inne się poprawia, przez co średnia wygląda stabilnie.
Dla agenta błędy nie są wymienne. Poprawnie wyglądające wywołanie funkcji z niewłaściwym odbiorcą, ścieżką, zapytaniem lub kwotą może zostać pomyślnie wykonane i spowodować szkodę.
Zagrożenia dla bezpieczeństwa SynthID wywierają presję na deweloperów agentów
Deweloperzy nie mogą już zakładać, że znak wodny po stronie dostawcy pozostawia przetestowane zachowanie agenta bez zmian.
Anthropic ogłosił 14 sierpnia 2026 roku, że przyszłe modele Claude będą generować tekst ze znakiem wodnym. Firma podała, że jej metoda wykorzystuje SynthID-Text i wesprze zgodność z unijnym AI Act.
Anthropic opisuje znacznik jako niewidoczny wzorzec statystyczny w doborze słów. Nic nie jest dołączane do tekstu, a system nie wstawia ukrytych znaków.
Firma twierdzi, że wewnętrzne testy nie wykazały praktycznego wpływu na treść, kreatywność, czytelność ani jakość wyników. Jej publiczne wyjaśnienie znakowania wodnego przywołuje również szeroko zakrojoną ocenę jakości Google.
To twierdzenie i nowe ustalenia nie są bezpośrednio sprzeczne. Mierzą różne właściwości.
Odpowiedź może pozostać płynna i otrzymać taką samą ocenę użytkownika, a mimo to zawierać inny argument narzędzia. Może też brzmieć równie dopracowanie, przechodząc jednocześnie od odmowy do realizacji żądania.
Pierwotni badacze SynthID-Text analizowali wykrywalność, opóźnienia i postrzeganą jakość odpowiedzi. W ich artykule w Nature opisano eksperyment na żywo obejmujący niemal 20 milionów odpowiedzi Gemini.
Standardowe benchmarki i porównania prowadzone przez ludzi nie wykazały mierzalnego spadku zdolności ani jakości. Znak wodny dodał również pomijalny narzut obliczeniowy w testowanym projekcie produkcyjnym.
Praca Lasso stawia inne pytanie. Czy ten sam system podejmuje taką samą decyzję dla tych samych danych wejściowych po zmianie próbkowania tokenów?
Pytanie to staje się pilne, gdy model działa za pośrednictwem agenta. Odpowiedź chatbota kończy się jako tekst, ale agent może przekształcić wygenerowane tokeny w wykonywalne działania.
Asystent może wybrać funkcję kalendarza, zapytanie do bazy danych, odbiorcę wiadomości e-mail, ścieżkę pliku lub kwotę płatności. Niewielkie zmiany w prozie mogą być nieszkodliwe. Niewielkie zmiany w ustrukturyzowanych argumentach już nie.
Presja jest też trudna do opanowania dla deweloperów aplikacji. Dostawca hostowanego modelu może aktywować znakowanie wodne lub zmienić tajny klucz poza cyklem wydawniczym twórcy aplikacji.
Zespół tworzący agenta mógł zweryfikować model przed taką zmianą. Jego monitoring może później wykazywać podobną ogólną dokładność, nawet jeśli inny zestaw indywidualnych żądań zaczyna zawodzić.
Eksperymenty Lasso wykazały, że efekty znakowania wodnego zależały od tajnego klucza. Badacze przetestowali klucz z głównego badania i dziesięć dodatkowych kluczy przy temperaturze 0.7.
Dla Llama 3.1 8B klucz badawczy zwiększył skuteczność ataków o 3.5 punktu procentowego. Pozostałe klucze dały średni wzrost o 4.4 punktu, w zakresie od spadku o 4.5 punktu do wzrostu o 14.5 punktu.
Oba testowane modele Gemma również wykazały przeważnie wyższą skuteczność ataków dla różnych kluczy. Granite 3.2 8B zmieniał się w obu kierunkach, podczas gdy Phi-4 i Qwen3 4B pozostawały blisko swoich wartości bazowych.
Ten zakres sprawia, że rotacja klucza jest zdarzeniem istotnym z punktu widzenia bezpieczeństwa. Dostawca może rotować klucze, aby chronić integralność wykrywania, ale zastępczy klucz może wygenerować inny profil zachowania.
Deweloperzy potrzebują więc testów specyficznych dla wdrożenia. Raport bezpieczeństwa sprzed wprowadzenia znaku wodnego nie może potwierdzić, że wersja ze znakiem zachowuje te same odmowy i wywołania narzędzi.
Odpowiedzialność nie może spoczywać wyłącznie na dostawcach modeli. Twórcy agentów wiedzą, które funkcje są dostępne, które dane są wrażliwe i jakie błędne argumenty powodują znaczące szkody.
Dostawcy kontrolują konfigurację znaku wodnego. Zespoły aplikacyjne kontrolują uprawnienia, kroki potwierdzające, granice wykonania oraz wiele kontroli w czasie działania.
Obie strony mierzą się teraz ze wspólnym obowiązkiem testowania. Dostawcy muszą ujawniać zmiany istotne dla zachowania, a deweloperzy muszą powtarzać oceny odporności na ataki względem faktycznie wdrożonego endpointu.
Jak znakowanie wodne SynthID zmienia decyzje modelu
Wyjaśnienie znakowania wodnego SynthID na poziomie tokenów pokazuje, dlaczego funkcja pochodzenia treści może wpływać zarówno na język, jak i działanie.
Duży model językowy generuje wynik, wielokrotnie wybierając następny token. Tokeny mogą reprezentować słowa, fragmenty słów, znaki interpunkcyjne, elementy kodu lub ustrukturyzowane wartości.
Model najpierw przypisuje prawdopodobieństwa możliwym następnym tokenom. Ustawienia próbkowania określają następnie, który kandydat staje się częścią odpowiedzi.
SynthID-Text interweniuje w tym procesie wyboru. Wykorzystuje tajne klucze i funkcję punktacji, aby tworzyć wykrywalny sygnał statystyczny w wielu wyborach.
Dokumentacja SynthID Google opisuje system jako procesor logitów stosowany po filtrowaniu Top-K i Top-P. Logity to wyniki modelu wykorzystywane do obliczania prawdopodobieństw tokenów.
W testowanej konfiguracji kandydaci przechodzą przez próbkowanie turniejowe. Pary tokenów konkurują przy użyciu ukrytych wyników wyprowadzonych z klucza, a zwycięzcy przechodzą dalej, aż system wybierze końcowy token.
Niezniekształcający projekt zachowuje pierwotny rozkład po uśrednieniu względem losowości znaku wodnego. Ta właściwość matematyczna nie wymaga jednak identycznego wyniku dla konkretnego stałego klucza.
To rozróżnienie leży u podstaw zagrożeń dla bezpieczeństwa SynthID. Rozkład może pozostawać poprawny w oczekiwaniu, podczas gdy wdrożony klucz zmienia konkretną odpowiedź.
Rozważmy zdanie, w którym „zachmurzone” i „pochmurne” mają niemal identyczne znaczenie. Wybór jednego z tych słów rzadko zmienia praktyczny rezultat.
Rozważmy teraz ustrukturyzowany wynik zawierający ścieżkę docelową lub odbiorcę. Kilka wartości może wydawać się modelowi prawdopodobnych, ale tylko jedna odpowiada intencji użytkownika.
Znak wodny nie musi wymuszać absurdalnego tokenu, aby powodować problemy. Wystarczy, że wybierze innego wiarygodnego kandydata w istotnym momencie.
Ten sam mechanizm może wpływać na odmowy. Trening bezpieczeństwa nie wstawia stałej wiadomości odmownej, która zawsze pojawia się bez zmian.
Odmowa jest kolejną generowaną sekwencją. Wczesne wybory tokenów mogą przesunąć tę sekwencję w stronę odrzucenia, częściowej pomocy lub bezpośredniego spełnienia żądania.
Prompt injection zwiększa stawkę, ponieważ umieszcza konkurencyjne instrukcje w kontekście modelu. Model musi rozstrzygnąć konflikt między zaufanymi wskazówkami a tekstem kontrolowanym przez atakującego.
Niewielka zmiana próbkowania może zmienić sposób rozwiązania tego konfliktu. Gdy model zacznie spełniać żądanie, kolejne tokeny mogą kontynuować nową trajektorię.
Wyjaśnia to, dlaczego zwykłe testowanie jakości może przeoczyć problem. Oceny czytelności koncentrują się na tym, czy odpowiedź brzmi spójnie i użytecznie.
Zazwyczaj nie pytają, czy agent wybrał identyczną funkcję lub zachował tę samą granicę bezpieczeństwa. Uśredniają też wyniki z wielu interakcji.
Zespół Lasso wykorzystał sparowane rozbieżności, aby uwidocznić te ukryte zmiany. Każdy prompt oceniano z watermarkingiem i bez niego, przy pozostałych warunkach zachowanych na tym samym poziomie.
Ta metoda rozróżnia dwa efekty. Dokładność netto mierzy końcową średnią, a zmienność — jak często zmieniają się poszczególne werdykty.
W przypadku wdrożonych agentów zmienność może być bardziej miarodajnym sygnałem. Stabilna średnia nie chroni konkretnego klienta, którego e-mail trafia do niewłaściwego odbiorcy.
SynthID vs bezpieczeństwo modeli nie jest więc prostym pojedynkiem między przejrzystością a ochroną. Pochodzenie treści i bezpieczeństwo mierzą odrębne właściwości, a jedno nie gwarantuje drugiego.
Wykrywalność pyta, czy sygnał statystyczny przetrwa w wygenerowanym tekście. Stabilność zachowania pyta, czy ten sam sygnał wejściowy prowadzi do akceptowalnie równoważnej decyzji.
Jakość tekstu dotyczy tego, czy ludzie zauważają pogorszenie. Bezpieczeństwo dotyczy tego, czy wrogie dane wejściowe mogą wywołać nieautoryzowane zachowanie.
Watermark może dobrze wypadać w pierwszej i trzeciej miarze, jednocześnie powodując niestabilność w drugiej i czwartej. Każda właściwość wymaga osobnej oceny.
Poprawka zgodności z przepisami tworzy kompromis w zakresie bezpieczeństwa
System mający zwiększać rozliczalność może wprowadzać nową niepewność do modeli, od których oczekuje się egzekwowania zasad bezpieczeństwa.
Europejscy regulatorzy chcą, aby syntetyczne treści pozostały możliwe do zidentyfikowania. Artykuł 50 AI Act wymaga, by określone wyniki AI były oznaczane w formacie odczytywalnym maszynowo i wykrywalnym.
Przepisy wymagają metod skutecznych, interoperacyjnych, niezawodnych i wystarczająco odpornych na usunięcie. Wytyczne dotyczące przejrzystości Komisji Europejskiej łączą te obowiązki z dezinformacją, podszywaniem się, oszustwami i wprowadzaniem konsumentów w błąd.
Te cele odpowiadają na rzeczywiste problemy. Generatory tekstu mogą tworzyć ogromne ilości przekonujących materiałów, podczas gdy skopiowane wyniki tracą większość widocznych informacji o swoim pochodzeniu.
SynthID oferuje technicznie atrakcyjną odpowiedź. Jego sygnał towarzyszy słowom, zamiast polegać wyłącznie na odłączalnych metadanych.
Regulatorzy i dostawcy omawiali jednak watermarking głównie jako warstwę identyfikacji. Nowe badania pokazują, że znakowanie na etapie generowania może również stać się częścią procesu decyzyjnego modelu.
Tworzy to kompromis między pochodzeniem treści a stabilnością zachowania. Nie oznacza to, że oba cele są niezgodne, lecz nie można zakładać, że którykolwiek z nich jest bezkosztowy.
Wdrożenie Anthropic czyni tę kwestię bardziej pilną. Firma twierdzi, że przyszłe obsługiwane modele Claude będą oznaczać wyniki na poziomie modelu, w tym tekst dostarczany przez API i platformy chmurowe.
Niezależny deweloper może nigdy nie wywołać funkcji watermarkingu. Tokeny generowane przez dostawcę mogą już odzwierciedlać proces znakowania.
Taka architektura poszerza obszar oddziaływania. Oznaczone wyniki mogą wykorzystywać asystenci wyszukiwania dla przedsiębiorstw, agenci programistyczni, systemy obsługi klienta i narzędzia badawcze.
Agent z dostępem tylko do odczytu stwarza jeden profil ryzyka. Agent upoważniony do wysyłania wiadomości, modyfikowania rekordów, uruchamiania kodu lub zatwierdzania transakcji stwarza inny.
Watermark współdziała również z warstwowymi mechanizmami obronnymi. System może łączyć odmowy modelu, filtrowanie promptów, uprawnienia narzędzi, walidację argumentów i potwierdzenie przez człowieka.
Dryf próbkowania nie pokonuje automatycznie każdej warstwy. Może jednak osłabić decyzję na poziomie modelu, która określa, czy późniejsze mechanizmy obronne otrzymają niebezpieczne żądanie.
Wynik badania przemawia za bardziej rygorystycznym procesem wdrażania. Zespoły powinny porównywać dopasowane przebiegi z watermarkiem i bez niego przed włączeniem oznaczania w środowisku produkcyjnym.
Powinny mierzyć zmiany od odmowy do wykonania polecenia w warunkach prompt injection. Powinny również śledzić przejścia od poprawnych do błędnych oraz od błędnych do poprawnych decyzji dla poszczególnych wywołań narzędzi.
Łączna dokładność pozostaje użyteczna, ale nie może być jedyną miarą. Testy powinny rozdzielać nieprawidłowo sformułowane wywołania, niewłaściwe narzędzia i nieprawidłowe argumenty, ponieważ awarie te niosą różne konsekwencje.
Narzędzia wysokiego ryzyka potrzebują deterministycznych mechanizmów kontroli poza modelem. Listy dozwolonych odbiorców, walidacja schematu, ograniczone poświadczenia, limity transakcji i wyraźna zgoda użytkownika mogą zmniejszyć ekspozycję.
Dzienniki muszą też zachowywać wystarczający kontekst do porównań. Zespoły potrzebują promptu, wersji modelu, ustawień próbkowania, schematu narzędzia, konfiguracji polityk i stanu watermarku.
Zmiany kluczy zasługują na taką samą ostrożność jak aktualizacje modeli. Nowy klucz powinien uruchamiać ukierunkowane testy regresji, ponieważ badanie wykazało kierunkowo różne efekty dla różnych kluczy.
Organizacja wdrażająca agenta powinna również utrzymywać przypadki ewaluacyjne oparte na rzeczywistych przepływach pracy. Ogólne benchmarki nie są w stanie odzwierciedlić każdego wrażliwego argumentu ani każdej reguły biznesowej.
W tym miejscu SynthID vs bezpieczeństwo modeli staje się pytaniem operacyjnym. Właściwym standardem nie jest to, czy watermark cokolwiek zmienia, ponieważ generowanie stochastyczne już jest zmienne.
Standardem jest to, czy oznaczony system pozostaje w zdefiniowanych tolerancjach bezpieczeństwa. Należy to mierzyć przy realistycznych atakach i uprawnieniach.
Czego badanie nie dowodzi
Dowody wskazują wiarygodny tryb awarii, ale nie dowodzą, że Claude, Gemini ani każde wdrożenie SynthID jest mniej bezpieczne.
Eksperymenty oceniały modele o otwartych wagach, ponieważ badacze potrzebowali bezpośredniej kontroli nad próbkowaniem tokenów. Nie testowali przyszłego modelu Claude z watermarkiem.
Wykorzystali również publiczną implementację SynthID-Text od Hugging Face. Anthropic może stosować inne ustawienia, dodatkowe zabezpieczenia, mechanizmy dekodowania lub testy wdrożeniowe.
Eksperyment dotyczący odmowy wykorzystywał jedną ustaloną technikę prompt injection. Atakujący mogą stosować wiele strategii, a inne prompty mogą dawać mniejsze, większe lub odwrotne efekty.
Badanie oddzieliło testowanie odmów od testowania wywołań narzędzi. Nie wykazało pełnego scenariusza, w którym agent przyjmuje wstrzyknięte szkodliwe żądanie i wykonuje powodujące szkody wywołanie narzędzia.
Ten połączony scenariusz pozostaje wnioskiem pośrednim. Jest prawdopodobny, ponieważ badanie osobno zaobserwowało zmienione odmowy i zmienione zachowanie narzędzi, lecz wymaga bezpośredniej walidacji.
Wyniki nie wskazują też uniwersalnego kierunku. Niektóre klucze zwiększały wykonywanie szkodliwych poleceń, podczas gdy inne je ograniczały. Kilka modeli prawie nie zmieniło się w testowanych warunkach.
Ta zmienność osłabia twierdzenie, że watermarking z natury czyni modele niebezpiecznymi. Wzmacnia natomiast argument, że bezpieczeństwa nie można wywnioskować z ogólnego projektu algorytmu.
Badanie opublikowała Lasso Security, firma sprzedająca produkty bezpieczeństwa AI i red-teamingu. Jej pozycja komercyjna nie unieważnia danych, lecz niezależna replikacja zwiększyłaby zaufanie.
Badacze powinni odtworzyć sparowane testy dla dodatkowych implementacji, rozmiarów modeli, technik prompt injection i architektur agentów. Badania prowadzone przez dostawców powinny publikować więcej niż średnie wyniki jakości.
Pierwotna ewaluacja SynthID pozostaje istotna. Prawie 20 milionów ocen odpowiedzi stanowi mocny dowód, że użytkownicy nie dostrzegli szerokiego pogorszenia jakości w tym wdrożeniu.
Jednak wskaźniki pozytywnych ocen odpowiadają na inne pytanie niż stabilność odmów wobec ataków. Oba ustalenia mogą być jednocześnie prawdziwe.
Ta sama ostrożność dotyczy opisywanych ustaleń. Najmocniejsze dowody dotyczą testowanych modeli i konfiguracji, a nie każdego produktu noszącego nazwę SynthID.
Anthropic twierdzi, że jego watermark nie zmienia znaczenia ani jakości wyników. Publicznie dostępne dowody obecnie uzasadniają ostrożność, a nie deklarację, że to stwierdzenie jest fałszywe.
Znaczenie jest trudne do zdefiniowania w przypadku działania agenta. Dwie odpowiedzi w języku naturalnym mogą wydawać się równoważne, a jednocześnie prowadzić do różnych ustrukturyzowanych argumentów w dalszym procesie.
Dostawca może również osiągać stabilne zachowanie produkcyjne dzięki wyborom konfiguracji, których publiczna implementacja nie odtwarza. Tę możliwość należy testować, a nie zakładać.
Istnieje też inna niepewność związana z normalną zmiennością modeli. Wyniki LLM już zmieniają się wraz z losowymi ziarnami, temperaturą, infrastrukturą i rewizjami modeli.
Badanie częściowo uwzględniło tę kwestię, porównując dopasowane pary i analizując zmienność wywołaną temperaturą. Przy temperaturze 0.7 zmienność odmów wywołana watermarkiem przewyższała zmienność wywołaną temperaturą w czterech z sześciu modeli.
Gemma 3 27B wykazał 26 procent zmienności wywołanej watermarkiem przy wstrzyknięciu, wobec 13.5 procent wynikających ze zmiany temperatury. Llama 3.1 8B wykazał 17.5 procent wobec 7.5 procent.
Granite 3.2 8B osiągnął 21.5 procent zmienności wywołanej watermarkiem i 15.5 procent zmienności wywołanej temperaturą. Gemma 3 12B wykazał odpowiednio 11 procent i 6 procent.
Porównania te sugerują, że watermark nie dodawał jedynie zwykłej losowości. Nadal jednak dotyczą wybranych ustawień, modeli i zadań.
Odpowiedzialny wniosek jest konkretny. Przedstawianie watermarkingu SynthID jako metody ustalania pochodzenia treści bez wpływu na jakość jest niepełne, jeśli bezpieczeństwo zachowania nie jest mierzone osobno.
Trzy sygnały pokażą, czy dostawcy ograniczą ryzyko
Kolejne dowody powinny pochodzić z testów specyficznych dla wdrożeń, niezależnej replikacji oraz widocznych zmian w praktykach bezpieczeństwa agentów.
Pierwszym sygnałem będzie ewaluacja przez Anthropic modeli Claude z watermarkiem. Firma powinna przedstawić sparowane wyniki odmów i wywołań narzędzi przed wdrożeniem lub równolegle z nim.
Przydatne ujawnienie danych rozdzielałoby zwykłe prompty od prompt injection. Pokazywałoby też wskaźniki rozbieżności dla poszczególnych przypadków, a nie tylko średnią dokładność lub preferencje użytkowników.
Jeśli Claude pozostanie stabilny dla różnych kluczy i zadań adversarialnych, wynik ten zawęzi ryzyko bezpieczeństwa SynthID do konkretnych modeli lub konfiguracji. Brak danych pozostawi główną niepewność nierozstrzygniętą.
Drugim sygnałem będzie niezależna replikacja w różnych implementacjach watermarkingu. Badacze muszą testować kod referencyjny, integrację Hugging Face i konfiguracje zbliżone do produkcyjnych.
Replikacja powinna obejmować kilka tajnych kluczy i wiele technik wstrzykiwania poleceń. Powinna też łączyć odmowy z rzeczywistymi działaniami agentów w kontrolowanych środowiskach.
Spójne przesunięcia między modelami wzmocniłyby twierdzenie, że watermarking na etapie generowania tworzy ogólny koszt bezpieczeństwa. Mieszane wyniki wskazywałyby na łagodzenie zależne od konfiguracji.
Trzecim sygnałem będzie to, czy twórcy agentów traktują zmiany watermarków jako wydania związane z bezpieczeństwem. Komunikat dostawcy powinien uruchamiać testy regresji, przeglądy uprawnień i ponowne ćwiczenia red-teamowe.
Zespoły powinny obserwować zmienione argumenty narzędzi, a nie tylko błędną składnię. Powinny porównywać te same przypadki wysokiego ryzyka przed i po aktualizacjach modelu, konfiguracji lub klucza.
Dojrzała odpowiedź przeniosłaby również krytyczne mechanizmy kontroli poza generowanie probabilistyczne. Agenci obsługujący wrażliwe działania powinni wymagać zwalidowanych argumentów i wyraźnego potwierdzenia w chwili wykonania.
Dla pracowników wiedzy natychmiastowa lekcja jest prostsza. Watermark mówi coś o prawdopodobnym pochodzeniu, a nie o prawdzie, bezpieczeństwie ani niezmienionym zachowaniu.
Deweloperzy powinni pytać dostawców, czy watermarking jest aktywny, gdzie jest stosowany i czy klucze mogą się zmieniać bez powiadomienia o wersji. Nabywcy korporacyjni powinni żądać wyników ewaluacji adversarialnych.
Zespoły bezpieczeństwa powinny dodawać stan watermarku do inwentarza modeli i rejestrów incydentów. Liderzy produktów powinni zdecydować, które działania agentów pozostają akceptowalne, gdy pojedyncze decyzje mogą ulegać dryfowi.
Otwarte pytanie nie dotyczy już tego, czy niewidoczne znaki tekstowe wpływają na czytelność. Dotyczy tego, czy pochodzenie treści można dodać bez zmieniania decyzji, które mają największe znaczenie.
SynthID a bezpieczeństwo modeli nie powinny stać się wyborem między przejrzystością a bezpiecznymi agentami. Powinny stać się wymogiem weryfikacji obu tych właściwości w dokładnie wdrożonej konfiguracji.
Dopóki dostawcy nie opublikują takich dowodów, zespoły powinny zakładać, że włączenie znaku wodnego podczas generowania zmienia system. Powinny testować je z taką samą starannością jak aktualizację modelu.



