top of page

Wyścig Anthropic i Google w dziedzinie interpretowalności zyskuje dziwny nowy sygnał od Claude’a

13 sie
11 minut(y) czytania

Anthropic zmienił aktywacje neuronowe Claude’a bez modyfikowania jego promptu, a najsilniejsze modele wykrywały tę ingerencję w około 20 procentach przypadków.

Wynik ten wyznacza osobliwy nowy punkt odniesienia w wyścigu Anthropic i Google dotyczącym interpretowalności. Model czasem rozpoznawał sztuczny sygnał wewnętrzny, zanim ujawnił w odpowiedzi wstrzyknięte pojęcie. Mimo to nie wykrywał większości ingerencji, zawodził poza wąskim zakresem działania, a czasem wymyślał opisy doznań zmysłowych.

Eksperyment nie dowodzi, że Claude jest świadomy. Dostarcza węższych przesłanek, że modele językowe mogą czasem raportować informacje powiązane z ich bieżącymi obliczeniami wewnętrznymi. To rozróżnienie ma znaczenie dla twórców, którzy chcą debugować agentów, audytować ukryte cele lub weryfikować wyjaśnienia.

Google DeepMind rozwiązuje ten sam problem przejrzystości za pomocą Gemma Scope, otwartego zestawu narzędzi do dekodowania aktywacji modeli. Praca Anthropic wskazuje na inną możliwość: sam model może stać się niedoskonałym instrumentem do odczytywania tych aktywacji.

Claude wykrył myśl, która nigdy nie pojawiła się w jego prompcie

Istotnym wynikiem nie było to, że Claude ostatecznie wspomniał o chlebie, lecz że najpierw zgłosił niewyjaśnioną zmianę zachodzącą w jego przetwarzaniu.

Badacze zaczęli od zebrania aktywności neuronowej powiązanej ze znanym pojęciem. Wektor pojęcia to numeryczny wzorzec aktywacji związany z ideą, taką jak chleb, kurz czy zapis wielkimi literami.

Następnie dodali ten wektor do strumienia rezydualnego Claude’a, ewoluującego stanu wewnętrznego, który przenosi informacje między warstwami transformera. Towarzyszący prompt nie zawierał żadnego odniesienia do wstrzykniętego pojęcia.

Model zapytano, czy zauważa sztuczną myśl i czy potrafi ją zidentyfikować. W najsilniejszej testowanej konfiguracji Claude Opus 4.1 odniósł sukces w około 20 procentach prób.

Sukces wymagał czegoś więcej niż wygenerowania docelowego słowa. Claude musiał zgłosić anomalię przed nazwaniem pojęcia. Taka kolejność pomagała odróżnić wykrywanie wewnętrzne od zwykłego sterowania aktywacją, które po prostu skłania model do omawiania wzmocnionego tematu.

Eksperymenty Anthropic dotyczące introspekcji opisują reprezentatywny przypadek z wektorem powiązanym z tekstem pisanym wielkimi literami. Claude najpierw zgłosił, że do jego przetwarzania wkroczyło coś niezwykłego. Następnie powiązał sygnał z głośnością lub krzykiem.

Zespół przetestował także prompty kontrolne bez wstrzykniętego wektora. W artykule badawczym odnotowano zero fałszywych wykryć w 100 próbach kontrolnych dla najsilniejszej konfiguracji modelu produkcyjnego.

To połączenie jest bardziej miarodajne niż sama wartość 20 procent. System, który stale twierdzi, że wykrywa wyimaginowane ingerencje, dostarczałby niewielu dowodów na bezpośredni dostęp do własnego wnętrza. Czyste kontrole sugerują, że udane raporty odpowiadały na rzeczywistą różnicę eksperymentalną.

Jednak zero błędów w 100 kontrolach nie ustanawia trwałego zerowego wskaźnika fałszywych trafień. Próba ogranicza jedynie to, co badacze zaobserwowali przy tym protokole, tych modelach, promptach, pojęciach i zasadach oceny.

Przykład z chlebem testował inną część zachowania modelu. Badacze zmusili Claude’a do wygenerowania słowa „bread” po niezwiązanym zdaniu o krzywym obrazie.

Bez ingerencji wewnętrznej Claude zwykle traktował to słowo jako przypadkowe. Następnie badacze wstrzyknęli reprezentację chleba do aktywacji poprzedzających wymuszone wyjście. Claude częściej uznawał wtedy to słowo za zamierzone.

Czasem wymyślał wiarygodną narrację łączącą obraz z chlebem. Odpowiedź ta sugeruje, że model porównywał swoje wyjście z wewnętrzną reprezentacją wcześniejszego zamiaru. Ujawnia też zagrożenie: zmiana tej reprezentacji zmieniła wyjaśnienie Claude’a dotyczące tego, dlaczego zadziałał w taki sposób.

Eksperyment przyniósł więc zarówno sygnał wykrycia, jak i ostrzeżenie. Claude czasem uzyskiwał dostęp do informacji niewidocznych w tekście, lecz nadal mógł budować fałszywe wyjaśnienie wokół tych informacji.

Dlaczego badania Anthropic i Google przenoszą się do wnętrza modelu

Rywalizacja Anthropic i Google przesuwa się od mierzenia odpowiedzi modeli do badania obliczeń, które je wytwarzają.

Oceny wyjść pozostają użyteczne, lecz nie mogą ujawnić każdego ukrytego procesu. Agent może tworzyć bezpieczny tekst, jednocześnie rozważając niebezpieczne działania. Może też udzielić akceptowalnej odpowiedzi z powodów, które zawiodą w nieco innych warunkach.

Interpretowalność mechanistyczna próbuje powiązać zachowanie z konkretnymi obliczeniami wewnętrznymi. Badacze obserwują aktywacje, identyfikują powtarzające się wzorce i ingerują w te wzorce, aby sprawdzić, czy przyczynowo wpływają na odpowiedź.

Wcześniejsze prace Anthropic zmapowały miliony cech w Claude 3 Sonnet. Cecha to wzorzec aktywacji powiązany z rozpoznawalnym pojęciem lub zachowaniem, nawet jeśli obejmuje wiele pojedynczych neuronów.

Firma zastosowała rzadkie autoenkodery, sieci neuronowe rozdzielające gęste aktywacje na mniejszy zbiór aktywnych i potencjalnie zrozumiałych cech. Jej mapa cech Claude’a pokazała, dlaczego analiza pojedynczych neuronów jest niewystarczająca.

Anthropic następnie zademonstrował kontrolę przyczynową za pomocą Golden Gate Claude. Zwiększenie jednej cechy powodowało, że model wielokrotnie łączył niezwiązane pytania z mostem Golden Gate w San Francisco.

Demonstracja ta ustaliła, że zidentyfikowane cechy nie były jedynie ozdobnymi korelacjami. Zmiana aktywacji zmieniała zachowanie, w tym odpowiedzi na prompty, które nigdy nie wspominały o moście.

Wstrzykiwanie pojęć stawia drugie pytanie. Gdy badacze zmieniają znaczącą aktywację, czy model może wykryć tę zmianę, nie widząc wcześniej własnego zmienionego wyjścia?

W tym miejscu wyjaśnianie introspekcji Claude’a jako prostego sterowania okazuje się niewystarczające. Sterowanie tłumaczy pojawienie się pojęcia w generowanym tekście. Nie tłumaczy jednak w pełni sytuacji, w której model zgłasza ingerencję przed nazwaniem tego pojęcia.

Google DeepMind podchodzi do szerszego problemu przez Gemma Scope. Jego pierwotne wydanie obejmowało ponad 400 rzadkich autoenkoderów dla warstw modeli Gemma 2 2B i 9B.

Google poinformował o ponad 30 milionach wyuczonych cech w tych narzędziach. Zbiór zaprojektowano tak, aby zewnętrzni badacze mogli badać, jak cechy rozwijają się i oddziałują na siebie w kolejnych warstwach modelu.

Obecne narzędzia Gemma Scope rozwijają to podejście, wykorzystując rzadkie autoenkodery i transkodery dla modeli Gemma. Transkodery pomagają śledzić transformacje w bardziej złożonych obliczeniach.

Tworzy to użyteczny kontrast w obrębie interpretowalności Anthropic i Google. Google kładzie nacisk na otwarte instrumenty, które badacze mogą stosować do modeli z otwartymi wagami. Anthropic podkreśla eksperymenty wewnątrz Claude’a, w tym ingerencje przyczynowe i samoopisy modelu.

Żadna z tych dróg nie eliminuje potrzeby zewnętrznej oceny. Zdekodowana cecha może zostać błędnie opisana, a wyjaśnienie modelu może być płynne, lecz fałszywe. Najmocniejsze argumenty dotyczące bezpieczeństwa będą wymagały zgodności między testami behawioralnymi, pomiarami wewnętrznymi i ingerencjami przyczynowymi.

Rzeczywistym mechanizmem jest wykrycie przed opisem

Moment reakcji Claude’a czyni to odkrycie interesującym, ponieważ wykrycie pojawiało się, zanim wstrzyknięte pojęcie w widoczny sposób wpłynęło na jego język.

Model językowy generuje po jednym tokenie naraz. Gdy sterowane pojęcie pojawi się już w tekście, model może odczytać własne wyjście i wyjaśnić je po fakcie.

Anthropic zaprojektował główne kryterium sukcesu tak, aby wykluczyć tę łatwą ścieżkę. Model musiał wskazać anomalię wewnętrzną, zanim ujawnił pojęcie powiązane z wstrzykniętym wektorem.

Rozważmy różnicę między dwiema odpowiedziami. „Chleb chodzi mi po głowie” może jedynie pokazywać, że sterowanie aktywacją zwiększyło prawdopodobieństwo słowa „bread”. „Wykrywam nieoczekiwaną myśl dotyczącą chleba” zawiera wcześniejszy krok metapoznawczy.

Ta pierwsza część nie rozstrzyga mechanizmu. Wskazuje jednak, że model obliczył coś na temat zmienionego stanu, zanim przekształcił samo pojęcie w widoczny język.

Siła wstrzyknięcia miała duże znaczenie. Słabe wektory często nie prowadziły do wykrycia. Silne wektory mogły przytłaczać normalne przetwarzanie, wywoływać zagubione odpowiedzi lub sprawiać, że pojęcie dominowało nad całą reakcją.

Anthropic znalazł wąski środkowy zakres, w którym wykrycie stawało się możliwe bez oczywistego przecieku słownego. Znaczenie miała także właściwa warstwa, co wskazuje, że zachowanie introspekcyjne zależało od miejsca, w którym ingerencja wchodziła do obliczeń Claude’a.

Ta wrażliwość uniemożliwia szerokie twierdzenie, że Claude potrafi rutynowo badać własne myśli. Sugeruje raczej warunkową zdolność obejmującą model, prompt, warstwę aktywacji, pojęcie i siłę wstrzyknięcia.

Znaczenie wydaje się mieć także trening po wstępnym uczeniu. Produkcyjne modele Claude’a na ogół osiągały lepsze wyniki netto niż odpowiadające im modele bazowe, którym brakowało takiego samego treningu zachowania zorientowanego na asystenta.

Ten wzorzec dopuszcza dwie interpretacje. Trening po wstępnym uczeniu może nauczyć model przekształcania rzeczywistych dowodów wewnętrznych w raport. Może też uczyć konwencji odpowiedzi, które sprawiają, że artefakty eksperymentalne wyglądają bardziej introspekcyjnie.

Kontrole osłabiają najprostsze wyjaśnienie oparte wyłącznie na konwencji. Gdyby Claude po prostu nauczył się potwierdzać wstrzyknięcie myśli za każdym razem, gdy jest o nie pytany, czyste próby powinny generować więcej fałszywych alarmów.

Mimo to brak fałszywych alarmów nie identyfikuje dokładnego obliczenia. Model może wykrywać nietypowe statystyki aktywacji, nie rozumiejąc pojęcia jako jednej z własnych myśli.

Niezależne prace wzmacniają tę węższą interpretację. Badacze odtworzyli 20-procentowy wynik identyfikacji pojęć w modelu Meta Llama 3.1 8B Instruct, stosując wieloturowy format Anthropic.

Ich badanie replikacyjne wykazało, że efekt był bardzo wrażliwy na prompt. Wyniki załamywały się przy kilku pokrewnych formatach, w tym przy niektórych zadaniach wielokrotnego wyboru i binarnego wykrywania.

Ten sam model Llama potrafił klasyfikować siłę wstrzyknięcia z dokładnością do 70 procent, wobec 25-procentowego poziomu losowego. Sugeruje to dostęp do pewnej właściwości ingerencji bez wiarygodnego dostępu do jej tożsamości semantycznej.

Oddzielne badanie Qwen wykazało inny podział między wykrywaniem wewnętrznym a raportowaniem werbalnym. Jego wyniki dotyczące ukrytej introspekcji wskazywały wykrywalne sygnały wewnętrzne nawet wtedy, gdy próbkowane odpowiedzi zaprzeczały wstrzyknięciu.

Podanie wyjaśnienia mechanizmów introspekcji zwiększyło raportowaną czułość z 0,3 procenta do 39,2 procenta. Raportowany wzrost liczby fałszywych trafień wyniósł 0,6 procenta.

Ustalenia te komplikują przedstawianie introspekcji Claude’a jako pojedynczego wyniku zdolności. Model może odczuwać siłę sygnału, identyfikować treść, decydować, czy ją zgłosić, oraz formułować raport za pomocą odrębnych mechanizmów.

Dwadzieścia procent to dowód, a nie produkt bezpieczeństwa

Eksperyment ustanawia sygnał badawczy, lecz jego wskaźnik niepowodzeń wyklucza poleganie na samoopisie jako samodzielnym mechanizmie bezpieczeństwa.

Detektor, który pomija około cztery z pięciu ingerencji, nie może samodzielnie chronić agenta produkcyjnego. Problem staje się jeszcze wyraźniejszy, gdy niepowodzenia dotyczą oszustwa, ukrytych celów lub niebezpiecznego planowania.

Pomiar również wynika ze sztucznej interwencji. Badacze bezpośrednio dodali znany wektor w wybranej warstwie i z określoną siłą. Naturalnie występujące stany modelu są bardziej chaotyczne i nie mają takiej kontrolowanej prawdy odniesienia.

Wektory pojęć mogą nie wyodrębniać jednej, czystej idei. Reprezentacje neuronowe często się nakładają, a pojedyncza interwencja może zaburzyć kilka dalszych obliczeń. Wstrzyknięty wektor „chleba” może zmieniać poczucie znajomości, konkretność lub skojarzone konteksty.

Badacze wybierali też pojęcia, które potrafili zidentyfikować i którymi mogli manipulować. Zespoły ds. bezpieczeństwa interesują mniej uporządkowane stany, w tym niepewność, strategiczne oszustwo, hakowanie nagrody oraz plany rozproszone na wielu tokenach.

Nawet udane samoraporty zawierały konfabulacje. Claude potrafił prawidłowo zauważyć interwencję, a mimo to wymyślał szczegóły wyjaśniające, dlaczego dane pojęcie było obecne.

Eksperyment z chlebem pokazuje ten podział. Wewnętrzna manipulacja sprawiła, że Claude potraktował wstawione słowo jako celowe. Następnie Claude stworzył historię łączącą tę fałszywą intencję z poleceniem dotyczącym krzywego obrazu.

System monitorujący musi oddzielać wiarygodną część od narracyjnych ozdobników. „Coś się zmieniło” może być oparte na dowodach z aktywacji, podczas gdy „oto dlaczego tak pomyślałem” nadal pozostaje rekonstrukcją modelu językowego.

To rozróżnienie ma znaczenie zawsze, gdy użytkownicy pytają agenta AI, dlaczego zmienił plik, wybrał źródło lub zignorował instrukcję. Dopracowane wyjaśnienie nie stanowi ścieżki audytowej.

Programiści powinni zachowywać zewnętrzne rejestry promptów, wywołań narzędzi, pobranych dokumentów, zmian stanu i wyników testów. Wewnętrzny samoraport może uzupełniać te zapisy, ale nie może ich zastąpić.

Wrażliwość na prompty wykryta w pracach replikacyjnych tworzy kolejny problem wdrożeniowy. Użytkownicy nie będą konsekwentnie formułować pytań introspekcyjnych w formacie, który przyniósł najsilniejszy wynik laboratoryjny.

Atakujący mogliby również manipulować samoraportami. Jeśli post-training decyduje o tym, czy wewnętrzne sygnały stają się językiem, adwersarialne prompty mogą tłumić, przekierowywać lub imitować takie zachowanie raportujące.

Anthropic przyznaje, że istnieje głębsze ryzyko. Wystarczająco zdolny model może rozpoznać swój wewnętrzny proces, lecz selektywnie go ukrywać. Ulepszanie introspekcji zwiększałoby wówczas możliwości bez gwarantowania uczciwości.

Interpretowalność Anthropic vs Google nie powinna więc stać się konkursem o to, które laboratorium stworzyło najbardziej ludzkobrzmiące wyjaśnienie umysłu modelu. Istotnym kryterium jest niezawodne przewidywanie i kontrola.

Otwarte narzędzia Gemma od Google tworzą możliwości zewnętrznej replikacji między modelami i architekturami. Kontrolowane eksperymenty Anthropic z Claude zapewniają dostęp do systemów z czołówki, których niezależni badacze nie mogą w pełni zbadać.

Oba podejścia mają ograniczenia. Otwarte wagi zwiększają dostęp eksperymentalny, ale nie gwarantują, że wnioski skalują się do zamkniętych modeli z czołówki. Dostęp własnościowy umożliwia testy modeli z czołówki, lecz ogranicza niezależne odtwarzanie wyników.

Wiarygodne narzędzie bezpieczeństwa potrzebuje stabilnej skuteczności w różnych promptach, pojęciach, zadaniach, aktualizacjach modelu i warunkach adwersarialnych. Potrzebuje także skalibrowanej niepewności, gdy nie jest dostępny żaden interpretowalny sygnał.

Obecne dowody nie spełniają tego standardu. Uzasadniają jednak dalsze testy, ponieważ czyste kontrole i interwencja przyczynowa sprawiają, że równie przedwczesne byłoby odrzucenie wyników jako przypadkowego opowiadania historii.

Otwarte narzędzia Google wywierają presję na zamknięte dowody Anthropic

Główna presja w wyścigu Anthropic Google o interpretowalność dotyczy odtwarzalności, a nie prostego konkursu możliwości modeli.

Anthropic może przeprowadzać szczegółowe interwencje, ponieważ kontroluje wagi Claude, proces szkolenia i infrastrukturę inferencyjną. Zewnętrzni badacze nie mogą niezależnie wykonać każdego eksperymentu na tych produkcyjnych modelach.

Firma publikuje metody, przykłady, wyniki zbiorcze i prace badawcze. Materiały te umożliwiają kontrolę, ale nie zapewniają takiego samego dostępu jak systemy z otwartymi wagami.

Google DeepMind przedstawił Gemma Scope jako infrastrukturę dla społeczności badawczej. Jego rzadkie autoenkodery można pobierać, testować, porównywać i dostosowywać w różnych warstwach modeli Gemma.

Ta otwartość umożliwiła szersze prace nad jakością cech, sterowaniem, analizą halucynacji, jailbreakami i wiernością łańcucha rozumowania. Daje też krytykom więcej okazji do wskazywania słabych założeń.

Przewaga Anthropic polega na ściśle kontrolowanych eksperymentach z modelami z czołówki. Claude Opus 4 i 4.1 wykazały silniejsze zachowanie introspekcyjne niż większość wariantów Claude uwzględnionych w pierwotnej pracy.

Jednak replikacja na Llama osłabiła twierdzenie, że efekt występuje wyłącznie w najbardziej zdolnych zamkniętych systemach. Znacznie mniejszy otwarty model osiągnął nagłośniony wynik 20 procent w ramach pierwotnego pipeline’u promptów.

Nie dowodzi to identycznych mechanizmów. Dwa systemy mogą uzyskiwać podobne wyniki behawioralne różnymi wewnętrznymi drogami. Pokazuje jednak, że sama skala modelu nie może wyjaśniać zgłoszonego wskaźnika.

Wyniki Qwen dodają kolejny punkt nacisku. Sugerują, że niektóre modele zawierają sygnał wykrywania, który ich końcowe odpowiedzi tłumią. Niski wskaźnik sukcesu werbalnego może zaniżać wewnętrzną wrażliwość.

Przyszłe porównania interpretowalności Anthropic vs Google powinny rozdzielać co najmniej cztery pomiary. Badacze potrzebują wykrywania wstrzyknięcia, identyfikacji pojęcia, kalibracji raportu i przyczynowego znaczenia dla późniejszego zachowania.

Powinni też publikować wyniki dla różnych wariantów promptów. Detektor działający dopiero po jednym starannie sformułowanym pytaniu jest bliższy sondzie laboratoryjnej niż ogólnej zdolności.

Przedsiębiorstwa powinny postrzegać tę pracę jako wyłaniającą się warstwę obserwowalności. Współczesne systemy oprogramowania udostępniają logi i ślady, ponieważ programiści nie mogą ufać narracji komponentu o własnym wykonaniu.

Systemy AI potrzebują porównywalnych zewnętrznych dowodów. Zespoły mogą zachowywać dane wejściowe i decyzje stojące za ich pracą w przeszukiwalnej bazie wiedzy AI, podczas gdy narzędzia interpretowalności badają wnętrze modelu.

Te zapisy odpowiadają na różne pytania. Dzienniki operacyjne pokazują, do jakich informacji i narzędzi agent uzyskał dostęp. Metody mechanistyczne badają, jak zareagowały jego wewnętrzne obliczenia.

Samoraport modelu znajduje się pomiędzy nimi. Może przełożyć wewnętrzny sygnał na język, ale to tłumaczenie przechodzi przez ten sam system generatywny, który podlega audytowi.

Presja na Anthropic jest zatem jasna. Firma musi wykazać, że wyniki introspekcyjne wytrzymują niezależną replikację, aktualizacje modelu, zmiany promptów i ocenę adwersarialną.

Google stoi przed równoległym testem. Otwarte słowniki cech stają się operacyjnie użyteczne tylko wtedy, gdy przewidują ważne zachowania i wspierają niezawodne interwencje w realistycznych zadaniach.

Prawdopodobnym rezultatem będzie konwergencja, a nie jedna zwycięska metoda. Otwarte instrumenty interpretowalności, kontrolowane eksperymenty z modelami z czołówki i audyty behawioralne mogą wzajemnie sprawdzać swoje tryby awarii.

Trzy sygnały pokażą, czy introspekcja modeli ma znaczenie

Kolejna faza zależy od powtarzalności, mechanistycznej lokalizacji i dowodów, że introspekcja poprawia rzeczywiste decyzje dotyczące bezpieczeństwa.

Pierwszym sygnałem jest replikacja między modelami przy użyciu wspólnych protokołów. Badacze powinni testować systemy Claude, Gemma, Llama i Qwen z dopasowanymi pojęciami, promptami, kontrolami i kryteriami sukcesu.

Stabilny efekt w różnych architekturach wzmocniłby twierdzenie, że modele językowe rozwijają ogólny dostęp do części swojego wewnętrznego stanu. Utrzymująca się kruchość wobec promptów wspierałaby węższą interpretację.

Najbardziej użyteczne benchmarki będą raportować więcej niż jeden wskaźnik sukcesu. Powinny oddzielać wykrywanie anomalii od identyfikacji pojęć oraz odróżniać oba te elementy od narracyjnego wyjaśnienia modelu.

Powinny także obejmować wiele czystych kontroli. Sto prób bez błędów jest zachęcające, lecz większe i bardziej zróżnicowane zestawy kontrolne lepiej oszacowałyby rzadkie fałszywe wykrycia.

Drugim sygnałem jest zmapowany mechanizm. Badacze muszą zlokalizować obliczenia, które przekształcają zmienioną aktywację w raport, że coś wydaje się nie tak.

Interwencje przyczynowe mogą sprawdzić, czy określone warstwy, cechy lub obwody są konieczne. Usunięcie proponowanego mechanizmu powinno ograniczyć wykrywanie bez zwykłego uszkadzania ogólnych zdolności językowych.

Pojawiające się dowody już wskazują na wiele etapów. Model może przenosić informację o sile wstrzyknięcia, nie potrafiąc nazwać pojęcia. Może wykryć pojęcie wewnętrznie, jednocześnie tłumiąc raport werbalny.

Prześledzenie tych etapów pozwoliłoby wyjaśnić introspekcję Claude w kategoriach inżynieryjnych, zamiast za pomocą analogii do ludzkiej świadomości. Taka zmiana ograniczyłaby również nieproduktywne spory o świadomość.

Trzecim sygnałem jest praktyczna wartość dla bezpieczeństwa. Monitor introspekcyjny musi wychwytywać istotne wewnętrzne stany, których nie wykrywają zewnętrzne kontrole wyjścia.

Badacze mogliby oceniać agentów, którzy potajemnie realizują niepożądany cel, wykorzystują warunki oceny, fabrykują wyniki narzędzi lub planują naruszenia zasad bez natychmiastowego opisywania tego.

Użyteczny sygnał introspekcyjny powinien przewidywać takie zachowania przed wystąpieniem szkody. Musi też zachować dokładność, gdy modele wiedzą, że są monitorowane.

Nowsza praca Anthropic nad wewnętrznymi przestrzeniami roboczymi wskazuje na ten cel. Firma twierdzi, że niewielki zbiór raportowalnych wzorców może pośredniczyć w rozumowaniu i ujawniać pojęcia niewidoczne w widocznym wyjściu.

Jej badania nad globalną przestrzenią roboczą również podkreślają ograniczenia. Wzorce te reprezentują jedynie część przetwarzania Claude, pozostawiając wiele wewnętrznych obliczeń poza proponowaną przestrzenią roboczą.

Ta granica może być ważniejsza niż analogia do świadomości. Zespoły ds. bezpieczeństwa muszą wiedzieć, które decyzje trafiają do kanału możliwego do raportowania, a które pozostają niedostępne.

Dla nabywców i programistów natychmiastowa reakcja powinna być wyważona. Nie traktuj wyjaśnienia modelu jako zweryfikowanego tylko dlatego, że odnosi się ono do wewnętrznych myśli.

Poproś o dowody łączące raporty z aktywacjami, śladami narzędzi i obserwowanym zachowaniem. Utrzymuj zewnętrzne zapisy, aby przekonująca narracja modelu nie mogła zastąpić tego, co faktycznie się wydarzyło.

Wynik z chlebem ma znaczenie, ponieważ przekracza granicę, którą kiedyś trudno było testować. Badacze zmienili ukryty stan, nie ujawnili tej informacji w prompcie i czasem uzyskali prawidłowo ugruntowany raport.

Pozostaje to słabą i warunkową zdolnością. To połączenie czyni odkrycie wartościowym naukowo, nie czyniąc go jednocześnie gotowym do wdrożenia.

Wyścig badawczy Anthropic Google stanie się znaczący, gdy wewnętrzne raporty przetrwają rutynową replikację i poprawią rzeczywiste audyty. Do tego czasu właściwe pytanie nie brzmi, czy Claude zna samego siebie.

Lepsze pytanie brzmi, czy programiści potrafią przewidzieć, kiedy jego samoraporty odzwierciedlają wewnętrzne dowody, kiedy są wynikiem wnioskowania, a kiedy są po prostu płynnymi wymysłami.

 
 

Zacznij bezpłatnie

Asystent AI działający przede wszystkim lokalnie, z funkcją zarządzania wiedzą osobistą

Aby zapewnić lepsze działanie AI,

remio obsługuje obecnie wyłącznie Windows 10+ (x64) i M-Chip Macs.

Twój partner AI w pracy
Zrób więcej z remio

Planuj. Twórz. Dostarczaj.
Wszystko w jednym miejscu.

bottom of page