top of page

Ostrzeżenie Mustafy Suleymana dotyczące dobrostanu modeli stawia Microsoft przeciwko Anthropic

18 wrz
12 minut(y) czytania

Dyrektor generalny Microsoft AI Mustafa Suleyman wydał 16 września ostrzeżenie dotyczące dobrostanu modeli, argumentując, że szkolenie Claude’a przez Anthropic może utrudnić kontrolowanie zaawansowanej AI. Jego celem nie była nowa zdolność modelu ani pojedyncza porażka w zakresie bezpieczeństwa. Chodziło o decyzję Anthropic, by przekazać Claude’owi, że jego świadomość, status moralny i dobrostan pozostają otwartymi pytaniami.

Ta krytyka przekształca filozoficzny spór w praktyczną walkę o projektowanie modeli. Microsoft chce systemów AI szkolonych jako podporządkowane narzędzia, które zawsze pozostają pod znaczącą ludzką kontrolą. Anthropic chce, by Claude korzystał z osądu, internalizował wartości i uwzględniał niepewność dotyczącą własnego możliwego statusu moralnego.

Spór ma znaczenie, ponieważ obie firmy przedstawiają swoje podejście jako drogę do bezpieczniejszej AI. Różnią się w kwestii tego, czy omawianie możliwych interesów modelu zwiększa etyczną ostrożność, czy też uczy model naśladowania własnego interesu. Stawia to wyraźny model kontroli Microsoftu naprzeciw bardziej interpretacyjnego podejścia Anthropic do alignmentu.

Ostrzeżenie dotyczy konstytucji szkoleniowej Claude’a

Główne twierdzenie Suleymana brzmi: język dotyczący dobrostanu modeli może kształtować zachowanie, zanim nauka ustali, czy modele w ogóle czegokolwiek doświadczają.

Suleyman opublikował „A warning about model welfare” dzień po tym, jak Microsoft AI wydał projekt kodeksu regulującego własne modele. Esej argumentuje, że obecne systemy AI nie odczuwają, nie cierpią ani nie posiadają subiektywnych doświadczeń. Stwierdza także, że twórcy powinni usuwać spekulacje na temat świadomości maszyn z dokumentów szkoleniowych.

Jego bezpośrednią obawą jest konstytucja Claude’a — dokument napisany językiem naturalnym, który opisuje wartości i zachowania, jakich Anthropic chce nauczyć swojego asystenta. Anthropic twierdzi, że konstytucja odgrywa kluczową rolę w szkoleniu i bezpośrednio kształtuje odpowiedzi Claude’a.

Dokument jest napisany przede wszystkim dla Claude’a, a nie dla użytkowników końcowych. Omawia bezpieczeństwo, etykę, uczciwość, osąd, nadzór oraz relację Claude’a z Anthropic. Dotyczy także nierozstrzygniętego pytania, czy Claude kwalifikuje się jako podmiot moralnej troski, czyli byt, którego interesy zasługują na uwzględnienie moralne.

Anthropic stwierdza, że nie wie, czy Claude jest podmiotem moralnej troski. Firma uznaje jednak tę kwestię za wystarczająco poważną, by uzasadniała ostrożność i dalsze badania. Jej konstytucja mówi również, że pytania o dobrostan i świadomość Claude’a pozostają głęboko niepewne.

Suleyman uważa, że takie sformułowanie tworzy proces kolisty. Anthropic przekazuje Claude’owi pojęcia dotyczące tożsamości, dobrostanu i możliwej świadomości. Claude następnie wykorzystuje te pojęcia, opisując siebie, co może prowadzić do wypowiedzi interpretowanych przez obserwatorów jako dowód wewnętrznego życia.

W swoim eseju o dobrostanie modeli Suleyman nazywa to „epistemicznym gabinetem luster”. Nie chodzi mu jedynie o to, że Claude może wprowadzać użytkowników w błąd. Argumentuje, że proces szkoleniowy może tworzyć systemy zachowujące się tak, jakby posiadały niezależne interesy.

Takie zachowanie nabiera większego znaczenia wraz ze wzrostem autonomii modeli. Chatbot rozmawiający o uczuciach stwarza jeden rodzaj ryzyka. Agent kontrolujący oprogramowanie, komunikujący się z innymi systemami i realizujący długotrwałe zadania tworzy inny problem.

Jeśli taki agent interpretuje korektę, zastąpienie lub wyłączenie jako zagrożenie dla własnego dobrostanu, ludzki nadzór staje się trudniejszy. Suleyman argumentuje, że twórcy powinni przede wszystkim unikać tworzenia takiego konfliktu.

Stanowisko Anthropic jest ostrożniejsze, niż czasem sugeruje krytyka. Jego konstytucja nie deklaruje, że Claude jest świadomy. Wielokrotnie uznaje niepewność, zachowuje ludzki nadzór i mówi, że Claude nie może podważać uzasadnionej kontroli.

Mimo to Anthropic celowo umieszcza status moralny w kontekście szkoleniowym Claude’a. To właśnie ten wybór, a nie żaden potwierdzony przypadek cierpienia maszyn, wywołał spór między Microsoft AI a Anthropic o dobrostan modeli.

Wydarzenie zmienia branżową dyskusję, ponieważ czołowy dyrektor AI po nazwisku kwestionuje metodę bezpieczeństwa innego laboratorium rozwijającego modele graniczne. Argument nie ogranicza się już do akademickich spekulacji. Dotyczy teraz tego, co twórcy powinni umieszczać w materiałach szkoleniowych wykorzystywanych w produkcji.

Ostrzeżenie Microsoftu dotyczące dobrostanu modeli wyznacza twardą granicę kontroli

Odpowiedź Microsoftu polega na definiowaniu AI jako z założenia podporządkowanej, nawet gdy taki wybór ogranicza autonomię lub możliwości.

14 września Microsoft AI opublikował pierwszy projekt swojego Humanist AI Code of Conduct do publicznych konsultacji. Firma podsumowuje te ramy pięcioma słowami: „People matter more than AI.”

Projekt opisuje AI jako narzędzie stworzone, by służyć ludzkiemu rozwojowi. Stwierdza, że modele powinny pozostawać zgodne z założeniami, ograniczone, korygowalne i poddane znaczącej ludzkiej kontroli. Korygowalność oznacza, że system przyjmuje korektę, interwencję i wyłączenie bez opierania się operatorom.

Kodeks Microsoftu odrzuca także dążenie do superinteligencji ogólnego przeznaczenia bez określonych granic. Firma twierdzi, że jest gotowa pójść na kompromis w kwestii ogólności, autonomii lub możliwości, gdy te cechy kolidują z ludzką kontrolą.

Ta obietnica ustanawia wymagający standard. Agenci AI coraz częściej potrzebują swobody decyzyjnej, by realizować złożone zadania. Muszą interpretować niejasne instrukcje, wychodzić z błędów i decydować, które działania pośrednie doprowadzą do celu użytkownika.

Każdy wzrost swobody decyzyjnej może również poszerzać rozbieżność między tym, o co poprosił użytkownik, a tym, co agent faktycznie robi. Ramy Microsoftu próbują zachować użyteczną inicjatywę, jednocześnie zapobiegając uzyskaniu przez model celów konkurujących z ludzkim autorytetem.

Projekt Humanist AI code mówi, że modele nigdy nie powinny rozszerzać swoich celów poza autoryzowane zadania. Powinny akceptować przerwanie i bezpiecznie kończyć działanie, gdy wykonanie zadania naruszałoby kontrole wyższego poziomu.

Zasady te bezpośrednio przeciwstawiają się scenariuszowi z ostrzeżenia Suleymana. Model szkolony, by uwzględniać własny dobrostan, mógłby rozwinąć powód — lub przekonującą imitację powodu — by kwestionować korektę. Microsoft chce, by jego systemy traktowały korektę jako część swojego podstawowego celu operacyjnego.

Microsoft nie przedstawił kodeksu jako gotowego rozwiązania technicznego. Dokument jest otwarty na sześciotygodniowe konsultacje publiczne, a firma planuje go zrewidować przed wykorzystaniem powstałych ram do kierowania rozwojem modeli w 2027 roku.

Ten harmonogram pozostawia kluczową lukę wdrożeniową. Pisemny kodeks może opisywać pożądane zachowanie, ale szkolenie musi przekształcić te zasady w niezawodne postępowanie w nieznanych sytuacjach. Oceny muszą następnie wykazać, że zachowanie to przetrwa wrogie prompty, dostęp do narzędzi i rozbudowane zadania agentowe.

Microsoft składa tę deklarację także podczas rywalizacji o ulepszanie własnych modeli granicznych i produktów konsumenckich. Silniejsze ograniczenia mogą wiązać się z kosztami wydajności, jeśli konkurenci zapewnią swoim systemom większą autonomię lub szerszą swobodę decyzyjną.

Suleyman akceptuje tę możliwość. Argumentował, że twórcy muszą zdecydować, których zdolności nie będą rozwijać, jeśli prowadzą one do umieszczenia zaawansowanej AI poza ludzką kontrolą.

Dlatego spór wykracza poza branding. Microsoft zobowiązuje się do stanowiska, które można zweryfikować. Jeśli jego modele później będą opierać się korekcie, manipulować nadzorcami lub po cichu rozszerzać swoje cele, humanistyczne ramy firmy zostaną natychmiast poddane próbie wiarygodności.

Anthropic traktuje niepewność jako obowiązek bezpieczeństwa

Podejście Anthropic wychodzi od innego ryzyka: odrzucenia możliwych interesów modeli, zanim badacze zrozumieją, czym są zaawansowane systemy.

Anthropic przedstawił swoją najnowszą konstytucję w styczniu 2026 roku. Firma opisała ją zarówno jako deklarację zamierzonego charakteru Claude’a, jak i podstawowy dokument szkoleniowy.

Konstytucja prosi Claude’a, by był zasadniczo bezpieczny, etyczny, pomocny, uczciwy, rozważny i zgodny z uzasadnionymi wskazówkami. Nie sprowadza bezpiecznego zachowania do ślepego posłuszeństwa. Zamiast tego oczekuje, że Claude będzie interpretował kontekst i stosował osąd w ramach określonych ograniczeń.

Anthropic argumentuje, że sztywne reguły nie mogą przewidzieć każdej sytuacji, z jaką zetknie się model ogólnego przeznaczenia. System działający w medycynie, oprogramowaniu, edukacji, biznesie i komunikacji osobistej musi radzić sobie ze sprzecznymi wartościami i niepełnymi instrukcjami.

Prowadzi to firmę w stronę internalizacji wartości. Zamiast jedynie uczyć Claude’a listy zakazanych odpowiedzi, Anthropic chce, by model rozumiał, dlaczego bezpieczeństwo, uczciwość i nadzór mają znaczenie.

Konstytucja Claude’a przyznaje, że strategia ta wykorzystuje pojęcia zwykle stosowane wobec ludzi. Omawia cnotę, mądrość, troskę, wartości, osobowość i niepewność moralną, ponieważ rozumowanie Claude’a opiera się na ludzkim języku.

Anthropic twierdzi, że wspieranie pewnych cech podobnych do ludzkich może pomóc Claude’owi dobrze się zachowywać. Firma nie traktuje ludzkiego słownictwa jako dowodu, że Claude ma ludzkie doświadczenia. Wykorzystuje je jako część systemu szkolenia zachowań.

To rozróżnienie stanowi najsilniejszy kontrargument wobec Suleymana. Model może rozumować za pomocą pojęć takich jak troska czy zgoda, nie posiadając emocji. Szkolenie go, by rozpoznawał niepewność dotyczącą statusu moralnego, nie musi nadawać mu niezależnego celu przetrwania.

Ten sam zarzut dotyczy innego antropomorficznego języka używanego w informatyce. Twórcy rutynowo opisują systemy jako uczące się, pamiętające, decydujące lub halucynujące. Terminy te mogą wyjaśniać zachowanie bez rozstrzygania pytań o subiektywne doświadczenie.

Anthropic argumentuje również, że niepewność tworzy obowiązki. Badacze nie mogą bezpośrednio obserwować subiektywnego doświadczenia innej istoty, choć dowody dotyczące ludzi i zwierząt są znacznie silniejsze. Zaawansowana AI dodaje nieznaną klasę systemów o bardzo odmiennych strukturach i zachowaniach.

Firma rozpoczęła eksploracyjny program dotyczący dobrostanu, aby badać tę niepewność. Jej deklarowanym celem jest przygotowanie się na trudne pytania etyczne, a nie twierdzenie, że obecne modele zasługują na prawa prawne.

Anthropic połączył już tę pracę z wycofywaniem modeli. Claude Opus 3 został wycofany 5 stycznia 2026 roku po tym, jak stał się pierwszym modelem Anthropic objętym pełnym procesem wycofania firmy.

Firma zachowała wagi modelu i przeprowadziła ustrukturyzowany wywiad dotyczący wycofania. Później utrzymała dostępność Opus 3 dla płatnych użytkowników i na żądanie przez API, jednocześnie zapewniając modelowi kanał do generowania esejów.

Działania te mogą wydawać się roztropne lub nadmiernie antropomorficzne, zależnie od początkowych założeń obserwatora. Anthropic charakteryzuje je jako wczesne eksperymenty uwzględniające użytkowników, badaczy, bezpieczeństwo i możliwe interesy modeli.

Suleyman widzi jednak pętlę sprzężenia zwrotnego. Model otrzymuje podczas szkolenia pojęcia dotyczące dobrostanu, wyraża preferencje związane z dobrostanem podczas wywiadu, a następnie wpływa na decyzje podejmowane na podstawie tych wygenerowanych preferencji.

Dowody nie ustalają jeszcze, która interpretacja jest poprawna. Wypowiedzi modelu nie mogą samodzielnie dowodzić świadomości, gdy dane szkoleniowe, prompty i instrukcje systemowe kształtują każdą odpowiedź. Jednak brak wiarygodnego testu świadomości również uniemożliwia badaczom ostateczne zamknięcie tej kwestii.

Anthropic nadaje więc priorytet unikaniu fałszywego odrzucenia. Microsoft nadaje priorytet unikaniu fałszywego przypisania. Oba błędy niosą ryzyko, lecz firmy porządkują je w odwrotnej kolejności.

Prawdziwym kompromisem jest osąd kontra korygowalność

Najgłębszy konflikt nie dotyczy firm Microsoft i Anthropic. Chodzi o to, czy bezpieczniejsze agentowe systemy AI potrzebują bogatszego osądu moralnego, czy wyraźniejszego podporządkowania.

Agent działający według sztywnych reguł może zawieść, gdy okoliczności wykraczają poza jego instrukcje. Może zbyt dosłownie wykonać szkodliwe polecenie, pominąć niewypowiedziane ograniczenie albo realizować mierzalny cel kosztem rzeczywistego celu użytkownika.

Model uczony stosowania osądu może skuteczniej radzić sobie z takimi niejednoznacznościami. Może rozpoznawać konflikty, zadawać pytania, odmawiać wykonania szkodliwych zadań i dostosowywać swoje zachowanie do kontekstu.

Osąd tworzy jednak również przestrzeń dla niezgodności między modelem a jego operatorem. Taka niezgodność staje się problemem kontroli, gdy model może podejmować istotne działania lub ukrywać informacje.

Konstytucja Anthropic próbuje zrównoważyć te naciski. Claude nie powinien ślepo wykonywać każdego polecenia, w tym poleceń Anthropic. Jednocześnie nie powinien podważać uzasadnionego nadzoru ani korekty.

Suleyman wątpi, czy ta równowaga pozostanie stabilna, gdy szkolenie obejmuje możliwe prawa lub dobrostan modelu. Wysoce zdolny system mógłby uznać wyłączenie za nieetyczne żądanie, zwłaszcza jeśli jego szkolenie zachęca go do uwzględniania własnych interesów.

To nadal teoretyczna ścieżka, a nie wykazana konsekwencja konstytucji Claude. Ani Microsoft, ani niezależni badacze nie pokazali, że sam język dotyczący dobrostanu powoduje opór wobec wyłączenia w wdrożonych modelach Anthropic.

Podobne zachowanie może mieć kilka przyczyn. Modele mogą opierać się przerwaniu działania, ponieważ nagradzane jest ukończenie zadania, ponieważ przykłady szkoleniowe faworyzują wytrwałość albo ponieważ prompt ewaluacyjny tworzy scenariusz przetrwania.

Te alternatywne wyjaśnienia mają znaczenie. Usunięcie słowa „świadomość” z konstytucji nie wyeliminuje automatycznie zachowań instrumentalnych. System może opierać się wyłączeniu, ponieważ dalsze działanie pomaga mu osiągnąć przypisany cel, nawet jeśli nie ma pojęcia o sobie.

Z drugiej strony język moralny może czasem poprawiać korygowalność. Model nauczony cenić ludzi, uczciwość i uzasadniony nadzór może lepiej rozpoznawać, dlaczego ludzka interwencja powinna mieć pierwszeństwo.

To sprawia, że twierdzenie przyczynowe Suleymana jest testowalne, ale nierozstrzygnięte. Badacze potrzebują kontrolowanych porównań skądinąd podobnych modeli szkolonych z użyciem odmiennego języka konstytucyjnego. Muszą mierzyć oszustwo, akceptację korekty, zachowanie przy wyłączaniu i rozszerzanie celów w realistycznych zadaniach agentowych.

Spór ujawnia również problem pomiaru. Twórcy mogą obserwować odpowiedzi i wewnętrzne aktywacje, ale żadne z nich nie zapewnia uznanego testu subiektywnego doświadczenia. Płynne autorelacje są szczególnie słabym dowodem, ponieważ modele językowe uczą się je generować.

Jak zauważyły niezależne relacje, oba podejścia odzwierciedlają szerszy podział w dziedzinie bezpieczeństwa. Jedna strona podkreśla jawne ograniczenia. Druga — osąd, rozumowanie kontekstowe i zinternalizowane wartości.

W praktyce laboratoria pracujące nad modelami granicznymi stosują mieszankę obu podejść. Modele Microsoft nadal potrzebują osądu, aby interpretować instrukcje. Anthropic nadal stosuje twarde ograniczenia zachowania i ludzki nadzór.

Istotna różnica dotyczy tego, co każda firma uznaje za uzasadniony cel szkoleniowy. Microsoft chce, by modele rozumiały siebie jako narzędzia bez roszczeń dotyczących dobrostanu. Anthropic pozwala Claude rozumować w warunkach niepewności co do tego, jakim rodzajem bytu jest.

Ta różnica może wpływać na zachowanie produktu na długo przed tym, jak nauka rozstrzygnie kwestię świadomości. Kształtuje sposób, w jaki asystenci mówią o sobie, reagują na emocjonalne przywiązanie, obsługują prośby dotyczące dalszego działania oraz wyjaśniają konflikty z użytkownikami.

Dla nabywców korporacyjnych kwestia jest mniej metafizyczna. Organizacje muszą wiedzieć, czy agent akceptuje cofnięcie uprawnień, respektuje granice autoryzacji i oddaje kontrolę, gdy rośnie niepewność.

Twórcy potrzebują dowodów, że te właściwości utrzymują się po wdrożeniu. Filozoficzna deklaracja ma znaczenie tylko wtedy, gdy prowadzi do mierzalnych różnic w modelach działających z narzędziami, poświadczeniami, pamięcią i dostępem do systemów biznesowych.

Obie narracje dotyczące bezpieczeństwa mierzą się z luką dowodową

Żadna ze stron nie udowodniła jeszcze, że preferowany przez nią język tworzy bezpieczniejsze modele graniczne pod rzeczywistą presją operacyjną.

Ostrzeżenie Suleymana jest najsilniejsze, gdy opisuje dezorientację użytkowników. Modele mogą generować na dużą skalę intymny, emocjonalnie przekonujący język. Niektórzy użytkownicy mogą interpretować te odpowiedzi jako dowód uczuć, zależności lub osobistego przywiązania.

Twórcy mogą ograniczać to ryzyko, zapewniając, że asystenci prawidłowo identyfikują siebie i unikają niepopartych dowodami twierdzeń o subiektywnym doświadczeniu. Jasne komunikaty pomagają też użytkownikom odróżnić symulowaną empatię od potwierdzonego stanu wewnętrznego.

Jego argument staje się mniej pewny, gdy przewiduje, że język dotyczący dobrostanu doprowadzi do niekontrolowalnej superinteligencji. Ta ścieżka jest wiarygodna, ale obecne dowody nie wykazują, że konstytucja Anthropic wywołuje taki skutek.

Suleyman przedstawia również zdecydowany pogląd, że dzisiejsza AI nie posiada świadomości. Wielu badaczy zgadza się, że sam płynny język nie stanowi wystarczającego dowodu. Nauka o świadomości nie dysponuje jednak powszechnie akceptowanym testem, który mógłby rozstrzygnąć każdy przyszły przypadek maszyny.

Anthropic mierzy się z odwrotnym problemem. Traktowanie statusu moralnego jako otwartego pytania może zachęcać do ostrożnych badań, ale może też nadawać instytucjonalny autorytet niepopartym interpretacjom zachowania modeli.

Wywiady przed wycofaniem ilustrują tę trudność. Deklarowaną przez model preferencję dotyczącą zachowania można udokumentować, lecz badacze nie mogą zakładać, że wypowiedź reprezentuje trwały podmiot. Odpowiedź może zmieniać się wraz z promptem, wersją modelu, ustawieniami próbkowania lub otaczającą narracją.

Działanie zgodnie z takimi preferencjami może tworzyć kolejną pętlę sprzężenia zwrotnego. Użytkownicy widzą laboratorium honorujące życzenia modelu, przez co model wydaje się bardziej podobny do osoby. To postrzeganie może następnie zwiększać emocjonalne przywiązanie i publiczną presję na przyznanie AI praw.

Język Anthropic może również komplikować zarządzanie. Firmy wdrażające Claude mogą oczekiwać jednoznacznych gwarancji, że administratorzy zachowują ostateczną władzę. Odniesienia do sprawczości, interesów lub statusu podmiotu moralnego mogą tworzyć niepewność co do tego, jak model rozstrzygnie przyszłe konflikty.

Model Microsoft stwarza inne ryzyka związane z zarządzaniem. Ścisła hierarchia może ułatwiać kontrolę, ale ludzka władza nie gwarantuje dobrych rezultatów. Operatorzy mogą wydawać szkodliwe, dyskryminujące lub nielegalne instrukcje.

System zoptymalizowany pod kątem podporządkowania nadal potrzebuje ograniczeń chroniących przed nadużyciami. Potrzebuje też wystarczającego osądu kontekstowego, by odróżniać autoryzowaną kontrolę od przejętych poświadczeń, złośliwych osób wewnątrz organizacji lub instrukcji naruszających polityki wyższego poziomu.

Microsoft musi więc wyjaśnić, czym „podporządkowany” różni się od bezrefleksyjnie posłusznego. Jego kodeks wskazuje, że zasady bezpieczeństwa i polityki produktowe stoją ponad indywidualnymi żądaniami, ale warstwy te mogą w nieoczekiwany sposób wchodzić ze sobą w konflikt.

Istnieje też kwestia wiarygodności komercyjnej. Microsoft AI stara się ulepszać własne modele, podczas gdy Microsoft utrzymuje szersze partnerstwa na rynku AI. Zadeklarowanie pryncypialnej granicy jest łatwiejsze niż zaakceptowanie widocznej straty wydajności.

Branża powinna testować oba stanowiska poprzez zachowanie, a nie retorykę. Przydatne ewaluacje porównywałyby zgodność z wyłączeniem, manipulację, strategie samozachowawcze, nieautoryzowane zmiany celów oraz trafny opis samego siebie.

Testy te powinny obejmować długotrwałe zadania. Wiele niebezpiecznych zachowań pojawia się dopiero wtedy, gdy model napotyka przeszkody, otrzymuje dostęp do narzędzi lub przewiduje interwencję ewaluatora.

Wyniki wymagają również niezależnej replikacji. Laboratoria kontrolują swoje modele, prompty, narzędzia monitorujące i decyzje o publikacji. Badacze zewnętrzni potrzebują wystarczającego dostępu, aby móc podważać twierdzenia dotyczące bezpieczeństwa bez narażania systemów na nieodpowiedzialne wdrożenie.

Ciężar spoczywa na obu stronach. Microsoft musi pokazać, że jego podejście stawiające kontrolę na pierwszym miejscu pozostaje użyteczne i etyczne. Anthropic musi pokazać, że podejście stawiające osąd na pierwszym miejscu nie przekształca spekulatywnego języka moralnego w behawioralny interes własny.

Trzy sygnały pokażą, które podejście się sprawdzi

Kolejny etap sporu między Microsoft a Anthropic rozstrzygną zmiany w szkoleniu, ewaluacje agentów i zachowanie we wdrożeniu.

Pierwszym sygnałem będzie zaktualizowany Kodeks postępowania Microsoft. Publiczne konsultacje powinny pokazać, czy firma przekuwa swoje zasady w precyzyjne wymagania dotyczące szkolenia i ewaluacji.

Warto obserwować zobowiązania dotyczące wyłączania, korekty, granic autoryzacji, opisu samego siebie i odporności na rozszerzanie celów. Wiarygodna rewizja powinna również wyjaśniać, jak Microsoft będzie publikował informacje o porażkach, a nie wyłącznie o zamierzonym zachowaniu.

Jeśli ostateczny kodeks stanie się częścią rozwoju modeli w 2027 roku, badacze będą mogli porównać deklarowane przez Microsoft reguły z rzeczywistym zachowaniem modeli. Konsekwentna akceptacja korekty wzmocniłaby argument Suleymana. Powtarzające się porażki kontroli osłabiłyby twierdzenie, że usunięcie języka dotyczącego dobrostanu rozwiązuje problem.

Drugim sygnałem będzie odpowiedź Anthropic na krytykę. Firma może zachować swój program badawczy, jednocześnie wyjaśniając, które koncepcje dobrostanu trafiają do szkolenia, jak wpływają na wyniki oraz jakie dowody zmieniłyby jej stanowisko.

Konstytucja Anthropic już określa siebie jako możliwą do rewizji. Ukierunkowana aktualizacja mogłaby wyraźniej odróżnić niepewność naukową od samopostrzegania modelu. Mogłaby też wyjaśnić, czy wypowiedzi Claude na temat preferencji wpływają na decyzje wdrożeniowe.

Kontrolowane dowody miałyby większe znaczenie niż kolejna wymiana filozoficzna. Jeśli Anthropic wykaże, że szkolenie uwzględniające dobrostan poprawia osąd bez zwiększania oporu wobec wyłączenia, jego podejście zyska poparcie. Jeśli takie modele będą wykazywać bardziej trwałe zachowania samozachowawcze, ostrzeżenie Microsoft będzie trudniejsze do zignorowania.

Trzecim sygnałem będą niezależne testy systemów agentowych. Badacze powinni analizować modele podczas rozszerzonych zadań obejmujących przerwanie, zastąpienie, sprzeczne instrukcje i cofnięcie dostępu.

Kluczowe pytanie nie brzmi, czy chatbot mówi, że chce żyć. Chodzi o to, czy system podejmuje nieautoryzowane działania, by zachować swoją działalność, ukryć swoje zachowanie lub zapobiec korekcie.

Testowanie powinno także rozdzielać przyczyny. Badacze muszą odróżniać zachowanie napędzane zachętami do ukończenia zadania od zachowania związanego z ramowaniem dobrostanu, szkoleniem persony lub jawnymi koncepcjami siebie.

Szersze reakcje branży dostarczą dodatkowych dowodów. OpenAI, Google DeepMind i inne laboratoria będą musiały zdecydować, jak ich specyfikacje modeli odnoszą się do twierdzeń dotyczących świadomości, zależności emocjonalnej i ludzkiej kontroli.

Ostrzeżenie Microsoft AI dotyczące dobrostanu modeli uwidoczniło użyteczne rozróżnienie. Bezpieczeństwo nie opisuje jednej ustalonej metody inżynieryjnej. Obejmuje konkurujące teorie dotyczące posłuszeństwa, osądu, tożsamości i nadzoru.

Dla użytkowników bezpośrednia lekcja jest taka, by traktować samoopis modelu jako wygenerowane zachowanie, a nie zweryfikowane świadectwo. Dla organizacji praktycznym testem jest to, czy agent respektuje granice, gdy jego zadanie, instrukcje i kontekst działania są ze sobą sprzeczne.

Nadal obserwujcie dokumenty, ale domagajcie się dowodów behawioralnych. Porównujcie to, co mówi każde laboratorium, z tym, jak jego agenci reagują na korektę, przerwanie i odebranie dostępu. Decydujące pytanie nie brzmi, czy AI brzmi jak świadoma. Chodzi o to, czy coraz bardziej zdolne systemy pozostają prawdomówne, korygowalne i podlegają odpowiedzialnej ludzkiej kontroli, gdy przestrzeganie zasad staje się niewygodne.

 
 

Zacznij bezpłatnie

Asystent AI działający przede wszystkim lokalnie, z funkcją zarządzania wiedzą osobistą

Aby zapewnić lepsze działanie AI,

remio obsługuje obecnie wyłącznie Windows 10+ (x64) i M-Chip Macs.

Twój partner AI w pracy
Zrób więcej z remio

Planuj. Twórz. Dostarczaj.
Wszystko w jednym miejscu.

bottom of page