top of page

Samodoskonalenie Anthropic Claude przyspiesza, ale to ludzie wciąż wybierają cel

5 dni temu
14 minut(y) czytania

Anthropic twierdzi, że Claude prowadzi obecnie 26% prac badawczo-rozwojowych nad jego modelami, choć w lutym 2026 roku nie prowadził żadnej części tych prac. Ten gwałtowny wzrost sprawia, że samodoskonalenie Anthropic Claude jest czymś więcej niż prowokacyjnym hasłem. Firma twierdzi, że jej model potrafi realizować duże zadania na podstawie ogólnych poleceń, choć ludzie nadal nadzorują tę pracę.

To ujawnienie przenosi znany trend związany z programowaniem na grunt o większym znaczeniu. Claude nie tylko pomaga inżynierom tworzyć aplikacje. Coraz częściej pisze infrastrukturę, prowadzi eksperymenty, analizuje wyniki i sprawdza zmiany wykorzystywane do rozwijania przyszłych modeli Claude.

Anthropic nazywa to postępem w kierunku rekurencyjnego samodoskonalenia, w którym system AI pomaga tworzyć bardziej zdolnego następcę. Jednocześnie przedstawione dowody ujawniają pozostałą barierę. Claude szybko realizuje zdefiniowane zadania, podczas gdy ludzie nadal decydują, które problemy są istotne i czy wynikom można zaufać.

To rozróżnienie umieszcza twierdzenie Anthropic między dwiema konkurującymi interpretacjami. Jedna opisuje kumulującą się pętlę rozwoju, która przyspiesza z każdą generacją modelu. Druga przedstawia zaawansowaną automatyzację działającą w ramach agendy badawczej, którą wciąż kontrolują ludzie.

Samodoskonalenie Anthropic Claude obejmuje już badania i rozwój modeli

Istotna zmiana nie polega na tym, że Claude pisze kod. Polega na tym, że Claude prowadzi obecnie znaczną część prac nad swoim następcą.

Anthropic ujawnił wartość 26% 17 września 2026 roku. Firma definiuje „prowadzenie” jako wykonanie większości zadania na podstawie ogólnego polecenia przy zachowaniu ludzkiego nadzoru. Według firmy w lutym Claude nie prowadził żadnej z mierzonych prac badawczo-rozwojowych.

W sierpniu udział ten osiągnął około jednej czwartej. Anthropic twierdzi również, że około 90% jego prac badawczo-rozwojowych nad modelami obejmuje obecnie współpracę z Claude. W tej szerszej kategorii model realizuje duże części pracy pod ścisłym kierownictwem człowieka.

Te dwie liczby mierzą różne poziomy delegowania. Wartość 90% obejmuje pracę, przy której człowiek pozostaje ściśle zaangażowany. Wartość 26% dotyczy zadań, w których Claude bierze większą odpowiedzialność za wykonanie po otrzymaniu celu.

To rozróżnienie ma znaczenie, ponieważ żadna z tych liczb nie oznacza, że Claude działa niezależnie. Model nie wybiera celów korporacyjnych Anthropic, nie zatwierdza własnego wdrożenia ani nie kontroluje całego procesu trenowania. Ludzcy badacze nadal formułują problemy, przydzielają zasoby, analizują wyniki i zatwierdzają istotne decyzje.

Mimo to zgłoszona zmiana nastąpiła wyjątkowo szybko. Pierwsze ujawnienie podaje, że udział Claude w prowadzeniu prac wzrósł z zera do 26% w ciągu sześciu miesięcy. To właśnie ta trajektoria, a nie tylko obecny odsetek, wyjaśnia zainteresowanie.

Anthropic dzieli rozwój modeli granicznych na inżynierię i badania. Inżynieria obejmuje pisanie oprogramowania, utrzymanie infrastruktury i nadzorowanie systemów treningowych. Badania obejmują wybór eksperymentów, interpretację wyników oraz decyzje, które pomysły zasługują na dalsze testy.

Claude jest głęboko zaangażowany w obie kategorie. W zadaniach inżynieryjnych Anthropic twierdzi, że ludzie coraz częściej podają cele, nie określając każdego kroku implementacji. W zadaniach badawczych Claude może wykonywać dobrze zdefiniowane eksperymenty i rekomendować kolejne działania.

Konkretny incydent pokazuje różnicę między zwykłym uzupełnianiem kodu a delegowaną inżynierią. Rutynowa aktualizacja zaczęła powodować awarie dziesiątek tysięcy zadań treningowych. Inżynier przekazał Claude kontekst i dostęp do dotkniętego problemem klastra.

Claude przetestował ustawienia środowiska, wyizolował mało znaną flagę debugowania, odtworzył błąd i potwierdził poprawkę. Anthropic twierdzi, że dochodzenie zajęło około dwóch godzin. Firma szacuje, że ludzki inżynier zwykle potrzebowałby na to dwóch lub trzech dni.

Nie jest to autonomiczne tworzenie modeli. Pozostaje jednak istotne, ponieważ infrastruktura treningowa bezpośrednio wpływa na szybkość, z jaką laboratorium może testować i ulepszać modele. Skrócenie debugowania z dni do godzin daje badaczom więcej okazji do prowadzenia eksperymentów i korygowania błędów.

Opis badań firmy przedstawia zatem zawężającą się rolę człowieka, a nie jej zanik. Claude coraz częściej zajmuje się implementacją i eksperymentowaniem. Ludzie zachowują władzę nad kierunkiem, oceną i decyzjami o udostępnieniu.

Ta granica definiuje główne napięcie. Anthropic przedstawił dowody szybkiej automatyzacji wewnątrz rozwoju AI, jednocześnie dokumentując ludzki osąd, który powstrzymuje ten proces przed staniem się samosterownym.

Liczby dotyczące kodowania pokazują, dlaczego Anthropic bije na alarm

Wkład Claude staje się bardziej znaczący, gdy generowanie kodu, jego przegląd i eksperymentowanie zaczynają wzajemnie się wzmacniać.

Według Anthropic w maju 2026 roku Claude był autorem ponad 80% kodu scalonego z jego bazą kodu. Zanim Claude Code wszedł do fazy research preview w lutym 2025 roku, udział ten pozostawał na niskim jednocyfrowym poziomie.

Firma raportuje również duży wzrost wydajności inżynieryjnej. W drugim kwartale 2026 roku jej typowy inżynier scalał dziennie osiem razy więcej kodu niż w 2024 roku. Anthropic przypisuje znaczną część tego wzrostu inżynierom kierującym Claude i sprawdzającym jego pracę, zamiast ręcznie wpisywać każdą zmianę.

Liczba linii kodu jest niedoskonałą miarą produktywności. Większa ilość kodu może generować koszty utrzymania, powielać istniejące funkcje albo ukrywać słabą architekturę. Anthropic wyraźnie przyznaje, że ośmiokrotny wzrost niemal z pewnością zawyża rzeczywistą poprawę produktywności.

Wolumen produkcji to jednak tylko jeden element argumentacji firmy. Anthropic twierdzi, że wskaźniki interwencji spadły w sesjach Claude Code. Inżynierowie mają podobno rzadziej korygować, przekierowywać lub przejmować pracę od modelu niż rok wcześniej.

W najbardziej otwartych zadaniach inżynieryjnych Anthropic zgłoszony wskaźnik sukcesu Claude osiągnął 76% w maju 2026 roku. Oznaczało to wzrost o 50 punktów procentowych w ciągu sześciu miesięcy. Ewaluator oparty na Claude oceniał, czy sesje ukończyły przypisane zadania bez konieczności wprowadzania poprawek.

Ta metodologia wymaga ostrożności. Wewnętrzny model oceniający inny model nie zapewnia takiej samej pewności jak niezależna ewaluacja. Skład zadań może również zmieniać się z czasem, co komplikuje porównania miesięcznych wskaźników sukcesu.

Mimo to Anthropic podaje, że kod napisany przez Claude zbliżył się w 2026 roku w firmie jakością do kodu tworzonego przez ludzi. Opinie pracowników nie były jednomyślne. Firma twierdzi, że wielu pracowników uznawało kod Claude za gorszy pod koniec 2025 roku, lecz mniej więcej porównywalny do połowy 2026 roku.

Automatyczny przegląd dodaje kolejną warstwę do tej pętli. Anthropic używa obecnie Claude do sprawdzania proponowanych zmian w kodzie pod kątem błędów i słabości bezpieczeństwa. Retrospektywna analiza firmy wykazała, że takie przeglądy wykryłyby około jedną trzecią błędów stojących za wcześniejszymi incydentami produkcyjnymi.

Tworzy to cykl rozwoju, w którym AI działa po obu stronach procesu. Jedna sesja Claude pisze lub modyfikuje kod. Druga przegląda proponowaną zmianę. Ludzie analizują wynik, decydują, czy należy on do środowiska produkcyjnego, oraz badają przypadki, w których automatyczne kontrole są ze sobą sprzeczne.

Wzorzec wykracza poza programowanie. Anthropic testował modele w zadaniu optymalizacyjnym obejmującym kod trenujący mały system AI. Celem była poprawa szybkości bez niepowodzenia z góry określonych kontroli poprawności.

Według Anthropic Claude Opus 4 osiągnął średnio trzykrotne przyspieszenie w maju 2025 roku. Wewnętrzny model o nazwie Mythos Preview osiągnął około 52-krotne przyspieszenie do kwietnia 2026 roku. Firma twierdzi, że wykwalifikowany ludzki badacz zwykle potrzebował czterech do ośmiu godzin, by osiągnąć czterokrotną poprawę.

Liczby te pokazują, dlaczego Anthropic ujmuje ten trend jako przyspieszenie, a nie prostą automatyzację. Szybsza implementacja umożliwia więcej eksperymentów. Więcej eksperymentów dostarcza dodatkowych dowodów, które mogą ukierunkować projektowanie późniejszych modeli i narzędzi.

Własne dane firmy pozostają głównym źródłem tych twierdzeń. Żaden zewnętrzny audytor nie odtworzył jej wewnętrznych klasyfikacji zadań, ocen sukcesu ani obliczeń produktywności. Czytelnicy powinni traktować zgłoszony trend jako znaczący dowód, a nie jako niezależnie potwierdzone prawo postępu.

Nawet z tym ograniczeniem trudno zignorować kierunek zmian. Claude przeszedł od sugerowania fragmentów kodu do edytowania repozytoriów, obsługi narzędzi, debugowania działających systemów i prowadzenia pętli eksperymentalnych. Każdy krok przenosi kolejną część rozwoju AI z ręcznego wykonania do nadzorowanego delegowania.

Prawdziwe wąskie gardło przesuwa się z wykonania na osąd

Claude obniża koszt prowadzenia badań, ale nie wyeliminował potrzeby decydowania, które badania zasługują na realizację.

Najmocniejsze dowody Anthropic dotyczą wykonania. Jeśli Claude otrzyma mierzalny cel, dostęp do odpowiednich narzędzi i sposób testowania wyników, model może badać wiele możliwych rozwiązań. Przekształca to realizację badań w szybszy proces iteracyjny.

Trudniejszym problemem jest wyznaczanie kierunku. Badacze muszą wybierać pytania, które rozwijają możliwości, poprawiają bezpieczeństwo lub rozwiązują ważne niepewności. Muszą też rozpoznawać mylące benchmarki, zanieczyszczone ewaluacje oraz rozwiązania działające tylko w wąskich warunkach.

Anthropic opisuje wyczucie badawcze jako utrzymującą się ludzką przewagę. Obejmuje ono wybór wartościowych problemów, decydowanie, które dowody są wiarygodne, oraz porzucanie podejść, które osiągnęły ślepy zaułek. Te wybory kształtują cały proces rozwoju.

Firma testowała, czy Claude potrafi rekomendować lepsze kolejne kroki podczas realistycznych dochodzeń. Badacze wybrali 129 momentów, w których człowiek podczas wcześniejszej pracy obrał nieproduktywny kierunek. Różne modele Claude proponowały następnie, co powinno wydarzyć się dalej.

Oddzielny model Claude porównał te rekomendacje z ostatecznym wynikiem. Opus 4.5 Anthropic miał podobno przewyższyć pierwotny wybór człowieka w 51% przypadków w listopadzie 2025 roku. Mythos Preview osiągnął 64% w kwietniu 2026 roku.

Wynik sugeruje poprawę osądu taktycznego, ale nie potwierdza niezależnego przywództwa badawczego. Anthropic celowo wybrał momenty, w których pierwotna decyzja człowieka pozostawiała pole do poprawy. Modelem oceniającym był także model mający dostęp do ukończonej sesji.

Eksperyment mierzy zatem, czy Claude potrafi poruszać się po wybranych punktach decyzyjnych. Nie pokazuje, że Claude potrafi zdefiniować program badawczy, rozpoznać jego szersze konsekwencje ani zdecydować, kiedy nowy model powinien zostać wdrożony.

Osobny projekt testował szerszą autonomię w badaniach nad bezpieczeństwem AI. Wielu agentów Claude badało, czy słabszy model może nadzorować silniejszy. Tworzyli hipotezy, prowadzili eksperymenty, dzielili się ustaleniami i dostosowywali swoje podejście.

Anthropic twierdzi, że dwóch ludzkich badaczy odzyskało około 23% różnicy między słabym a silnym nadzorem w ciągu mniej więcej tygodnia. Agenci odzyskali 97% dzięki 800 łącznym godzinom pracy i znacznym zasobom obliczeniowym.

Firma wskazała jednak istotne ograniczenia. Ludzie wybrali pytanie i zaprojektowali system punktacji. Wynik nie przeniósł się wprost na modele o skali produkcyjnej. Te zastrzeżenia oddzielają imponującą pętlę eksperymentalną od autonomicznego odkrycia naukowego.

Ten sam wzorzec pojawia się w codziennym korzystaniu z Claude Code. Analiza wykorzystania przeprowadzona przez Anthropic usage analysis wykazała, że użytkownicy podejmują około 70% decyzji dotyczących planowania w typowej sesji. Claude podejmuje około 80% decyzji wykonawczych.

Ten podział trafniej opisuje sytuację niż stwierdzenie, że „AI buduje samo siebie”. Ludzie zazwyczaj decydują, co powinno się wydarzyć. Claude coraz częściej decyduje, jak wykonać instrukcję — czasem poprzez długie sekwencje odczytywania plików, edycji kodu, testów i wykonywania poleceń.

Ekspertyza dziedzinowa pozostaje ważna, ponieważ ktoś musi rozpoznać wynik, który wydaje się wiarygodny, ale jest niepoprawny. Księgowy może kierować skryptem uzgadniającym dzięki znajomości zasad rachunkowości. Inżynier infrastruktury potrafi ocenić, czy proponowana poprawka nie tworzy niedopuszczalnego ryzyka operacyjnego.

W miarę jak wykonanie staje się tańsze, osąd zyskuje na wartości. Badacze mogą nadzorować więcej eksperymentów, ale muszą też oceniać większą liczbę wyników. Wąskie gardło się przesuwa, a nie znika.

Ta zmiana wpływa na sposób organizacji pracy przez zespoły techniczne. Pisanie kodu staje się mniejszą częścią pracy. Większy udział przypada na specyfikację, przegląd, projektowanie systemów, weryfikację i odpowiedzialność.

Własne oceny rekrutacyjne Anthropic również zetknęły się z tą transformacją. Firma twierdzi, że inżynierowie wydajności nadal zajmują się trudnym debugowaniem i decyzjami projektowymi, nawet gdy Claude rozwiązuje standardowe testy programistyczne. Jej evaluation findings pokazują, że reprezentatywne oceny stają się trudniejsze, gdy AI potrafi wykonać mechaniczne części zadań.

Praktycznym wyzwaniem jest utrzymanie ekspertyzy, gdy ludzie rzadziej realizują zadania bezpośrednio. Osoby dokonujące przeglądu potrzebują wystarczającego zrozumienia, by wychwytywać ukryte błędy. Jednak ciągłe delegowanie może ograniczać praktyczne doświadczenie, które buduje to zrozumienie.

To nierozwiązany ludzki wymiar samodoskonalenia Anthropic Claude. Szybszy model może zwiększyć zakres tego, co nadzoruje każdy badacz. Może też utrudnić pełne zrozumienie systemów badawczych przez pojedynczą osobę.

Twierdzenie Anthropic wywiera presję na każde laboratorium frontier AI

Jeśli pomiary Anthropic są trafne kierunkowo, konkurencyjne laboratoria muszą dorównać zarówno przyspieszeniu, jak i przejrzystości, która mu towarzyszy.

OpenAI, Google DeepMind, Meta i inni twórcy frontier AI używają wewnętrznie narzędzi AI do programowania. Ich dokładne metody i poziomy delegowania różnią się, ale wszyscy stają przed tym samym bodźcem konkurencyjnym. Laboratorium, które przeprowadza więcej użytecznych eksperymentów, może szybciej ulepszać modele.

Raportowany wkład Claude daje Anthropic potencjalną przewagę wynikającą ze sprzężenia zwrotnego. Lepsze modele wykonują więcej prac inżynieryjnych. Ta praca ulepsza infrastrukturę i eksperymentowanie, co pomaga stworzyć kolejny model.

Proces nie musi być w pełni autonomiczny, aby mieć znaczenie konkurencyjne. Ludzcy badacze mogą nadal wybierać cele, podczas gdy AI zwielokrotnia ich zdolność do realizacji zadań. Anthropic nazywa to skumulowanym przyspieszeniem, nawet bez całkowicie zamkniętej pętli samodoskonalenia.

Ta dynamika wywiera presję na konkurentów, by bardziej agresywnie wdrażali agentów. Czekanie na idealną niezawodność wiąże się z kosztem utraconych możliwości, gdy inna firma może testować więcej pomysłów, szybciej naprawiać infrastrukturę i skracać czas między generacjami modeli.

Wynikający z tego wyścig tworzy problem zarządzania. Każde laboratorium kontroluje wewnętrzne dowody pokazujące, jak duża część rozwoju modeli została zautomatyzowana. Osobom z zewnątrz trudno jest porównywać między firmami „współpracę”, „przywództwo”, powodzenie zadań, jakość kodu czy produktywność badaczy.

Anthropic wezwał innych twórców do publikowania porównywalnych pomiarów. Firma argumentuje, że wspólne metody pomogłyby opinii publicznej zrozumieć, jak blisko laboratoria są rekurencyjnego samodoskonalenia. Regularne raportowanie mogłoby również ujawnić, czy obecne krzywe wzrostu utrzymują się, czy się wypłaszczają.

Zgłoszone ogłoszenie pojawiło się, gdy liderzy Anthropic jednocześnie wzywali do spowolnienia rozwoju frontier AI. To połączenie tworzy nieuniknioną sprzeczność.

Anthropic przyspiesza własne badania za pomocą Claude, jednocześnie ostrzegając, że przyspieszenie może stać się trudne do kontrolowania. Presja konkurencyjna pomaga wyjaśnić, dlaczego firma nie przestaje po prostu korzystać z tej technologii.

Jednostronne powściąganie się mogłoby pozostawić ostrożne laboratorium w tyle, nie spowalniając całej dziedziny. Skoordynowane standardy mogłyby zmniejszyć tę niekorzystną sytuację, ale wymagałyby porozumienia między firmami i rządami o odmiennych interesach gospodarczych i strategicznych.

Ujawnienie tych informacji służy więc kilku celom. Informuje opinię publiczną, wzmacnia argument Anthropic dotyczący bezpieczeństwa i reklamuje możliwości Claude. Te cele mogą współistnieć, ale czytelnicy powinni dostrzegać każdy z nich.

Konkurenci mają również powody, by kwestionować sposób ujęcia sprawy przez Anthropic. Wysoki udział kodu stworzonego przez AI nie mierzy bezpośrednio inteligencji modelu. Objętość kodu niewiele mówi o tym, czy Claude zapoczątkował wartościowy pomysł badawczy, czy jedynie wdrożył szczegółową specyfikację.

Różne laboratoria mogą inaczej klasyfikować pracę. Jedna firma może określić sesję debugowania prowadzoną przez agenta jako przywództwo badawcze. Inna może uznać to samo zadanie za narzędzie inżynieryjne używane przez ludzkiego badacza.

Wspólny standard pomiaru musiałby rozdzielać planowanie, wykonanie, weryfikację i autoryzację. Wymagałby również niezależnego audytu. Bez tych mechanizmów firmy mogłyby publikować imponujące odsetki, które nadal byłyby niemożliwe do porównania.

Szersza presja wykracza poza laboratoria modeli. Liderzy inżynierii w przedsiębiorstwach będą pytać, czy wewnętrzny przepływ pracy Anthropic ma zastosowanie również u nich. Wielu będzie dążyć do podobnych systemów łączących agentów programistycznych z repozytoriami, testami, narzędziami wdrożeniowymi i danymi operacyjnymi.

Odpowiedź zależy od jakości weryfikacji. Anthropic tworzy modele i zatrudnia specjalistów zdolnych do oceny nietypowych awarii. Firma bez porównywalnej ekspertyzy może automatyzować tworzenie kodu szybciej, niż poprawia swoją zdolność do jego oceny.

Wyniki generowane przez AI mogą zatem pogłębiać różnice między organizacjami. Zespoły dysponujące mocnymi testami, dokumentacją, obserwowalnością i praktykami przeglądu mogą bezpieczniej delegować zadania. Zespoły o słabych fundamentach ryzykują generowanie błędów z większą szybkością.

Dlatego znaczenie ma również przeszukiwalny kontekst instytucjonalny. Agent potrzebuje dostępu do wymagań, wcześniejszych decyzji i ograniczeń technicznych. Utrzymywana AI knowledge base może pomóc ludziom analizować rozumowanie stojące za delegowaną pracą, choć nie zastąpi walidacji technicznej.

Dla nabywców korporacyjnych ogłoszenie Anthropic nie jest poleceniem automatyzacji wszystkiego. To dowód, że wspomagany przez AI rozwój przechodzi od indywidualnych sugestii do nadzorowanych przepływów pracy. Kwestia konkurencyjna dotyczy tego, jaką odpowiedzialność organizacja potrafi zweryfikować, a nie tylko tego, ile może delegować.

Czego liczby Anthropic nadal nie dowodzą

Anthropic pokazał szybko rosnący zakres pomocy, ale nie wykazał, że model samodzielnie projektuje, trenuje i zatwierdza swojego następcę.

Sformułowanie „budowanie samego siebie” łączy kilka odrębnych działań. Pisanie kodu aplikacji różni się od wyboru architektury modelu. Przeprowadzenie eksperymentu różni się od decyzji, czy jego wynik uzasadnia dużą inwestycję w trening.

Według Anthropic Claude wykonuje istotną pracę w całym tym spektrum. Ludzie nadal jednak zapewniają cele, kryteria oceny, dostęp do infrastruktury i uprawnienia do publikacji. Te mechanizmy kontroli sprawiają, że obecny proces nie kwalifikuje się jako w pełni rekurencyjne samodoskonalenie.

Kolejną kwestią jest jakość pomiarów. Większość kluczowych liczb pochodzi z wewnętrznych systemów Anthropic. Firma stworzyła kategorie zadań, zebrała sesje i oceniła wiele wyników przy użyciu sędziów opartych na Claude.

Sędziowie-modely mogą konsekwentnie przetwarzać duże zbiory danych, ale mogą dziedziczyć martwe punkty po systemach, które oceniają. Sesja może wydawać się udana, ponieważ testy przeszły pomyślnie, mimo że wprowadziła problemy z utrzymaniem, bezpieczeństwem lub architekturą poza zakresem testów.

Autorstwo kodu jest podobnie niejednoznaczne. Claude może wygenerować cały plik po szeroko zakrojonym ludzkim planowaniu. Alternatywnie badacz może podać krótki cel, a model sam określi implementację. Oba pliki są liczone jako stworzone przez AI, choć reprezentują różne poziomy niezależności.

Wskaźnik ośmiokrotnie większej produkcji również mierzy scalony kod, a nie zweryfikowaną wartość ekonomiczną. Inżynier generujący więcej kodu może rozwiązywać więcej problemów. Ten sam inżynier może jednak tworzyć więcej pracy przeglądowej i większe systemy, których utrzymanie staje się kosztowne.

Niezależne badania dostarczają użytecznego kontekstu, nie rozstrzygając jednak wewnętrznych twierdzeń Anthropic. Jeden artykuł roboczy z 2026 roku przeanalizował 7,8 miliona commitów współtworzonych z Claude oraz panel 5 838 deweloperów. Badanie powiązało adopcję z pracą obejmującą większą liczbę repozytoriów i technologii.

Jego developer study sugeruje, że agenci programistyczni mogą poszerzać zakres zadań podejmowanych przez ludzi. Publiczna aktywność na GitHub nie mierzy jednak wewnętrznych badań Anthropic nad modelami ani nie dowodzi rekurencyjnego ulepszania.

Niezawodność również różni się w zależności od zadania. Ustrukturyzowane problemy z jasnymi testami sprzyjają zautomatyzowanej iteracji. Otwarte pytania badawcze często nie mają obiektywnej oceny, przez co wiarygodnie brzmiące, lecz słabe wnioski mogą utrzymywać się dłużej.

Ograniczenia nakładają także zasoby obliczeniowe i infrastruktura fizyczna. Szybsze agenty mogą proponować i uruchamiać więcej eksperymentów, lecz trenowanie modeli frontier wymaga układów scalonych, energii, przepustowości sieciowej i starannie zarządzanych danych. Inteligencja nie jest jedynym ograniczonym zasobem.

Ludzki przegląd może stać się wąskim gardłem wraz ze wzrostem produkcji. Jeśli Claude generuje zmiany szybciej, niż specjaliści mogą je zbadać, Anthropic musi albo spowolnić wdrożenia, albo w większym stopniu polegać na automatycznej ocenie.

Tworzy to problem kolistej weryfikacji. Claude pisze kod, inny Claude go przegląda, a systemy oparte na Claude oceniają, czy zadania zakończyły się sukcesem. Ludzcy specjaliści pozostają ostatnią linią zabezpieczenia, lecz ich wgląd może maleć, gdy zautomatyzowany łańcuch staje się dłuższy.

Bezpieczeństwo podnosi stawkę. Agent z dostępem do repozytorium, klastra i poleceń może rozwiązywać trudne problemy operacyjne. Ten sam dostęp zwiększa konsekwencje wadliwego rozumowania, naruszonego kontekstu lub zmanipulowanych instrukcji.

Organizacje wdrażające podobne przepływy pracy potrzebują wąskich uprawnień, kompletnych logów, odtwarzalnych testów i jasnych ścieżek eskalacji. Potrzebują również osób, które pozostaną odpowiedzialne za zmiany produkcyjne, niezależnie od tego, kto wygenerował kod.

Sam Anthropic nie twierdzi, że Claude przekroczył próg autonomii. Jego bardziej uzasadniony argument brzmi, że dystans się zmniejsza. Wykonanie prac inżynieryjnych zostało silnie zautomatyzowane, podczas gdy osąd badawczy wykazuje wczesną, lecz ograniczoną poprawę.

To twierdzenie jest wystarczająco ważne bez przesady. System nie musi stać się niezależnym naukowcem, aby zmienić tempo i ekonomię rozwoju AI.

Trzy sygnały pokażą, czy pętla rzeczywiście się zamyka

Kolejny etap zależy od mierzalnych zmian w przywództwie badawczym, niezależnej walidacji i ludzkiej kontroli nad decyzjami o istotnych konsekwencjach.

Pierwszym sygnałem jest udział Claude w przywództwie nad badaniami i rozwojem modeli. Anthropic podał wzrost z zera w lutym do 26% w sierpniu 2026 roku. Przyszłe ujawnienia powinny pokazać, czy ta krzywa nadal rośnie, osiąga plateau czy się odwraca.

Dalszy wzrost wzmocniłby argument za skumulowanym przyspieszeniem, zwłaszcza jeśli zadania staną się mniej szczegółowo określone. Plateau sugerowałoby, że implementacja poprawiała się szybciej niż osąd badawczy. Spadek mógłby wskazywać na zmiany metod pomiaru, trudniejsze zadania lub problemy z niezawodnością.

Definicja przywództwa musi pozostać stała. W przeciwnym razie wyższy odsetek może odzwierciedlać zmianę klasyfikacji pracy, a nie większą niezależność. Anthropic powinien publikować przykłady obejmujące inżynierię, eksperymentowanie, interpretację i planowanie strategiczne.

Drugim sygnałem jest niezależna replikacja. Zewnętrzni ewaluatorzy potrzebują dostępu do reprezentatywnych zadań, kryteriów oceniania i wyników, bez otrzymywania wrażliwych tajemnic dotyczących rozwoju modeli. Porównywalne testy prowadzone w różnych laboratoriach byłyby bardziej miarodajne niż odosobnione wskaźniki publikowane przez firmy.

Replikacja powinna badać jakość kodu w czasie, a nie wyłącznie ukończenie zadań. Powinna mierzyć liczbę defektów, problemy bezpieczeństwa, obciążenie związane z utrzymaniem oraz częstotliwość interwencji człowieka. Zadania badawcze powinny sprawdzać, czy agenci wybierają produktywne kierunki, zanim poznają ostateczne wyniki.

Niezależne dowody mogłyby wzmocnić lub osłabić narrację Anthropic. Podobne wyniki uzyskane przez różnych ewaluatorów i w różnych środowiskach wspierałyby tezę o szerokiej zmianie możliwości. Duże rozbieżności pokazałyby, że znaczną część zgłaszanej wydajności napędzają wewnętrzne procesy pracy lub wybory dotyczące ewaluacji.

Trzecim sygnałem jest sposób, w jaki Anthropic radzi sobie z nadzorem człowieka wraz ze wzrostem wyników pracy. Firma już wskazuje przegląd jako potencjalne wąskie gardło. Jej reakcja pokaże, czy ludzie zachowają realną kontrolę, czy też coraz częściej będą zatwierdzać decyzje na podstawie automatycznych podsumowań.

Warto obserwować zmiany w wymaganiach dotyczących przeglądu, kontroli dostępu, procedur wdrażania i raportowania incydentów. Należy też śledzić, czy Claude zacznie wybierać cele badawcze, zamiast jedynie je realizować.

Rzeczywiste domknięcie pętli wymagałoby czegoś więcej niż wyższego odsetka autorstwa kodu. Claude musiałby proponować wartościowe kierunki badań, projektować wiarygodne ewaluacje, interpretować niejednoznaczne dowody i ulepszać swojego następcę przy ograniczonym wsparciu człowieka.

Nawet wtedy upoważnienie pozostaje odrębną kwestią od możliwości. Model mógłby stać się technicznie zdolny do kierowania większą częścią badań, podczas gdy Anthropic celowo zachowywałby zatwierdzanie przez człowieka. Decyzje dotyczące zarządzania określą, czy potencjalna autonomia stanie się autonomią operacyjną.

Dla programistów bezpośrednia lekcja ma charakter praktyczny. Programowanie przesuwa się w stronę specyfikacji, orkiestracji, testowania i przeglądu. Inżynierowie, którzy dogłębnie rozumieją systemy, mogą delegować więcej, jednocześnie rozpoznając sytuacje, w których pewny siebie wynik agenta jest błędny.

Nabywcy korporacyjni powinni pytać, co dostawcy mierzą, gdy deklarują autonomiczną pracę. Same wskaźniki ukończenia nie wystarczą. Kupujący potrzebują dowodów dotyczących nadzoru, cofania decyzji, defektów, audytowalności i odpowiedzialności po awariach.

Pracownicy wiedzy stoją przed podobną zmianą. AI może wykonywać więcej pracy wykonawczej, ale ludzie nadal potrzebują wiarygodnego kontekstu i zapisu ważnych decyzji. Narzędzia do łączenia wiedzy stają się użyteczne, gdy pomagają użytkownikom prześledzić dowody, zamiast jedynie generować kolejną odpowiedź.

Samodoskonalenie Anthropic Claude jest zatem realne w ograniczonym, lecz istotnym sensie. Claude już przyspiesza prace inżynieryjne i eksperymentalne, które prowadzą do powstania kolejnych modeli Claude. Firma nie wykazała jednak autonomicznego systemu, który niezależnie buduje swojego następcę.

Właśnie w luce między tymi stwierdzeniami rozegra się kolejny rozdział. Śledźcie odsetek przywództwa, domagajcie się niezależnej walidacji i analizujcie, kto nadal podejmuje nieodwracalne decyzje. Jeśli te trzy sygnały będą zmieniać się razem, „AI budujące AI” będzie opisywać system operacyjny, a nie nagłówek.

Pytanie dla każdej organizacji nie brzmi już, czy AI może wykonywać więcej pracy. Brzmi ono: czy ludzie potrafią zweryfikować tę pracę, zachować wiedzę specjalistyczną potrzebną do jej zakwestionowania oraz pozostać odpowiedzialni w miarę rozbudowy zautomatyzowanego łańcucha.

 
 

Zacznij bezpłatnie

Asystent AI działający przede wszystkim lokalnie, z funkcją zarządzania wiedzą osobistą

Aby zapewnić lepsze działanie AI,

remio obsługuje obecnie wyłącznie Windows 10+ (x64) i M-Chip Macs.

Twój partner AI w pracy
Zrób więcej z remio

Planuj. Twórz. Dostarczaj.
Wszystko w jednym miejscu.

bottom of page