top of page

Dane Anthropic i a16z mówią, że agenci przewyższają ludzi, ale benchmark skrywa trudniejszą rzeczywistość

11 sie
11 minut(y) czytania

Dane Anthropic i a16z plasują obecnie Claude Fable 5 na poziomie 85% w OSWorld-Verified, powyżej często przytaczanego wyniku 72,36% dla ludzi. Rok wcześniej najlepszy zgłoszony wynik agenta wynosił około 42%. Ten wzrost sugeruje, że agenci korzystający z komputera przekroczyli próg, który jeszcze niedawno wydawał się odległy.

Porównaniu temu towarzyszy jednak istotne zastrzeżenie. Wynik ludzi pochodził z pierwotnego badania OSWorld, podczas gdy rezultat 85% opiera się na zmienionej ocenie OSWorld-Verified. Liczby te opisują powiązane testy, ale nie tworzą kontrolowanego pojedynku między Claude Fable 5 a ludźmi.

To rozróżnienie ma znaczenie, ponieważ agenci komputerowi przechodzą od demonstracji do procesów pracy, w których błędy mają konsekwencje. OpenAI, Google, Anthropic i wyspecjalizowani deweloperzy chcą, by agenci obsługiwali przeglądarki, aplikacje desktopowe i systemy biznesowe. Wysoki wynik zmienia oczekiwania nabywców, nawet jeśli nie rozstrzyga, czy systemy te potrafią poradzić sobie ze zwykłym dniem pracy.

Dane Anthropic i a16z pokazują niezwykły roczny wzrost

Najważniejsza zmiana nie polega na tym, że jeden model osiągnął 85%. Chodzi o to, że trudny benchmark korzystania z komputera poprawił się z około 42% do 85% w ciągu mniej więcej roku.

Ranking agentów komputerowych wyróżniony przez a16z śledzi gwałtowny wzrost wyników w OSWorld-Verified. Claude Fable 5 prowadzi w zgłoszonych wynikach z rezultatem 85%. Wykres przedstawia interakcję z komputerem jako jeden z najszybciej rozwijających się obszarów stosowanej AI.

OSWorld sprawdza, czy agent potrafi wykonywać zadania w środowiskach prawdziwego oprogramowania. Zamiast odpowiadać na pytanie, agent musi przeanalizować ekran i zdecydować, co zrobić. Następnie wykonuje działania za pośrednictwem interfejsów przypominających sterowanie myszą i klawiaturą.

Zadanie może wymagać edycji dokumentu, zmiany ustawienia aplikacji, obsługi plików lub przenoszenia informacji między programami. Sukces zależy od czegoś więcej niż generowania języka. Agent musi rozpoznawać elementy interfejsu, zachowywać stan, planować kilka kroków i oceniać, czy jego działania przyniosły skutek.

Pierwotny benchmark OSWorld obejmował 369 zadań dotyczących aplikacji takich jak Chromium, LibreOffice, Thunderbird, GIMP, VLC i Visual Studio Code. Osiem zadań Google Drive można było wykluczyć, ponieważ wymagały ręcznej konfiguracji, co dawało ocenę obejmującą 361 zadań.

Badacze zgłosili najlepszy wskaźnik sukcesu modelu na poziomie 12,24%, gdy przedstawili benchmark w 2024 roku. Uczestnicy testu, którzy nie znali oprogramowania, ukończyli 72,36% zadań. Ta ogromna różnica uczyniła OSWorld użytecznym testem, ponieważ ujawniał słabości ukryte przez benchmarki konwersacyjne.

Agenci mieli trudności z osadzaniem w graficznym interfejsie użytkownika, czyli połączeniem celu wizualnego z właściwą lokalizacją na ekranie. Brakowało im również wiedzy operacyjnej o zachowaniu aplikacji. Model mógł rozumieć instrukcję, a mimo to kliknąć niewłaściwy element lub zgubić kontekst okna dialogowego.

Późniejsza inicjatywa OSWorld-Verified zajęła się wadliwymi lub niestabilnymi zadaniami z pierwotnego zbioru. Utrzymanie benchmarku ma znaczenie, ponieważ strony internetowe się zmieniają, aplikacje są aktualizowane, a skrypty oceniające mogą błędnie odczytywać prawidłowe wyniki. Czystszy test może mierzyć możliwości agentów bardziej konsekwentnie.

Zmiana benchmarku zmienia jednak także znaczenie jego wyników. Usuwanie uszkodzonych zadań poprawia wiarygodność, ale uniemożliwia proste porównanie historyczne, chyba że każdy starszy system zostanie uruchomiony ponownie w identycznych warunkach. Ustawienia agentów, limity działań, rozdzielczość ekranu i środowiska oceny również muszą się zgadzać.

Dlatego zmianę z 42% do 85% najlepiej rozumieć jako sygnał szybkiego postępu. Nie jest to kontrolowany szacunek, że agenci stali się dokładnie dwukrotnie bardziej zdolni. Trend jest wyraźny, ale jego precyzyjna skala pozostaje niepewna.

Wynik 85% nadal ma znaczenie. Systemy korzystające z komputera muszą wielokrotnie przekładać obserwacje wizualne na działania, więc błędy kumulują się w trakcie realizacji zadania. Podnoszenie wskaźników ukończenia wymaga poprawy percepcji, rozumowania, pamięci i odzyskiwania po błędach.

Sprawia to, że rezultat ma szersze znaczenie niż aktualizacja jakości modelu. Wskazuje, że deweloperzy coraz lepiej składają w całość cały cykl wykonawczy. Lepsze modele pomagają, ale na wynik wpływają też prompty, reprezentacje ekranu, kroki autorefleksji i wyspecjalizowane komponenty rozpoznające elementy interfejsu.

Porównanie Anthropic i a16z uchwytuje więc rzeczywistą zmianę. Agenci korzystający z komputera nie zawodzą już niemal automatycznie przy zwykłych zadaniach desktopowych. Trudniejsze pytanie brzmi, czy zaliczenie benchmarku pozwala teraz przewidywać niezawodną pracę poza jego kontrolowanym środowiskiem.

Nagłówek o poziomie ludzkim łączy dwa różne testy

Claude Fable 5 pozornie przewyższa znany ludzki punkt odniesienia, ale dostępne dowody nie ustanawiają równoważnego porównania człowieka z agentem.

Wynik 72,36% pochodzi z testów z udziałem ludzi przeprowadzonych na potrzeby pierwotnej publikacji OSWorld. Wynik 85% wiąże się z OSWorld-Verified, zmienionym zestawem zadań i procesem oceny. Traktowanie ich jako zamiennych usuwa kontekst metodologiczny stojący za obiema liczbami.

Nawet słowo „ludzki” wymaga doprecyzowania. Pierwotne badanie testowało osoby, które nie znały oprogramowania. Ich wynik nie był teoretyczną granicą ludzkiej wydajności. Doświadczeni użytkownicy, dodatkowy czas lub lepsze wdrożenie mogłyby przynieść inny rezultat.

Wynik agenta także zależy od warunków działania. Oceny systemów korzystających z komputera mogą różnić się rozdzielczością ekranu, dostępną historią działań, maksymalną liczbą kroków, polityką ponawiania prób i budżetem rozumowania. Agent, któremu pozwala się na więcej wnioskowania lub refleksji, może ukończyć więcej zadań, zużywając przy tym więcej czasu i zasobów obliczeniowych.

Wskaźniki zaliczenia mogą być również raportowane z jednej próby albo wielu prób. System, który odnosi sukces raz w kilku uruchomieniach, oferuje inne doświadczenie produktowe niż taki, który działa niezawodnie przy pierwszej próbie. Automatyzacja biznesowa zwykle wymaga drugiego zachowania.

Kolejną kwestią są dane dotyczące przebiegu działań. Zadania benchmarku i ślady udanych interakcji mogą wpływać na późniejsze trenowanie modeli lub projektowanie agentów. Ekspozycja nie unieważnia automatycznie wyniku, ale osłabia twierdzenie, że wynik mierzy ogólne kompetencje komputerowe.

Pierwotny zespół OSWorld ustalił, że dłuższa tekstowa historia przebiegu działań poprawiała wyniki. Historia ta dawała agentom więcej informacji o wcześniejszych decyzjach. Jednocześnie tworzyła wyzwania związane z wydajnością wraz ze wzrostem kontekstu rozumowania.

Znaczenie miała również rozdzielczość ekranu. Zrzuty ekranu o wyższej rozdzielczości ogólnie poprawiały wyniki, ponieważ modele mogły dokładniej lokalizować małe elementy sterujące. To ustalenie pokazuje, dlaczego dwie nominalnie podobne oceny mogą dawać odmienne wyniki, gdy ich środowiska nie są wyrównane.

Wynik 85% nadal oznacza istotny odsetek porażek. W przypadku 361 zadań, 15% wskaźnik niepowodzeń odpowiadałby około 54 nieudanym zadaniom, gdyby każde zadanie miało taką samą wagę. Ten szacunek ilustruje lukę operacyjną, choć raportowane protokoły benchmarków mogą agregować uruchomienia inaczej.

W eksperymencie konsumenckim okazjonalna porażka może być akceptowalna. W przypadku płac, zgodności z przepisami, administracji kontami lub danych klientów niepowodzenie w jednym zadaniu na siedem stanowi ograniczenie wdrożeniowe. Koszt zależy od tego, czy system bezpiecznie się zatrzyma, czy pozostawi po sobie nieprawidłowy stan.

Nie czyni to benchmarku bez znaczenia. OSWorld-Verified mierzy coś istotnego: czy agent potrafi wykonać ograniczoną instrukcję w skonfigurowanym środowisku komputerowym. Stanowi bardziej realistyczne wyzwanie niż statyczne odpowiadanie na pytania.

Problem zaczyna się wtedy, gdy sukces w tym teście staje się twierdzeniem o ogólnej autonomii w miejscu pracy. Rzeczywista praca obejmuje niejasne prośby, przerywane sesje, zmieniające się uprawnienia, brakujące informacje i konsekwencje, których nie da się zresetować przez uruchomienie nowej maszyny wirtualnej.

Ludzie wiedzą również, kiedy instrukcje kolidują z kontekstem. Proszą o wyjaśnienie, zauważają podejrzane zmiany i wnoszą do zadania wiedzę zewnętrzną. Agenci komputerowi często optymalizują działanie pod kątem wykonania pozornej instrukcji, nawet gdy właściwym krokiem jest zatrzymanie się.

Nagłówek Anthropic i a16z jest zatem kierunkowo użyteczny, lecz liczbowo kruchy. Mówi nam, że Claude Fable 5 i otaczający go system agentowy potrafią wykonać wiele ustandaryzowanych zadań desktopowych. Nie pokazuje, że system jest zdolniejszy od doświadczonego pracownika w rzeczywistych procesach pracy.

Rzetelniejsze twierdzenie o poziomie ludzkim wymagałoby, by ludzie i agenci podejmowali te same zweryfikowane zadania przy porównywalnych ograniczeniach. Badacze musieliby raportować ukończenie, czas, ponowienia prób, interwencje i szkodliwe błędy. Bez tych kontroli porównanie 85% z 72,36% pozostaje przyciągającym uwagę zestawieniem powiązanych pomiarów.

Agenci komputerowi wywierają teraz presję na każdą strategię automatyzacji

Wynik wywiera presję na firmy, które zbudowały automatyzację wokół API, skryptów i stałych procesów, ponieważ agenci działający na poziomie interfejsu mogą dotrzeć do oprogramowania, którego te metody nie obejmują.

Tradycyjna automatyzacja działa najlepiej, gdy system udostępnia ustrukturyzowane interfejsy. Deweloperzy łączą interfejs programowania aplikacji, czyli API, z inną usługą. Narzędzia do robotycznej automatyzacji procesów zamiast tego wykonują z góry zdefiniowane kroki i reguły interfejsu.

Oba podejścia mogą być skuteczne, ale prace integracyjne powodują trudności. Niektóre wewnętrzne narzędzia nie mają API. Starsze oprogramowanie może udostępniać niekompletne interfejsy, a niewielkie zmiany w procesie pracy mogą wymagać od dewelopera lub konsultanta przebudowy automatyzacji.

Agent korzystający z komputera oferuje inną drogę. Interpretuje te same ekrany, które widzi człowiek, a następnie działa za pośrednictwem istniejącego interfejsu. Teoretycznie pozwala to organizacji automatyzować oprogramowanie bez czekania, aż każdy dostawca udostępni dedykowaną integrację.

Anthropic wprowadził swoją funkcję korzystania z komputera właśnie wokół tej idei. Jego dokumentacja computer-use opisuje pętlę, w której aplikacja dostarcza zrzuty ekranu i wykonuje żądane działania myszy lub klawiatury. Model obserwuje każdy nowy stan przed wybraniem kolejnego działania.

Ta struktura jest atrakcyjna, ponieważ oddziela rozumowanie od wykonania. Firma może umieścić model w kontrolowanym środowisku i zdecydować, na jakie działania zezwolić. Agent nie potrzebuje nieograniczonego dostępu do fizycznego komputera pracownika.

Lepszy wynik OSWorld-Verified podnosi oczekiwany zwrot z budowy tej infrastruktury. System, który wykonuje mniej niż połowę zadań, wymaga stałego nadzoru. Przy 85% ukierunkowane wdrożenia zaczynają wyglądać bardziej wiarygodnie, zwłaszcza gdy niepowodzenia można łatwo wykryć.

Ta zmiana wywiera presję na kilka grup.

Dostawcy oprogramowania dla przedsiębiorstw muszą zdecydować, czy agenci powinni obsługiwać ich graficzne interfejsy, czy korzystać ze wspieranych API. Dostęp przez interfejs rozszerza zasięg, ale może tworzyć nieprzewidywalne obciążenie i omijać procesy produktowe zaprojektowane z myślą o ludzkiej kontroli.

Dostawcy automatyzacji muszą pokazać, dlaczego deterministyczne procesy pozostają wartościowe. Ich przewaga polega na powtarzalności, możliwości audytu i jawnych regułach. Agenci komputerowi konkurują dzięki radzeniu sobie ze zmiennością i nieustrukturyzowanymi instrukcjami.

Dostawcy modeli stoją pod presją, by poprawiać coś więcej niż dokładność w benchmarkach. Klienci potrzebują kontroli tożsamości, dzienników działań, granic uprawnień i niezawodnych sposobów przerywania wykonania. Model, który widzi właściwy przycisk, jest tylko jednym komponentem agenta gotowego do wdrożenia.

OpenAI i Google również konkurują w tym obszarze. Ich systemy wykorzystują różne kombinacje modeli wizualnych, przeglądarek, narzędzi i środowisk wykonawczych. Rankingi benchmarków mają znaczenie, ale zasięg produktu zależy od tego, jak bezpiecznie te komponenty współdziałają.

Twórcy wyspecjalizowanych agentów nadal mogą przewyższać model ogólnego przeznaczenia, zawężając środowisko. System zaprojektowany dla jednej aplikacji może obejmować niestandardowe parsery, reguły odzyskiwania i kontrole walidacyjne. Ogólne użycie komputera obejmuje więcej zadań, podczas gdy wyspecjalizowana automatyzacja może oferować większą przewidywalność.

Ten kompromis będzie kształtował wdrażanie. Agent ogólnego przeznaczenia może podczas jednej sesji przygotować wiadomość e-mail, zaktualizować arkusz kalkulacyjny i przesłać plik. Wyspecjalizowany system może obsługiwać jeden proces roszczeniowy, stosując bardziej rygorystyczne kontrole i zapewniając wyraźniejszą odpowiedzialność.

Przedsiębiorstwa powinny spodziewać się projektów hybrydowych. Agent może interpretować żądanie i poruszać się po nieznanych stanach, podczas gdy interfejsy API wykonują wrażliwe transakcje. Deterministyczne walidatory mogą sprawdzać wynik, zanim nastąpi jakiekolwiek nieodwracalne działanie.

Taki projekt ogranicza znaczenie pojedynczego rankingu. Użyteczne pytanie biznesowe nie brzmi, czy Anthropic computer use osiągnęło 85%. Chodzi o to, czy skonfigurowany system może realizować rozkład zadań firmy w granicach jej tolerancji ryzyka.

Organizacje potrzebują również dostępu do odpowiedniego kontekstu. Agent obsługujący oprogramowanie musi wiedzieć, który plik, rekord klienta, polityka lub wiadomość ma zastosowanie. Przeszukiwalna AI knowledge base może pomóc ludziom uporządkować ten kontekst, choć nie eliminuje potrzeby kontroli wykonania.

Nowy wynik benchmarku zmienia założenie wyjściowe. Kupujący nie muszą już pytać, czy automatyzacja na poziomie interfejsu w ogóle działa. Muszą określić, gdzie działa konsekwentnie, gdzie wymaga zatwierdzenia i gdzie API nadal pozostaje bezpieczniejsze.

Czego nie mierzy wynik 85%

Najmocniejsze dowody przeciwko szerokiej autonomii pochodzą z dłuższych zadań, w których agenci nadal tracą kontekst, przeoczają zmiany i nie weryfikują własnej pracy.

Oryginalne zadania OSWorld zwykle obejmowały około 30 działań. To wystarcza, by ujawnić błędy osadzenia w kontekście, ale nadal jest znacznie krótsze niż wiele profesjonalnych procesów pracy. Rzeczywiste zadania mogą obejmować kilka aplikacji, dokumentów, kont i punktów decyzyjnych.

OSWorld 2.0 zaprojektowano, aby testować to trudniejsze środowisko. Jego benchmark długiego horyzontu zawiera 108 procesów pracy z obszarów zawodowych i codziennych. Wykwalifikowana osoba potrzebuje średnio około 1,6 godziny, aby ukończyć zadanie.

Procesy obejmują badania, inżynierię, produkcję kreatywną, finanse, operacje, administrację, zgodność z przepisami i opiekę zdrowotną. Około 69,6% z nich zajmuje wykwalifikowanemu użytkownikowi ponad godzinę. Obejmują dynamiczne informacje, ukryty stan i fakty rozproszone po różnych źródłach.

Jeden z przykładów dotyczy składania wniosku o zwrot kosztów. Agent musi przeczytać instruktaż, sprawdzić rachunki, zweryfikować dane bankowe i e-mailowe, obsłużyć nową wiadomość, odzyskać informacje o pracowniku oraz rozwiązać niespójność. Poprawne kliknięcia są dopiero początkiem.

W OSWorld 2.0 najlepszy zgłoszony system ukończył 20,6% zadań według głównej binarnej metryki. Jego wynik częściowy osiągnął 54,8%, co oznacza, że często robił postępy, nie kończąc jednak poprawnie całego procesu pracy.

Wynik ten prowadzi do zasadniczego odwrócenia perspektywy. Agenci komputerowi mogą sprawiać wrażenie nadludzkich w krótszych, zweryfikowanych zadaniach, a jednocześnie pozostawać znacznie poniżej niezawodnej wydajności w długich zadaniach zawodowych. Oba ustalenia mogą być prawdziwe, ponieważ mierzą różne horyzonty.

Wydajność gwałtownie spadała wraz z wydłużaniem zadań. W przypadku procesów pracy trwających od 137 do 163 minut dla człowieka żaden testowany model nie przekroczył 10% binarnego ukończenia. Powyżej 163 minut zachowane modele nie ukończyły żadnego zadania.

Zmienił się także wzorzec porażek. Agenci nie zawodzili głównie dlatego, że nie potrafili obsłużyć podstawowej kontrolki. Tracili kontrolę nad ograniczeniami, przeoczali nowe informacje, zgadywali zamiast zadawać pytania i pomijali końcową weryfikację.

To poważne błędy w miejscu pracy. Pracownik często może natychmiast naprawić błędne kliknięcie. System, który zapomina o warunku polityki lub ignoruje zaktualizowaną wiadomość e-mail, może wygenerować rezultat wyglądający na ukończony, lecz merytorycznie niepoprawny.

Kolejna luka dotyczy efektywności. Badanie OSWorld-Human przeanalizowało, ilu kroków potrzebowali agenci w porównaniu z trajektoriami zaprojektowanymi przez ludzi. Stwierdzono, że czołowe systemy wykorzystywały znacznie więcej działań, niż było to konieczne.

Badacze wskazali również wywołania modeli do planowania, refleksji i oceniania jako główne źródła opóźnień. Kolejne kroki mogły trwać trzykrotnie dłużej niż początkowe, w miarę rozbudowy trajektorii. Więcej rozumowania poprawiało niektóre decyzje, jednocześnie spowalniając proces pracy.

W jednym przykładzie zmiana interlinii dwóch akapitów na podwójną zajęła agentowi 12 minut. Osoba z podstawowym doświadczeniem w obsłudze komputera mogłaby wykonać to samo działanie w mniej niż 30 sekund. Samo ukończenie nie oddawało praktycznej różnicy.

Badanie wykazało, że 23% analizowanych błędów wynikało ze słabego osadzenia wizualnego. Błędy te mogły dodać do zadania nawet 30 niepotrzebnych kroków. Zachowania naprawcze często zużywały zasoby, nie gwarantując poprawnego wyniku.

To w konstruktywny sposób komplikuje narrację anthropic a16z. Wynik 85% odzwierciedla rzeczywisty postęp w wykonywaniu zadań o krótkim horyzoncie. Nowsze dowody wskazują granicę, przy której postęp ten przestaje się przenosić.

Koszt pozostaje kolejnym pominiętym wymiarem. Agent może poprawić wskaźnik ukończenia, wykorzystując więcej tokenów wyjściowych, więcej prób lub głębszą refleksję. OSWorld 2.0 wykazał wyraźny kompromis między efektywnością tokenową a maksymalnym ukończeniem.

Najwyżej oceniana konfiguracja Claude korzystała ze znacznie większego budżetu wyjściowego niż bardziej efektywny system GPT. Kupujący potrzebują obu pomiarów, ponieważ najlepszy wynik benchmarku może nie zapewniać najlepszego rezultatu ekonomicznego na dużą skalę.

Bezpieczeństwa również nie da się uchwycić prostym procentem ukończenia. Agent może technicznie ukończyć zadanie, podejmując po drodze niedopuszczalne działanie. Może ujawnić wrażliwe informacje, zaakceptować nieoczekiwany prompt lub wprowadzić nieodwracalną zmianę bez zatwierdzenia.

Środowiska benchmarkowe rozpoczynają się także od kontrolowanych stanów. Komputery produkcyjne gromadzą powiadomienia, rozszerzenia, zapisane sesje, prośby o uprawnienia i różnice w interfejsie. Drobne różnice mogą zniszczyć strategię wykonania, która działała na standardowej maszynie wirtualnej.

Treści internetowe wprowadzają ryzyka o charakterze adversarialnym. Strona może zawierać tekst próbujący przekierować agenta lub zażądać danych uwierzytelniających. Systemy potrzebują niezawodnego rozróżnienia między instrukcją użytkownika a niezaufaną treścią wyświetlaną podczas zadania.

Agenci do obsługi komputera potrzebują zatem warstwowych zabezpieczeń. Organizacje mogą izolować sesje, ograniczać domeny, limitować uprawnienia, wymagać potwierdzenia i walidować wyniki za pośrednictwem odrębnych systemów. Kontrole te zmniejszają ryzyko, ale zawężają również znaczenie autonomicznego działania.

Wynik benchmarku powinien wyznaczać granice wdrożenia, a nie je zacierać. Najsilniejsze zastosowania w krótkim terminie są ograniczone, odwracalne i łatwe do skontrolowania. Działania o dużym wpływie nadal powinny przechodzić przez deterministyczne kontrole lub zatwierdzenie człowieka.

Trzy sygnały pokażą, czy wynik się przenosi

O kolejnym etapie zdecyduje ukończenie długich zadań, niezawodność przy pierwszej próbie oraz mierzalne wdrożenie produkcyjne, a nie kolejny odizolowany rekord rankingu.

Pierwszym sygnałem jest wydajność w OSWorld 2.0 lub innym porównywalnym benchmarku długiego horyzontu. Wynik Claude Fable 5 na poziomie 85% w OSWorld-Verified staje się znacznie bardziej przekonujący, jeśli ten sam model poprawi granicę ukończenia 20,6% w rozszerzonych procesach pracy.

Częściowy postęp nie wystarczy. Zadanie zawodowe często tworzy wartość tylko wtedy, gdy każdy wymagany krok zostanie ukończony i zweryfikowany. Badacze powinni wspólnie raportować binarne ukończenie, częściowe punkty, zużycie tokenów, liczbę działań i częstotliwość interwencji.

Duży wzrost w długich zadaniach wzmocniłby argument, że modele potrafią zachowywać cele i ograniczenia w zmieniających się środowiskach. Niewielki wzrost sugerowałby, że wynik 85% zależy przede wszystkim od krótszych, ograniczonych interakcji.

Drugim sygnałem jest niezawodność przy pierwszej próbie w ustandaryzowanych warunkach. Dostawcy powinni publikować liczbę uruchomień, limity działań, ustawienia rozumowania i mechanizmy ewaluacyjne stojące za ich wynikami. Niezależne powtórzenia uczyniłyby porównania modeli bardziej wiarygodnymi.

Wariancja ma znaczenie, ponieważ użytkownicy nie doświadczają średniej wydajności benchmarkowej. Doświadczają jednego wykonania naraz. System, który przeplata sukcesy porażkami, generuje koszty nadzoru, nawet gdy jego średni wynik wygląda dobrze.

Raporty powinny także oddzielać bezpośrednią wydajność modelu od ulepszeń wynikających z frameworka agentowego. Planista, mechanizm osadzania wizualnego, mechanizm ponawiania prób i weryfikator mogą podnieść końcowy wynik. Kupujący muszą wiedzieć, które komponenty przyniosły poprawę i czy mogą ją odtworzyć.

Konsekwentne wyniki pozytywne przy pierwszej próbie wzmocniłyby argument o poziomie ludzkim. Wyniki wymagające powtarzanych prób lub wyjątkowo dużych budżetów rozumowania osłabiłyby go w kontekście zwykłego wdrożenia.

Trzecim sygnałem są dowody produkcyjne z ograniczonych procesów biznesowych. Użyteczne raportowanie obejmowałoby wskaźniki ukończenia, średni czas wykonania, częstotliwość eskalacji oraz udział wyników poprawianych przez ludzi.

Najbardziej informacyjne wdrożenia będą dotyczyć oprogramowania bez wygodnych interfejsów API. To właśnie tam agenci na poziomie interfejsu oferują najwyraźniejszą przewagę nad konwencjonalną integracją. To również tam zmiany interfejsu mogą ujawnić ich kruchość.

Warto obserwować, czy organizacje rozszerzają zastosowanie agentów od obserwacji do działania. System, który zbiera informacje i przygotowuje wersję roboczą, niesie mniejsze ryzyko niż system wysyłający płatności, zmieniający uprawnienia lub kontaktujący się z klientami.

Rozszerzenie na działania o większym wpływie wskazywałoby na rosnące zaufanie do technologii i jej mechanizmów kontrolnych. Dalsze ograniczenie do wersji roboczych i zadań tylko do odczytu pokazałoby, że postęp benchmarkowy nie usunął obaw operacyjnych.

Dane Anthropic a16z zasługują na uwagę, ponieważ agenci do obsługi komputera poprawili się znacznie szybciej, niż sugerowały pierwotne wyniki OSWorld. Zgłoszony wynik Claude Fable 5 na poziomie 85% oznacza wiarygodną zmianę możliwości w krótkim horyzoncie.

Nie dowodzi on, że agenci przewyższają teraz ludzi w ogólnym korzystaniu z komputerów. Taki wniosek wymaga równoważnych testów, efektywnego wykonania, stabilnych pierwszych prób i sukcesów w długich procesach pracy.

Dla deweloperów i kupujących praktyczną odpowiedzią nie jest ani odrzucenie, ani natychmiastowa autonomia. Testujcie agentów na reprezentatywnych zadaniach, mierzcie każdą interwencję i oddzielajcie działania odwracalne od tych niosących konsekwencje. Następnie zadajcie pytanie, które ma znaczenie: czy wynik anthropic a16z wytrzymuje konfrontację z waszą rzeczywistą pracą?

 
 

Zacznij bezpłatnie

Asystent AI działający przede wszystkim lokalnie, z funkcją zarządzania wiedzą osobistą

Aby zapewnić lepsze działanie AI,

remio obsługuje obecnie wyłącznie Windows 10+ (x64) i M-Chip Macs.

Twój partner AI w pracy
Zrób więcej z remio

Planuj. Twórz. Dostarczaj.
Wszystko w jednym miejscu.

bottom of page