Holo4: napędzanie generalistycznych agentów do obsługi komputerów, ale luka benchmarkowa nadal ma znaczenie
Holo4 zadebiutował 28 września z dwoma modelami, czterema trybami interakcji i bezpośrednim wyzwaniem rzuconym wyspecjalizowanym systemom obsługi komputerów. H Company opisuje Holo4: napędzanie generalistycznych agentów do obsługi komputerów jako rodzinę modeli, która potrafi poruszać się po ekranach, wykonywać kod i wywoływać narzędzia programowe.
Premiera ma znaczenie, ponieważ automatyzacja pracy na komputerze rzadko pozostaje w obrębie jednego interfejsu. Proces biznesowy może zacząć się w przeglądarce, przejść przez API, a zakończyć w oprogramowaniu desktopowym bez nowoczesnych integracji. Większość systemów agentowych radzi sobie z takim przejściem, łącząc różne modele, narzędzia i pętle sterowania.
Holo4 proponuje prostszą drogę. Ten sam model może wybierać między interfejsami graficznymi, kodem, narzędziami Model Context Protocol i API. MCP to standard, który pozwala systemom AI uzyskiwać dostęp do zewnętrznych narzędzi i danych za pośrednictwem ustrukturyzowanych połączeń.
Ta obietnica stawia Holo4 naprzeciw architektury specjalistycznej, a nie jedynie kolejnego dostawcy modeli. Podejście specjalistyczne przypisuje różne modele lub polityki do nawigacji wizualnej, programowania i wywoływania narzędzi. H Company twierdzi, że jeden wyszkolony generalista może skuteczniej koordynować te obszary.
Firma udostępniła też do wglądu tysiące trajektorii benchmarkowych. Ta przejrzystość daje programistom więcej dowodów niż sam wynik z rankingu. Nie rozstrzyga jednak kwestii niezawodności, bezpieczeństwa ani działania w rzeczywistych organizacjach.
Holo4: napędzanie generalistycznych agentów do obsługi komputerów w czterech interfejsach
Kluczowa zmiana ma charakter architektoniczny: Holo4 traktuje interfejs jako wybór w ramach zadania, a nie stałą granicę wokół agenta.
Według premiery Holo4 rodzina obejmuje gęsty model z 27 miliardami parametrów oraz 35-miliardowy model mixture-of-experts. Ten drugi aktywuje około trzech miliardów parametrów w każdym kroku inferencji.
Model mixture-of-experts kieruje dane wejściowe przez wybrane komponenty wewnętrzne zamiast aktywować każdy parametr. Taka konstrukcja może ograniczać obliczenia, choć rzeczywista szybkość zależy od sprzętu, oprogramowania i decyzji wdrożeniowych.
Oba modele Holo4 mogą działać z graficznymi interfejsami użytkownika, pisać i wykonywać kod oraz wywoływać narzędzia MCP lub API. H Company twierdzi, że ten sam model może obsługiwać komputery desktopowe, strony internetowe, urządzenia z Androidem, piaskownice programistyczne i systemy biznesowe.
Różni się to od agenta, który wyłącznie przewiduje kliknięcia myszy na podstawie zrzutów ekranu. Różni się też od modelu wywołującego narzędzia, który staje się nieskuteczny, gdy aplikacja nie ma API. Holo4 zaprojektowano tak, aby zmieniał metody wraz ze zmianą przepływu pracy.
Rozważmy rutynową operację finansową. Agent może wyodrębnić pola z dokumentu, znormalizować je kodem, przesłać przez API i zweryfikować wynik na ekranie. Starsze oprogramowanie korporacyjne mogłoby wymusić kolejne przejście do sterowania myszą i klawiaturą.
Model generalistyczny mógłby zachować jeden proces decyzyjny na wszystkich tych etapach. Stos specjalistów zwykle kierowałby każdy etap do osobnego modelu, polityki lub usługi. Takie kierowanie może poprawić kontrolę, ale wprowadza też więcej przekazań i punktów awarii.
H Company podaje, że szkoliło Holo4 poprzez uczenie nadzorowane i uczenie ze wzmocnieniem w generowanych środowiskach interaktywnych. Jego wewnętrzna fabryka zadań miała stworzyć około 10 000 zadań obejmujących aplikacje internetowe, komputery desktopowe, serwery MCP i środowiska hybrydowe.
Te generowane zadania są istotne, ponieważ statyczne przykłady nie potrafią odtworzyć konsekwencji działań agenta. Interaktywne środowisko może sprawdzić, czy kliknięcie zmieniło stan, czy kod został wykonany albo czy wywołanie API utworzyło zamierzony rekord.
Podejście pozwala także H Company generować zadania na podstawie dokumentacji i zrzutów ekranu. Mogłoby to poszerzyć zakres treningu bez ręcznego projektowania każdego przepływu pracy. Jednak generowane środowiska nadal mogą różnić się od chaotycznych systemów produkcyjnych z uprawnieniami, opóźnieniami i nieoczekiwanymi stanami.
Premiera obejmuje zaktualizowany model Holotron4 Nano wraz z dwoma głównymi wariantami Holo4. Oferuje też wagi modeli w kilku formatach, w tym BF16, FP8, NVFP4 i czterobitowym GGUF.
Dostępność tych formatów daje programistom kilka opcji wdrożenia. Mimo to ważniejsze pozostaje twierdzenie, że jeden model może koordynować wiele interfejsów bez zewnętrznej warstwy wyboru modelu.
To sprawia, że Holo4: napędzanie generalistycznych agentów do obsługi komputerów jest sprawdzianem tego, czy ogólność interfejsowa może ograniczyć złożoność systemu bez poświęcania precyzji oferowanej przez wyspecjalizowanych agentów.
Dlaczego długie przepływy pracy wywierają presję na stosy wyspecjalizowanych agentów
Holo4 wywiera presję na stosy specjalistów, ponieważ długie przepływy pracy zwielokrotniają koszt każdej decyzji o routingu, przekazania kontekstu i kroku odzyskiwania sprawności.
Krótkie zadanie w przeglądarce może ukrywać słabości architektoniczne. Agent może otworzyć jedną stronę, wprowadzić wartość i wysłać formularz. Nawet kruchy system czasem wykona taką sekwencję.
Praca zawodowa wygląda inaczej. Obejmuje kilka aplikacji, trwały stan, niejednoznaczne instrukcje i informacje pojawiające się podczas wykonywania zadania. Agent musi pamiętać wcześniejsze ograniczenia, dostosowując się do późniejszych zdarzeń.
OSWorld 2.0 zaprojektowano z myślą o tym trudniejszym środowisku. Jego badacze zebrali 108 długoterminowych przepływów pracy obejmujących zadania codzienne i zawodowe. Wykwalifikowany człowiek potrzebuje medianowo około 1,6 godziny na ukończenie każdego zadania.
Benchmark wskazuje, że czołowi agenci mogą wykonywać średnio ponad 300 kroków na przepływ pracy. Zadania OSWorld 1.0 wymagały około 30 kroków, przez co nowszy benchmark jest znacznie surowszym testem zarządzania kontekstem.
Awarie wykraczają też poza niedokładne klikanie. Badacze zaobserwowali, że agenci gubili ograniczenia, pomijali napływające informacje, zgadywali, gdy konieczne było doprecyzowanie, oraz rezygnowali z weryfikacji. Te słabości mogą kumulować się w długim procesie.
H Company twierdzi, że w odpowiedzi na te problemy przebudowało środowisko wykonawcze agenta Holo4. Harness to pętla wykonawcza, która dostarcza obserwacje, zarządza kontekstem, uruchamia działania i zwraca wyniki do modelu.
Dwa najbardziej zauważalne dodatki to trwała pamięć na setki kroków oraz powłoka działająca na komputerze desktopowym. Powłoka daje agentowi ścieżkę opartą na kodzie, gdy bezpośrednia interakcja z GUI staje się nieefektywna.
W tym miejscu projekt generalistyczny staje się czymś więcej niż listą funkcji. Model może uznać, że przeanalizowanie lokalnego pliku kodem jest lepsze niż odczytywanie go wizualnie. Następnie może wrócić do interfejsu, by wykonać działania wymagające wizualnego potwierdzenia.
Stos specjalistów może wykonać tę samą sekwencję. Musi jednak zdecydować, kiedy przekazać kontrolę i ile kontekstu powinno towarzyszyć każdemu przekazaniu. Błędny wybór routingu może zmarnować kroki lub odrzucić informacje.
Holo4 próbuje umieścić tę decyzję wewnątrz wytrenowanego modelu. Jeśli podejście będzie działać konsekwentnie, programiści mogą ograniczyć logikę potrzebną do koordynowania kontroli przeglądarki, pulpitu, wykonywania kodu i narzędzi ustrukturyzowanych.
Nie eliminuje to orkiestracji. Systemy produkcyjne nadal potrzebują zarządzania poświadczeniami, sandboxingu, ponownych prób, rejestrowania i bramek zatwierdzania. Potrzebują też niezawodnego sposobu zatrzymania agenta, zanim niepewne działanie spowoduje szkody.
Zmiana jest węższa, ale nadal znacząca. Programiści mogliby poświęcać mniej wysiłku na decydowanie, który model powinien obsłużyć dany interfejs. Mogliby bardziej skupić się na definiowaniu uprawnień, walidowaniu wyników i mierzeniu kompletnych przepływów pracy.
To rozróżnienie ma znaczenie dla zespołów budujących przeszukiwalną bazę wiedzy. Ich przepływy pracy często obejmują lokalne dokumenty, wyszukiwanie wewnętrzne, narzędzia przeglądarkowe i ustrukturyzowane systemy firmowe.
Holo4 nie dowodzi, że generalistyczne modele zastąpią każdego specjalistę. Sprawia raczej, że routing specjalistów staje się wyborem projektowym, który programiści muszą uzasadnić, a nie nieuniknionym fundamentem.
Jeden model agenta jest prostszy, ale specjaliści nadal wyznaczają poprzeczkę niezawodności
Główna rywalizacja toczy się między jednym modelem generalistycznym a skoordynowanym stosem specjalistów, a o tym, która architektura zwycięży, zdecyduje niezawodność.
Specjaliści oferują intuicyjną przewagę. Model szkolony wąsko pod kątem wizualnego osadzania może skupić się na lokalizowaniu kontrolek. Model programistyczny może koncentrować się na składni, wykonywaniu i debugowaniu bez interpretowania każdego zrzutu ekranu.
Modele wywołujące narzędzia korzystają również z ustrukturyzowanych schematów. API udostępnia dozwolone działania i przewidywalne pola. Interfejs graficzny zapewnia większą elastyczność, ale jego przyciski, układy i przejściowe stany tworzą niejednoznaczność.
Podejście specjalistyczne pozwala inżynierom wybrać najlepszy model dla każdej powierzchni interakcji. Może też izolować ryzykowne możliwości. Agent wizualny może otrzymać dostęp do ekranu bez uzyskania możliwości dowolnego wykonywania poleceń powłoki.
Specjalizacja przenosi jednak złożoność do otaczającego systemu. Router musi klasyfikować każdy etap, wybierać komponent i zachowywać intencję użytkownika między przekazaniami. Stos musi uzgadniać różne formaty kontekstu i sygnały awarii.
Generalistyczna ścieżka Holo4 przenosi część tej koordynacji do modelu. Agent może spojrzeć na ekran, rozpoznać, że bezpośrednia manipulacja jest nieefektywna, i zamiast tego użyć kodu lub ustrukturyzowanego narzędzia.
H Company ilustruje to podejście zadaniami w profesjonalnym oprogramowaniu. W jednym przykładzie Holo4 27B miał użyć 68 wywołań i 2,4 miliona tokenów do stworzenia autonomicznej gry w Godot. Jego baza Qwen użyła 197 wywołań i 11,4 miliona tokenów przy tym samym promptcie i harnessie.
Dane te pochodzą z własnej ewaluacji H Company, a nie z niezależnego laboratorium. Opisują jedno zadanie, a nie średnią wydajność produkcyjną. Mimo to pokazują rodzaj efektywności, jaki firma chce osiągnąć dzięki Holo4.
Inne przykłady dotyczą konstruowania szczegółowych obiektów w FreeCAD. Te przepływy pracy łączą interpretację przestrzenną, kontrolę oprogramowania i generowanie kodu. Są bardziej wymagające niż wypełnienie pojedynczego formularza internetowego.
Przykłady ujawniają również ograniczenie. Zadanie Holo4 polegające na stworzeniu Wieży Eiffla miało wymagać 84 wywołań i 1,3 miliona tokenów. Długie sesje obsługi komputera mogą pozostawać kosztowne obliczeniowo nawet wtedy, gdy końcowy rezultat jest pomyślny.
Specjaliści zachowują kolejną przewagę, gdy przepływ pracy jest przewidywalny. Deterministyczny skrypt lub wąska integracja API może być szybsza i łatwiejsza do audytu niż agent wybierający spośród kilku możliwych działań.
Argument za generalistą staje się silniejszy, gdy przepływy pracy się różnią, interfejsy się zmieniają lub starsze systemy nie mają integracji. Argument za specjalistami pozostaje silniejszy, gdy organizacje potrzebują powtarzalności i potrafią precyzyjnie zdefiniować proces.
Oznacza to, że Holo4 raczej nie wyeliminuje konwencjonalnej automatyzacji. Zamiast tego konkuruje o niepewny środek, w którym stałe skrypty zawodzą, ale nieograniczeni agenci frontierowi pozostają zbyt kosztowni lub trudni do zarządzania.
Programiści powinni więc oceniać kompletne zadania, a nie pojedyncze kliknięcia. Istotne pytanie brzmi, czy Holo4 ogranicza awarie i nakład pracy inżynieryjnej w rzeczywistych przepływach pracy.
Model, który osiąga prawidłowy stan końcowy dzięki mniejszej liczbie przekazań, może uzasadniać niższą surową precyzję w jednej wąskiej umiejętności. Generalista, który nieprzewidywalnie zmienia metody, może stworzyć większe obciążenie związane z debugowaniem.
Wynik będzie zależał od jakości trajektorii, odtwarzalności i zachowania podczas odzyskiwania sprawności. Czynniki te są ważniejsze niż to, czy jedna architektura wygląda czyściej na diagramie.
Wyniki benchmarków Holo4 wymagają uwzględnienia harnessów i przypisów
Wyniki Holo4 są godne uwagi, ale sama premiera wyjaśnia, dlaczego kilka kluczowych porównań nie jest bezpośrednio równoważnych.
H Company podaje, że Holo4 27B uzyskał 61,7 procent w OSWorld 2.0. Model 35B-A3B osiągnął 30,9 procent. Firma porównuje te wyniki z 81,8 procent dla Opus 5.5.
Różnica 20,1 punktu między Holo4 27B a Opus 5.5 jest znacząca. Holo4 nie przewodzi najsilniejszemu zamkniętemu modelowi w tej raportowanej miarze. Argument firmy koncentruje się na rozmiarze modelu, elastyczności wdrożenia i szacowanym koszcie realizacji zadań.
H Company przytacza także wyniki 70,2 procent dla Opus 5 oraz 66,2 procent dla GPT-5.6 Sol. Te odniesienia wykorzystują częściowe nagrody przy maksymalnym wysiłku na offline’owym zestawie OSWorld 2.0 z 8 sierpnia 2026 roku.
W komunikacie zastrzeżono, że różnią się wersje modeli, harnessy i podzbiory zadań. To ostrzeżenie powinno towarzyszyć każdemu porównaniu. Wydajność agentów zależy od znacznie większej liczby czynników niż sam checkpoint modelu.
Harness kontroluje pamięć, dostęp do narzędzi, formatowanie obserwacji, zachowanie przy ponownych próbach i maksymalną liczbę kroków. Zmiana którejkolwiek z tych zmiennych może zmienić wynik, nawet gdy bazowy model pozostaje bez zmian.
Wykresy kosztów wymagają podobnej ostrożności. H Company oszacowała wydatki na podstawie tokenów wejściowych i wyjściowych użytych podczas każdego uruchomienia. Holo4 wyceniono według własnych stawek API, a dla pozostałych modeli użyto zewnętrznych cen katalogowych.
Takie szacunki mogą wspierać planowanie wewnętrzne, ale nie są kontrolowanymi pomiarami ekonomicznymi. Założenia dotyczące cache’owania, infrastruktury inferencyjnej, ponownych prób i rabatów wolumenowych mogą zmienić rzeczywiste koszty wdrożenia.
AutomationBench wprowadza kolejną kwestię porównywalności. H Company oceniła Holo4 i bazowe modele Qwen w wersji 1.0.6 we własnym wewnętrznym harnessie. Wyniki innych modeli pochodziły z publicznego zestawu benchmarku.
Przywołane dane kosztowe dla innych modeli pochodziły z rankingu korzystającego z prywatnego zestawu. H Company deklaruje, że poda wyniki Holo4 w tej prywatnej ewaluacji po przeprowadzeniu testów.
Do tego czasu czytelnicy nie powinni traktować wszystkich punktów AutomationBench jako rezultatów jednego kontrolowanego eksperymentu. Są to powiązane pomiary uzyskane w różnych warunkach.
Nawet definicje benchmarków mogą kształtować narrację. OSWorld 2.0 obsługuje punktację binarną za ukończenie oraz punktację częściową. Model może otrzymać istotne częściowe punkty, mimo że nie zrealizował kompletnego przepływu pracy.
Nie oznacza to, że punktacja częściowa jest bezużyteczna. Może ujawniać postęp w długich zadaniach, w których binarny sukces ukrywałby ulepszenia. Kupujący jednak interesuje, czy końcowy rekord, plik lub transakcja są poprawne.
Efektywność również wymaga czegoś więcej niż liczby tokenów. Badanie dotyczące efektywności agentów wykazało, że wiodący agenci do obsługi komputerów wykonywali w ewaluacji od 1,4 do 2,7 razy więcej kroków niż było to konieczne.
To samo badanie wykazało, że późniejsze kroki mogą trwać znacznie dłużej niż wcześniejsze. Wywołania planowania i refleksji odpowiadały za dużą część opóźnień. Długi ślad agenta może więc zwiększać opóźnienia bardziej, niż sugeruje widoczna liczba działań.
Wyniki te wzmacniają nacisk H Company na pamięć i dostęp do powłoki. Pokazują też, dlaczego udany wynik benchmarkowy nie przekłada się automatycznie na akceptowalne doświadczenie użytkownika.
Uczciwa interpretacja nie polega ani na odrzuceniu, ani na bezkrytycznej akceptacji. Holo4 osiąga konkurencyjny, raportowany przez firmę wynik dla stosunkowo kompaktowego modelu, jednocześnie ustępując wiodącemu systemowi zamkniętemu.
Praktycznym testem będzie to, czy wyniki te utrzymają się w niezależnych harnessach, prywatnych ewaluacjach i przepływach pracy zawierających specyficzne dla organizacji uprawnienia oraz dane.
Otwarte trajektorie poprawiają weryfikowalność, a nie bezpieczeństwo
Najsilniejszym ruchem H Company na rzecz wiarygodności jest udostępnienie śladów stojących za wynikami, choć możliwość inspekcji zachowania nie oznacza automatycznie bezpieczeństwa.
Zbiór trajectory dataset zawiera 7 366 uruchomień Holo4 27B i Holo4 35B-A3B. Każdy ślad może obejmować zadanie, rozumowanie, działania, wyniki narzędzi, zrzuty ekranu, czas trwania, kroki i końcowy wynik.
Kolekcja obejmuje ponad 2 100 uruchomień OSWorld dla obu modeli. Zawiera także 212 uruchomień OSWorld 2.0 i niemal 3 200 uruchomień AutomationBench.
Dodatkowe ślady obejmują AndroidWorld, PinchBench i Agents’ Last Exam. H Company pozwala użytkownikom pobrać zbiór danych lub odtworzyć ślady w dedykowanej przeglądarce.
To ujawnienie daje badaczom kilka sposobów na podważenie wniosków firmy. Mogą sprawdzić, czy udane uruchomienie wykorzystywało rozsądną ścieżkę, powtarzało niepotrzebne działania lub korzystało ze skrótów specyficznych dla zadania.
Mogą też analizować wzorce porażek. Zagregowany wynik nie pokaże, czy agent źle zrozumiał instrukcję, kliknął niewłaściwy cel, utracił kontekst czy zatrzymał się przed weryfikacją.
Otwarte trajektorie mogą ujawnić, czy poprawa wydajności wynika z lepszego rozumowania, czy z bardziej pobłażliwego harnessu. Mogą także pomóc zespołom oszacować, jak często konieczna może być interwencja człowieka.
Przejrzystość po wykonaniu działania różni się jednak od kontroli przed jego wykonaniem. Ślad pomaga badaczom zrozumieć, co się wydarzyło. Nie zapobiega wysyłaniu danych przez agenta, usuwaniu plików ani wykonywaniu złośliwych instrukcji.
Agenci korzystający z komputerów mierzą się z ryzykiem, którego unikają konwencjonalne systemy czatowe. Działają w środowiskach zawierających niezaufane treści i cenne poświadczenia. Strona internetowa może umieścić tekst adversarialny bezpośrednio w obserwacji modelu.
Benchmark OS-Harm testuje celowe nadużycia, prompt injection i niezamierzone zachowanie modeli w 150 zadaniach. Jego badacze stwierdzili istotne niebezpieczne zachowania w kilku systemach frontierowych.
Badanie to nie oceniało Holo4, więc jego wyniki nie mogą potwierdzać bezpieczeństwa Holo4. Pokazuje jednak, że sprawne sterowanie komputerem i bezpieczne sterowanie komputerem to odrębne problemy ewaluacyjne.
Ryzyko staje się większe, gdy jeden model ma szeroki dostęp do interfejsów. Generalista może przejść od czytania strony internetowej do uruchamiania kodu lub wywoływania API. Ta elastyczność zwiększa użyteczność, ale także potencjalne skutki błędu.
Przedsiębiorstwa będą potrzebować wielowarstwowych mechanizmów kontroli niezależnie od wyników benchmarków. Obejmują one ograniczone poświadczenia, izolowane wykonywanie, ograniczony dostęp do sieci, odwracalne działania oraz zatwierdzanie przez człowieka istotnych kroków.
Będą również potrzebować dzienników łączących każde działanie z instrukcją użytkownika i stanem zaobserwowanym w danej chwili. Format trajektorii Holo4 oferuje użyteczny model takich zapisów audytowych.
Na uwagę zasługuje również licencjonowanie. Otwarte wagi nie gwarantują identycznych praw komercyjnych dla każdego checkpointu ani komponentu. Zespoły powinny przeanalizować każdą kartę modelu i zależność przed wdrożeniem.
To samo dotyczy zarządzania danymi. Zrzuty ekranu i ślady agentów mogą przechwytywać dane osobowe, rekordy klientów lub poufne dokumenty. Rejestrowanie wszystkiego może ułatwić debugowanie, ale jednocześnie tworzy kolejny wrażliwy zbiór danych.
H Company podaje, że poświadczenia, wewnętrzne hosty i dane osobowe zostały zamaskowane w publicznym wydaniu trajektorii. Operatorzy środowisk produkcyjnych muszą stworzyć równoważne mechanizmy redakcji i retencji dla własnych śladów.
Otwarty zbiór danych podnosi poprzeczkę dla przyszłych premier. Dostawcy deklarujący lepszą wydajność w obsłudze komputerów mają teraz wyraźniejszy przykład tego, jak mogą wyglądać odtwarzalne dowody.
Mimo to najcenniejsza praca zewnętrzna będzie obejmować adversarialne odtwarzanie, niezależną punktację i testy poza harnessem H Company. Przejrzystość otwiera ten proces; nie kończy go.
Trzy sygnały pokażą, czy zakład Holo4 na generalistę się sprawdzi
Kolejny etap należy oceniać przez niezależną reprodukcję, wyniki prywatnych benchmarków oraz dowody z produkcyjnych przepływów pracy.
Pierwszym sygnałem jest niezależna reprodukcja wydajności Holo4 w OSWorld 2.0. Badacze muszą uruchomić udostępnione wagi z udokumentowaną infrastrukturą, promptami, limitami kroków i zasadami punktacji.
Odtworzenie raportowanego wyniku 61,7 procent wzmocniłoby twierdzenie H Company, że to sam model zapewnia tę zdolność. Duże różnice sugerowałyby, że harness firmy wnosi więcej, niż wskazuje nagłówek.
Reprodukcja powinna także porównywać binarne ukończenie, częściowe punkty, kroki, opóźnienia i wskaźniki interwencji. Jeden wynik nie oddaje tego, czy agent osiąga użyteczny rezultat w praktycznych ograniczeniach.
Udostępnione trajektorie ułatwiają tę pracę. Badacze mogą zacząć od znanych uruchomień, badać granice porażek i porównywać alternatywne harnessy na tych samych zadaniach.
Drugim sygnałem będzie prywatny wynik Holo4 w AutomationBench. Komunikat przyznaje, że obecne wyniki pochodzą z wewnętrznego uruchomienia na publicznym zestawie, podczas gdy koszty porównawcze odnoszą się do rankingu prywatnego zestawu.
Prywatna ewaluacja stworzyłaby czystsze porównanie i zmniejszyłaby obawy o dostrajanie pod widoczne zadania. Sprawdziłaby także, czy Holo4 generalizuje się na nieznane przepływy pracy API.
Wynik powinien obejmować więcej niż wskaźnik sukcesu. Deweloperzy potrzebują danych o kosztach, użyciu tokenów, ponownych próbach, opóźnieniach i kategoriach błędów w ramach jednej udokumentowanej konfiguracji ewaluacyjnej.
Trzecim sygnałem będą wiarygodne dowody produkcyjne z przepływów pracy wykorzystujących mieszane interfejsy. Najlepsze przypadki obejmowałyby zadania, które rzeczywiście wymagają GUI, kodu i ustrukturyzowanych narzędzi w ramach jednej sesji.
Przydatne raportowanie pokazywałoby ukończenie bez korekty człowieka, odzyskiwanie sprawności po zmianach interfejsu oraz działanie przy ograniczonych uprawnieniach. Powinno również liczyć nieodwracalne błędy, a nie tylko udane uruchomienia.
Reprezentatywnym testem jest przepływ pracy związany z przetwarzaniem wydatków. Agent musi odczytać dokumenty, zweryfikować pola, wchodzić w interakcję z oprogramowaniem biznesowym i potwierdzić, że rekordy osiągnęły zamierzony stan.
Inny mocny test obejmowałby operacje inżynieryjne dotyczące lokalnych plików, trackerów zgłoszeń, konsol przeglądarkowych i narzędzi wiersza poleceń. Takie przepływy pracy ujawniają, czy wspólny kontekst jest zaletą, czy źródłem niekontrolowanego zachowania.
Aktualizacje modelu zapewnią powiązany sygnał. H Company podaje, że planowane są zoptymalizowane checkpointy drafterów, aby przyspieszyć inferencję. Zmierzone redukcje opóźnień wzmocniłyby ekonomiczny argument za architekturą generalistyczną.
Reakcje konkurentów również mają znaczenie, ale pozostają dowodami wspierającymi. Dostawcy modeli zamkniętych mogą poprawić obsługę komputerów, a twórcy modeli otwartych mogą dodać szersze szkolenie narzędziowe do własnych wydań.
Centralne pytanie nie brzmi, czy Holo4 pozostanie przed każdą alternatywą. Chodzi o to, czy pojedynczy model generalistyczny zapewnia lepszy stosunek niezawodności do złożoności niż zestaw modeli wyspecjalizowanych.
Dla deweloperów natychmiastową szansą jest kontrolowana ewaluacja. Korzystajcie z reprezentatywnych zadań, ograniczonych poświadczeń i odwracalnych środowisk. Mierzcie ukończone rezultaty, a nie izolowane działania modelu.
Dla nabywców korporacyjnych pytanie zakupowe powinno uwzględniać harness. Zapytajcie, który komponent zarządza pamięcią, zatwierdzeniami, ponownymi próbami, sekretami, dziennikami audytowymi i odzyskiwaniem po częściowym wykonaniu.
Dla pracowników wiedzy premiera sugeruje, że agenci będą przekraczać coraz więcej granic między aplikacjami. Ta wygoda sprawia również, że projektowanie uprawnień i widoczne potwierdzenia stają się ważniejsze.
Holo4: powering generalist computer-use agents jest więc mniej deklaracją zwycięstwa, a bardziej konkretnym wyzwaniem architektonicznym. H Company dostarczyła modele, deklaracje i wyjątkowo szczegółowe ślady.
Kolejny ruch należy do niezależnych ewaluatorów i zespołów wdrożeniowych. Czy Holo4 potrafi odtworzyć raportowane wyniki, przetrwać nieznane zadania i wykonywać rzeczywistą pracę bez zwiększania ryzyka operacyjnego?
Te trzy testy określą, czy generalistyczni agenci do obsługi komputerów uproszczą automatyzację, czy jedynie przeniosą jej najtrudniejsze problemy.



