top of page

Xenon Hunmin VLM 397B jest otwarty, ale Qwen-CUA wciąż wygrywa trudniejszy test

1 dzień temu
12 minut(y) czytania

Xenon udostępnił Hunmin VLM 397B jako open source, dając modelowi o 397 miliardach parametrów nowe możliwości sterowania komputerem po treningu na ośmiu GPU Nvidia B200. Wydanie udostępnia rozpoznawanie ekranów, klikanie, pisanie i wieloetapową pracę na pulpicie na licencji Apache 2.0. Własne wyniki Xenona ujawniają jednak istotną różnicę między rozpoznawaniem elementów interfejsu a realizacją dłuższych zadań.

Xenon Hunmin VLM 397B uzyskał 75,6 punktu w ScreenSpot-Pro, benchmarku mierzącym, czy model potrafi zlokalizować cele interfejsu w profesjonalnych aplikacjach. Według firmy wynik ten zapewnił mu drugie miejsce na rankingu Hugging Face tego benchmarku w chwili premiery modelu. Przewyższył też zarówno bazowy model Qwen3.5, jak i Qwen-CUA w pięciu zgłoszonych ocenach ugruntowania w interfejsie.

Hierarchia zmienia się, gdy test przechodzi od wskazania przycisku do ukończenia całego przepływu pracy. Xenon podaje wynik 70,5 w swojej ocenie OSWorld obejmującej 360 zadań, wobec 77,1 dla Qwen-CUA w tym samym odtworzonym środowisku. Ta różnica sprawia, że wydanie mówi więcej niż zwykłe ogłoszenie wyniku w rankingu.

Hunmin pokazuje, że firma może przenieść wyspecjalizowaną zdolność do ogromnego otwartego modelu przy użyciu relatywnie niewielkiego klastra treningowego. Nie dowodzi jednak, że sama precyzja wizualna tworzy najbardziej niezawodnego agenta komputerowego. Dla deweloperów i nabywców korporacyjnych to rozróżnienie ma większe znaczenie niż imponująca liczba parametrów modelu.

Xenon Hunmin VLM 397B dodaje sterowanie komputerem do Qwen3.5

Wydanie przekształca ogólny model multimodalny w otwarty model do obsługi komputera bez ponownego trenowania całej jego podstawy liczącej 397 miliardów parametrów.

Xenon, znany także międzynarodowo jako GenON, wydał model 18 września 2026 roku. Firma publikuje swoje modele za pośrednictwem organizacji mncai na Hugging Face. Nowe repozytorium zawiera model w pełnej precyzji, wersję FP8, wyniki ewaluacji oraz wskazówki implementacyjne.

Hunmin bazuje na Qwen3.5-397B-A17B, otwartym modelu mixture-of-experts od zespołu Qwen firmy Alibaba. Ma on 397 miliardów parametrów łącznie, lecz aktywuje około 17 miliardów podczas każdego przejścia w przód. Taka konstrukcja oferuje pojemność wiedzy bardzo dużego modelu bez wykorzystywania każdego parametru dla każdego tokenu.

Oryginalne wydanie Qwen3.5 wprowadziło natywne przetwarzanie multimodalne tekstu, obrazów i wideo. Xenon zachował tę podstawę, dodając możliwości obsługi komputera. Pozwalają one modelowi interpretować zrzuty ekranu, generować współrzędne i decydować, jaka akcja interfejsu powinna nastąpić jako kolejna.

Pełna publiczna nazwa modelu to Hunmin-397B-A17B-CUA. CUA oznacza computer-use agent, czyli system wykonujący zadania za pośrednictwem graficznych interfejsów używanych przez ludzi. Zamiast polegać wyłącznie na API strony internetowej, taki model może obsługiwać przeglądarki, aplikacje biurowe i oprogramowanie desktopowe przez widoczne elementy sterujące.

Podejście to rozwija wcześniejsze prace Xenona nad Hunminem. Firma wydała Hunmin 32B w 2025 roku, a na początku 2026 roku Hunmin VLM 235B. Jej historia firmy łączy również serię Hunmin z OneAgent, zorientowanym na działanie korporacyjnym produktem AI.

Xenon twierdzi, że nowy model zachowuje większość koreańskojęzycznych możliwości Qwen3.5. W ośmiu zgłoszonych koreańskich benchmarkach jego wyniki pozostawały w przybliżeniu w granicach dwóch punktów od modelu bazowego. Kilka indywidualnych rezultatów nieznacznie wzrosło, podczas gdy inne spadły.

Ta równowaga ma dla Xenona strategiczne znaczenie. Model do obsługi komputera, który traci zbyt wiele zdolności językowych, może mieć trudności z instrukcjami, dokumentami i zlokalizowanymi interfejsami. Utrzymanie wyników w języku koreańskim daje firmie wyraźniejszą pozycję korporacyjną niż model zoptymalizowany wyłącznie pod anglojęzyczne zadania webowe.

Publiczna karta modelu zawiera więcej szczegółów niż nagłówki premierowe. Określa dane treningowe, stos technologiczny, konfigurację sprzętową, ustawienia porównań i znane ograniczenia ewaluacji. Oznacza również wyniki bazowe jako odtworzone przez autorów, a nie wyniki zgłoszone przez dostawców.

To ujawnienie zwiększa użyteczność wydania. Deweloperzy mogą sprawdzić, które porównania korzystają z tego samego środowiska, zamiast łączyć nieporównywalne liczby z niezależnych rankingów. Ujawnia ono również kompromis definiujący obecną pozycję Hunmina.

Osiem GPU B200 obsłużyło pracę po treningu wstępnym

Najważniejsze twierdzenie Xenona dotyczy efektywności treningu, a nie łącznej liczby parametrów modelu.

Trening od podstaw modelu bazowego o 397 miliardach parametrów wymagałby znacznie więcej niż ośmiu GPU. Xenon tego nie próbował. Przeniósł istniejącą zdolność obsługi komputera do Qwen3.5, a następnie dopracował powstały model za pomocą uczenia nadzorowanego i uczenia ze wzmocnieniem.

Pierwszy krok wykorzystywał Qwen-CUA jako źródło zachowań związanych ze sterowaniem komputerem. Xenon obliczył różnice parametrów między Qwen-CUA a odpowiadającym mu bazowym checkpointem Qwen3.5. Następnie przybliżył te różnice za pomocą skróconej dekompozycji wartości osobliwych, metody matematycznej kompresującej dużą macierz do komponentów o niższym rzędzie.

Te skompresowane różnice stały się adapterami w stylu LoRA. LoRA, czyli low-rank adaptation, reprezentuje aktualizację modelu za pomocą mniejszych trenowalnych macierzy zamiast niezależnej zmiany każdej pierwotnej wagi. Xenon połączył te adaptery z większym checkpointem Qwen3.5-397B-A17B.

Technika ta ma znaczenie, ponieważ konwencjonalne dostrajanie staje się trudne wraz ze wzrostem modelu. Stany optymalizatora, gradienty, aktywacje i wagi modelu zużywają pamięć GPU. Aktualizacja ograniczonej reprezentacji niskiego rzędu zmniejsza ilość trenowalnych danych oraz związane z nią obciążenie pamięci.

Xenon następnie skwantyzował przeniesiony checkpoint do FP8. FP8 przechowuje wiele wartości numerycznych w ośmiu bitach, ograniczając użycie pamięci w porównaniu z formatami 16-bitowymi. Zespół przeprowadził dalszy trening po wstępnym treningu za pomocą FP8 QLoRA, nadzorowanego dostrajania i uczenia ze wzmocnieniem agentów.

Nadzorowane dostrajanie uczyło model na przykładach zawierających pożądane akcje interfejsu. Uczenie ze wzmocnieniem agentów nagradzało następnie skuteczne zachowanie w środowiskach komputerowych. Xenon wskazuje GRPO, czyli Group Relative Policy Optimization, jako metodę uczenia ze wzmocnieniem zastosowaną na tym etapie.

Stos treningowy obejmował MS-Swift, Ray, Megatron-Core i vLLM. Xenon wymienia ScaleCUA-Data od OpenGVLab jako swój nadzorowany zbiór danych. Wskazuje również ScaleCUA i CUA-Gym jako środowiska uczenia ze wzmocnieniem.

Według Xenona kompletny proces treningu po wstępnym treningu działał na ośmiu GPU Nvidia B200. To stwierdzenie nie oznacza, że pełny model bazowy został utworzony na ośmiu akceleratorach. Oznacza, że etapy transferu zdolności i treningu po wstępnym treningu korzystały z tego klastra po tym, jak Qwen zbudował już model bazowy.

To rozróżnienie zapobiega przekształceniu imponującego wyniku inżynieryjnego w mylące porównanie mocy obliczeniowej. Xenon skorzystał z oryginalnego modelu Qwen, wyspecjalizowanego checkpointu Qwen-CUA, otwartych zbiorów danych treningowych i dojrzałego oprogramowania optymalizacyjnego. Jego wkład polega na efektywnym połączeniu tych komponentów i dostosowaniu ich do docelowych możliwości.

Metoda ta oferuje możliwy szablon dla mniejszych dostawców AI. Zamiast finansować nowy model bazowy, firma może zacząć od otwartego checkpointu i dodać wąską umiejętność operacyjną. Może następnie przeznaczyć ograniczoną moc obliczeniową na dane zadaniowe, ewaluację i uczenie ze wzmocnieniem zamiast powtarzać ogólny trening wstępny.

Taka ścieżka zmniejsza też dystans między pracą akademicką a wdrażalnymi modelami korporacyjnymi. Zespół może skoncentrować się na aplikacjach, językach lokalnych i kontrolowanych środowiskach. Powstały model nadal może dziedziczyć szerokie zdolności wizualne i językowe po swoim fundamencie.

Model pozostaje jednak wymagający w czasie inferencji. Architektura mixture-of-experts aktywuje tylko część zestawu parametrów, lecz wszystkie 397 miliardów wag nadal wymaga przechowywania. Wydanie Xenona w FP8 w przybliżeniu zmniejsza wymagania pamięciowe o połowę, jednak wdrożenie nadal wymaga poważnej infrastruktury wielo-GPU.

Twierdzenia o treningu na ośmiu GPU nie należy więc interpretować jako obietnicy wdrożenia na ośmiu GPU. Trening adapterów i obsługa połączonego modelu stawiają inne wymagania zasobowe. Zespoły korporacyjne muszą ocenić pojemność pamięci, przepustowość połączeń, opóźnienia, współbieżność i zużycie energii przed wyborem tej architektury.

Rozpoznawanie ekranu jest najczytelniejszą przewagą Hunmina

Najmocniejsze wyniki Hunmina pokazują, że potrafi identyfikować cele interfejsu, zwłaszcza na gęsto zapełnionych profesjonalnych ekranach.

Ugruntowanie w graficznym interfejsie użytkownika łączy pisaną instrukcję z konkretną lokalizacją na zrzucie ekranu. Jeśli użytkownik prosi agenta o wybranie formuły arkusza kalkulacyjnego, model musi znaleźć odpowiednią komórkę lub element paska narzędzi. Niewielki błąd współrzędnych może skierować agenta do niewłaściwego menu albo zmienić niewłaściwy plik.

ScreenSpot-Pro testuje tę zdolność w wysokorozdzielczych profesjonalnych aplikacjach. Jego zadania obejmują interfejsy gęstsze i mniej wybaczające błędy niż typowe konsumenckie strony internetowe. Benchmark ScreenSpot-Pro powstał, ponieważ wcześniejsze testy ugruntowania nie reprezentowały wystarczająco dobrze wyspecjalizowanego oprogramowania desktopowego.

Xenon podaje wynik 75,6 przy inferencji z pojedynczym widokiem oraz 76,6 przy użyciu metody powiększenia. Odtworzone wyniki bazowego Qwen3.5 wyniosły odpowiednio 72,7 i 75,1. Qwen-CUA uzyskał 62,2 bez powiększenia i 71,9 z powiększeniem w tym samym zgłoszonym środowisku.

Hunmin uzyskał także 96,2 w ScreenSpot-v2, wobec 95,2 dla modelu bazowego i 95,0 dla Qwen-CUA. W OSWorld-G, ewaluacji skoncentrowanej na ugruntowaniu, osiągnął 79,9. W dopracowanej wersji OSWorld-G-R uzyskał 86,8.

Karta modelu wskazuje, że wyniki ugruntowania prowadziły w grupie porównawczej ocenianej przez Xenon w jego odtworzonym środowisku. To sformułowanie jest istotne. Nie ustanawia trwałego lidera we wszystkich modelach, konfiguracjach ewaluacji ani kolejnych zgłoszeniach.

Zgłoszone wyniki wciąż pokazują spójny wzorzec. Hunmin poprawia percepcję interfejsu w kilku testach, zamiast opierać się na pojedynczej korzystnej liczbie. Jego największa przewaga nad Qwen-CUA występuje w ScreenSpot-Pro, gdzie różnica sięga 13,4 punktu w środowisku Xenona.

Dla oprogramowania korporacyjnego ta mocna strona ma praktyczną wartość. Gęste interfejsy nadal są powszechne w systemach księgowych, platformach zarządzania relacjami z klientami, środowiskach programistycznych i wewnętrznych narzędziach administracyjnych. Wiele z tych produktów oferuje niekompletne API lub wymaga działań obejmujących widoczne stany interfejsu.

Ugruntowany model może również działać ze starszymi aplikacjami, które nigdy nie były projektowane z myślą o integracji z AI. Może identyfikować elementy sterujące na podstawie pikseli i etykiet zamiast zależeć od ustrukturyzowanych elementów strony internetowej. Zapewnia to szerszy zasięg, ale stwarza też wyzwania dotyczące niezawodności i bezpieczeństwa.

Xenon instruuje użytkowników, aby dostarczali zrzuty ekranu w natywnej rozdzielczości i normalizowali współrzędne do zakresu od zera do 1 000. Otrzymane współrzędne należy następnie przeskalować do rzeczywistej szerokości i wysokości ekranu. Te szczegóły mogą istotnie wpływać na precyzję kliknięć.

Model stosuje także limit historii wizualnej wynoszący pięć zrzutów ekranu w zgłoszonych ewaluacjach obsługi komputera. Xenon twierdzi, że historia bliższa 20 obrazom może zwiększać zużycie pamięci i koszt inferencji. Mniejsze okno odzwierciedla wybór wdrożeniowy, a nie wyłącznie wybór związany z benchmarkingiem.

Ograniczenie historii wizualnej może pomóc utrzymać koszty obsługi na bardziej kontrolowanym poziomie. Może jednak również pozostawić agentowi mniej dowodów dotyczących wcześniejszych działań, okien dialogowych lub stanów stron. To napięcie staje się ważniejsze wraz z wydłużaniem się zadania.

Pojedyncze precyzyjne kliknięcie nie wymaga rozbudowanej pamięci. Ukończenie 30-etapowego procesu już tak. Ta różnica wyjaśnia, dlaczego wysokie wyniki Hunmin w zakresie uziemienia wizualnego nie przekładają się automatycznie na pozycję lidera w pełnych zadaniach komputerowych.

Qwen-CUA Wciąż Prowadzi w Kompleksowych Zadaniach Komputerowych

Główny wniosek jest podzielony: Hunmin lepiej rozpoznaje cele w interfejsie, podczas gdy Qwen-CUA kończy więcej zadań wymagających długiego horyzontu działania.

OSWorld ocenia agentów w rzeczywistych aplikacjach komputerowych, zamiast testować odizolowane współrzędne. Zadania mogą obejmować przeglądarki, operacje na plikach, klientów poczty e-mail, edytory obrazów, narzędzia dokumentowe i wiele aplikacji. Agent musi obserwować stan, wybrać działanie, reagować na zmiany i kontynuować pracę aż do ukończenia zadania.

Oficjalny benchmark OSWorld pierwotnie zgromadził 369 zadań komputerowych z odtwarzalnymi stanami początkowymi i oceną opartą na wykonaniu. Xenon wykorzystał konfigurację 360 zadań dla wyników przedstawionych w karcie modelu. Firma podaje, że wszystkie porównywane modele korzystały z tego samego limitu historii wizualnej wynoszącego pięć obrazów.

Hunmin uzyskał w tej ocenie wynik 70.5. Bazowy model Qwen3.5 osiągnął 48.2, co oznacza wzrost Hunmin o 22.3 punktu. To znacząca poprawa i wsparcie dla twierdzenia Xenon, że jego trening po wstępnym uczeniu dodał istotne zachowania związane z kontrolą komputera.

Mimo to Qwen-CUA uzyskał 77.1 w tym samym odtworzonym środowisku, wyprzedzając Hunmin o 6.6 punktu. WindowsAgentArena daje tę samą kolejność. Hunmin uzyskał 50.9, o 9.1 punktu więcej niż 41.8 bazowego modelu, podczas gdy Qwen-CUA osiągnął 57.3.

Wyniki te nie podważają postępów Hunmin w zakresie uziemienia wizualnego. Pokazują, że agent potrzebuje czegoś więcej niż precyzyjnego wskazywania elementów wizualnych. Musi planować, śledzić postępy, zarządzać błędami, rozumieć stan aplikacji i unikać działań wykolejających proces.

Wyobraźmy sobie agenta, któremu polecono zaktualizować dane w arkuszu kalkulacyjnym i wysłać wynik e-mailem. Może on poprawnie zlokalizować każde menu, komórkę i przycisk. Nadal może jednak zawieść, edytując niewłaściwy skoroszyt, stosując formułę do błędnego zakresu lub dołączając nieaktualny plik.

Dłuższe zadania potęgują drobne błędy. Wczesna pomyłka zmienia późniejsze zrzuty ekranu i unieważnia pierwotny plan. Model musi wykryć tę rozbieżność i odzyskać kontrolę, zamiast pewnie kontynuować niewłaściwą ścieżką.

Wyniki treningu Hunmin ujawniają, skąd pochodziła część poprawy. Xenon twierdzi, że punkt kontrolny z przeniesionymi zdolnościami osiągnął 66.2 w OSWorld przed późniejszym treningiem. Dostrajanie nadzorowane i uczenie ze wzmocnieniem podniosły ten wynik do 70.5, czyli o kolejne 4.3 punktu.

Ten postęp potwierdza wartość metody Xenon. Transfer zdolności zapewnił dużą część początkowej umiejętności korzystania z komputera, a trening specyficzny dla zadań ją poprawił. Pozostała przewaga Qwen-CUA sugeruje jednak, że część zachowań została niedoskonale skompresowana lub zmieniona podczas integracji.

Koreańskojęzyczny cel może również wpływać na ten kompromis. Hunmin zachowuje wydajność w ośmiu koreańskich benchmarkach lepiej niż Qwen-CUA w kilku porównaniach. Xenon nie optymalizował wyłącznie pod kątem najwyższego możliwego wyniku OSWorld.

Przykładowo Hunmin uzyskał 76.1 w KMMLU-Pro, wobec 71.4 dla Qwen-CUA. Osiągnął również 80.3 w K-MMStar, wobec 75.0. Wyniki te sugerują bardziej zrównoważony profil wielojęzyczny, choć nadal są to oceny odtworzone przez firmę.

Ta równowaga może mieć znaczenie dla koreańskich przedsiębiorstw. Model musi rozumieć lokalne instrukcje, dokumenty, terminologię i interfejsy użytkownika, zanim jego zdolność klikania stanie się użyteczna. Wyższy wynik agenta zorientowanego na język angielski nie rozstrzyga każdej decyzji zakupowej.

Mimo to Xenon nie powinien przedstawiać przywództwa w uziemieniu wizualnym jako równoważnego przywództwu w ogólnym korzystaniu z komputera. Karta modelu unika tego błędu, publikując niekorzystne porównanie OSWorld. Materiały premierowe są mniej użyteczne, gdy podkreślają drugie miejsce w ScreenSpot-Pro bez wyjaśnienia różnicy w zadaniach end-to-end.

Dla kupujących właściwe porównanie zależy od zamierzonego obciążenia pracą. Proces zdominowany przez gęste wskazywanie elementów interfejsu może sprzyjać profilowi Hunmin. Dłuższa sekwencja wymagająca odzyskiwania kontroli i planowania może ujawnić jego obecną słabość względem Qwen-CUA.

Otwartość modelu daje zespołom jeszcze jedną opcję. Deweloperzy mogą przeanalizować wydanie, dostosować je i przeprowadzić kontrolowane oceny na własnym oprogramowaniu. Ta elastyczność jest cenna, lecz nie eliminuje potrzeby testowania specyficznego dla aplikacji.

Otwarte Wagi Nie Eliminują Ryzyka Wdrożeniowego

Dostęp na licencji Apache 2.0 zwiększa kontrolę, ale model do obsługi komputera dostępny do pobrania wciąż daleki jest od bezpiecznego autonomicznego pracownika.

Xenon udostępnił zarówno oryginalny model, jak i wariant FP8 na licencji Apache 2.0. Licencja ta zasadniczo zezwala na użycie komercyjne, modyfikację i redystrybucję pod warunkiem spełnienia jej wymogów. Daje firmom większą swobodę wdrożeniową niż zamknięty agent dostępny wyłącznie przez hostowany interfejs.

Otwarty dostęp umożliwia również prywatną ocenę. Przedsiębiorstwo może testować Hunmin w wewnętrznych aplikacjach bez wysyłania zrzutów ekranu do zewnętrznego dostawcy modelu. Zespoły mogą mierzyć jego zachowanie w lokalnym języku, na specjalistycznych formularzach i w procesach specyficznych dla organizacji.

Dostęp do modelu to jednak tylko jedna warstwa systemu korzystania z komputera. Agent produkcyjny nadal potrzebuje środowiska wykonawczego, kontrolera działań, modelu uprawnień, śladu audytowego, strategii poświadczeń i procesu odzyskiwania. Potrzebuje też ochrony przed złośliwymi instrukcjami osadzonymi na stronach internetowych lub w dokumentach.

Model do obsługi komputera może wchodzić w interakcję ze wszystkim, do czego ma dostęp konto systemowe. Może to obejmować e-mail, dane klientów, magazyn w chmurze, wewnętrzne pulpity i aplikacje finansowe. Jedno błędne działanie może mieć konsekwencje, których nie powoduje nieprawidłowa odpowiedź chatbota.

Benchmarki uziemienia ekranu dostarczają niewielu dowodów dotyczących autoryzacji lub intencji. Zlokalizowanie właściwego przycisku „Usuń” jest technicznie sukcesem, nawet jeśli jego naciśnięcie naruszałoby politykę. Otaczający agenta system musi zdecydować, czy działanie jest dozwolone i czy wymaga zatwierdzenia przez człowieka.

Zadania benchmarkowe rozpoczynają się również od kontrolowanych stanów. Rzeczywiste komputery stacjonarne gromadzą powiadomienia, aktualizacje oprogramowania, rozszerzenia przeglądarki, wygasłe sesje, niestandardowe układy i niespójne rozmiary okien. Te zmienne mogą zmieniać zarówno to, co widzi model, jak i skutki działania.

Xenon przyznaje istnienie kilku ograniczeń oceny. Firma twierdzi, że wyniki zależą od rozdzielczości zrzutów ekranu, ustawień rozumowania, limitów interakcji, oprogramowania obsługującego i wersji benchmarków. Ostrzega również przed bezpośrednim porównywaniem swoich wyników z rezultatami uzyskanymi przy użyciu znacznie dłuższych historii zrzutów ekranu.

Ta ostrożność powinna wpływać na sposób, w jaki czytelnicy interpretują każdą liczbę w wydaniu. Firma odtworzyła modele bazowe we własnym środowisku. Tworzy to uczciwsze porównanie wewnętrzne, ale niezależne zespoły nie powieliły jeszcze szeroko tych wyników.

Pozycja w rankingu przedstawia kolejną niewiadomą. Rankingi ScreenSpot-Pro mogą się zmieniać wraz z pojawianiem się nowych modeli i metod wnioskowania. Drugie miejsce w momencie premiery jest migawką z określonego czasu, a nie trwałym statusem.

Skala parametrów wprowadza także ryzyko operacyjne. Nawet przy kwantyzacji FP8 i rzadkiej aktywacji organizacje potrzebują odpowiedniej infrastruktury. Mniejszy wyspecjalizowany model może zapewnić wystarczającą dokładność przy niższych opóźnieniach, prostszym wdrożeniu i łatwiejszym dostrajaniu.

Zespoły powinny więc porównywać systemy na poziomie procesów roboczych. Użyteczne miary obejmują wskaźnik ukończenia, częstotliwość interwencji, średnią liczbę kroków, skuteczność odzyskiwania, opóźnienia oraz dotkliwość nieudanych działań. Pojedynczy zagregowany wynik benchmarku nie może uchwycić wszystkich tych wymiarów.

Ta sama zasada dotyczy pracy z wiedzą otaczającej operacje agentów. Zespoły potrzebują przeszukiwalnych rejestrów instrukcji, wyników, wyjątków i decyzji podejmowanych przez ludzi. Kontrolowana baza wiedzy AI może pomóc osobom oceniającym odtworzyć, dlaczego zautomatyzowane zadanie przyniosło konkretny rezultat.

Nie czyni to agenta bezpiecznym samo w sobie. Tworzy dowody na potrzeby przeglądu, debugowania i ulepszania polityk. Systemy korzystania z komputera stają się łatwiejsze do nadzorowania, gdy ich działania pozostają powiązane z dokumentami i decyzjami, które je autoryzowały.

Wydanie Xenon zasługuje na uznanie za publikowanie ograniczeń i niekorzystnych porównań obok najsilniejszych wyników. Ta przejrzystość pozwala deweloperom zadawać lepsze pytania. Następnym krokiem są niezależne testy mierzące zarówno możliwości, jak i konsekwencje błędów.

Trzy Sygnały Pokażą, Czy Hunmin Może Zmniejszyć Lukę

Znaczenie Hunmin zależy teraz od niezależnego odtworzenia wyników, lepszych rezultatów w długich zadaniach oraz wdrożenia wykraczającego poza repozytorium modelu.

Pierwszym sygnałem jest niezależna replikacja benchmarków. Zewnętrzni badacze muszą uruchomić Hunmin, Qwen3.5 i Qwen-CUA na tym samym sprzęcie, przy tej samej historii zrzutów ekranu, ustawieniach rozumowania i infrastrukturze zadań. Podobne wyniki wzmocniłyby twierdzenie Xenon, że transfer niskiego rzędu zachował użyteczne możliwości kontroli komputera.

Replikacja powinna obejmować więcej niż ScreenSpot-Pro. Badacze powinni testować uziemienie wizualne, pełne ukończenie zadań, odzyskiwanie, opóźnienia i zużycie zasobów. Powinni również publikować kategorie błędów, a nie tylko wyniki zbiorcze.

Jeśli niezależne uruchomienia odtworzą wynik 75.6 w uziemieniu wizualnym i 70.5 w OSWorld, zaufanie do oceny Xenon wzrośnie. Duże odchylenia osłabiłyby narrację premiery i wskazały na wrażliwość na konfigurację.

Drugim sygnałem będzie to, czy Xenon zmniejszy lukę w długich zadaniach względem Qwen-CUA. Obecny model już precyzyjnie odnajduje cele, więc kolejne zyski muszą wynikać z planowania i zarządzania stanem. Lepsza pamięć, silniejsze środowiska uczenia ze wzmocnieniem lub ulepszone odzyskiwanie po błędach mogłyby zwiększyć ukończenie zadań end-to-end.

Przyszły punkt kontrolny powinien zmniejszyć zgłaszany deficyt 6.6 punktu w OSWorld bez poświęcania wydajności w języku koreańskim. Taki wynik wspierałby argument Xenon, że efektywny trening po wstępnym uczeniu może stworzyć zrównoważony, praktyczny model do obsługi komputera. Same ulepszenia uziemienia wizualnego pozostawiłyby główne ograniczenie nierozwiązane.

Trzecim sygnałem jest wdrożenie w OneAgent lub innym produkcie korporacyjnym. Publiczny punkt kontrolny demonstruje dostęp techniczny, ale wykorzystanie produktu pokazuje, czy model radzi sobie z ograniczeniami opóźnień i nieprzewidywalnymi interfejsami. Rzeczywiste wdrożenie pokaże również, czy firmy cenią kontrolę w lokalnym języku na tyle, by zaakceptować wymagania infrastrukturalne modelu.

Xenon twierdzi, że planuje wykorzystać nowe możliwości do ulepszenia OneAgent i rozszerzenia zakresu pracy, którą może wykonywać AI. Kupujący powinni obserwować nazwane wdrożenia, powtarzalne procesy, wskaźniki interwencji oraz dowody, że zadania pozostają niezawodne poza środowiskami benchmarkowymi.

Najbardziej użyteczne studia przypadków będą opisywać ograniczenia równie jasno jak sukcesy. Powinny wskazywać, które aplikacje agent może obsługiwać, które działania wymagają zatwierdzenia i jak często musi interweniować człowiek. Bez tych szczegółów komunikaty klientów dostarczą niewielu dowodów technicznych.

Xenon Hunmin VLM 397B jest już godnym uwagi wydaniem inżynieryjnym. Pokazuje, że stosunkowo skoncentrowany zespół może dodać zachowania kontroli komputera do ogromnego otwartego modelu, wykorzystując osiem wysokiej klasy GPU do treningu po wstępnym uczeniu. Jego własne liczby również uniemożliwiają prostą narrację o zwycięstwie.

Deweloperzy oceniający model powinni zacząć od wąskiego procesu roboczego i odwracalnego środowiska testowego. Należy mierzyć pełny sukces zadania, a nie tylko dokładność kliknięć, oraz rejestrować każdą interwencję lub odzyskiwanie. Następnie trzeba porównać te wyniki z Qwen-CUA i mniejszymi alternatywami w identycznych warunkach. Otwarta licencja umożliwia tę pracę, lecz tylko niezależne testy ustalą, czy przewaga Hunmin w uziemieniu wizualnym przekłada się na niezawodne działanie.

 
 

Zacznij bezpłatnie

Asystent AI działający przede wszystkim lokalnie, z funkcją zarządzania wiedzą osobistą

Aby zapewnić lepsze działanie AI,

remio obsługuje obecnie wyłącznie Windows 10+ (x64) i M-Chip Macs.

Twój partner AI w pracy
Zrób więcej z remio

Planuj. Twórz. Dostarczaj.
Wszystko w jednym miejscu.

bottom of page