Model świata Pokémon stmonty’ego działa lokalnie, ale prawdziwym testem jest planowanie długoterminowe
Deweloper stmonty wytrenował 12,5-milionowy model świata Pokémon na jednej RTX 3080 Ti, a następnie użył go do wybrania startera w Pokémon Red. Model nie otrzymał zasad gry, mapy ani nagrody za zdobycie Pokémona. Uczył się, przewidując, co wydarzy się po każdym naciśnięciu przycisku.
Wynik ten brzmi jak kolejna pozycja w rosnącej kolekcji demonstracji AI grającej w gry. Jednak interesujący konflikt nie dotyczy tego, czy AI potrafi ukończyć znaną sekwencję w grze. Większe modele językowe i konwencjonalne systemy uczenia ze wzmocnieniem już mierzyły się ze znacznie szerszymi wyzwaniami w Pokémon.
Model świata Pokémon stmonty’ego sprawdza węższą tezę. Czy mały model predykcyjny może nauczyć się użytecznej dynamiki środowiska na podstawie zrzutów ekranu, planować w swojej wyuczonej reprezentacji i działać na sprzęcie dostępnym dla niezależnego dewelopera?
Odpowiedź brzmi: tak, ale z zastrzeżeniami. Po dostrojeniu model zdobył startera w 52 ze 100 zaplanowanych prób. Losowe sekwencje przycisków nie odnotowały żadnych sukcesów, podczas gdy ten sam proces wyszukiwania połączony z niewytrenowanym predyktorem odniósł sukces raz.
Liczby te pokazują, że wyuczony model wniósł użyteczne informacje. Wyznaczają również granice projektu. Pozycja startowa została starannie dobrana, plan obejmował tylko 14 naciśnięć przycisków, a wielokrotne naciskanie A było już poprawnym rozwiązaniem.
Projekt dostarcza zatem dowodów na dostępne eksperymentowanie z modelami świata, a nie na stworzenie uniwersalnego gracza w Pokémon. Jego najważniejsza lekcja wynika z różnicy między przewidzeniem jednej akcji a utrzymaniem użytecznej prognozy w ciągu wielu akcji.
Ta różnica umieszcza eksperyment w szerszej rywalizacji między dwiema drogami rozwoju AI. Jedna wykorzystuje duże modele ogólnego przeznaczenia z wiedzą językową, narzędziami zewnętrznymi, pamięcią i rozbudowanymi zasobami obliczeniowymi. Druga buduje mniejsze systemy wokół dynamiki konkretnego środowiska.
Projekt stmonty’ego nie rozstrzyga tej rywalizacji. Pokazuje jednak, dlaczego kompaktowe modele predykcyjne pozostają interesujące, zwłaszcza gdy deweloperzy potrzebują lokalnego treningu, szybkiego eksperymentowania i bezpośredniej kontroli nad danymi.
Co faktycznie zrobił model świata Pokémon stmonty’ego
Model nauczył się wystarczającej dynamiki gry, aby poprowadzić krótki plan, ale nie nauczył się grać w Pokémon Red od początku do końca.
stmonty początkowo rozważał znacznie większy cel. Proponowana sekwencja obejmowała dotarcie do laboratorium Profesora Oaka, ukończenie dialogu, wybranie startera, opuszczenie budynku i pokonanie rywala.
Plan ten szybko okazał się zbyt ambitny jak na pierwszy eksperyment. Zadanie ograniczono do stanu zapisu wewnątrz laboratorium Oaka, gdzie postać mogła zdobyć Bulbasaura, Charmandera lub Squirtle’a.
Z tej pozycji wystarczało nacisnąć A 12 razy. Model nadal mógł używać sterowania kierunkowego, anulować dialog przyciskiem B lub podążyć inną poprawną sekwencją. Jego zadaniem było wskazanie 14-akcyjnego planu, który przybliżał przewidywany stan gry do przykładu udanego wyboru startera.
Deweloper zarejestrował 42 382 klatki w skali szarości z emulatora Pokémon Red. Klatki te utworzyły 1 009 krótkich trajektorii zawierających zrzut ekranu, naciśnięcie przycisku i kolejny zrzut ekranu.
Część trajektorii podążała zaprogramowanymi trasami. Inne zawierały zakłócenia lub bardziej losowy ruch. Ta mieszanka miała znaczenie, ponieważ planer bada zarówno rozsądne, jak i słabe sekwencje akcji.
Zbiór danych zawierający wyłącznie idealne demonstracje mógłby skojarzyć A z postępem, ucząc się niewiele o anulowaniu, zablokowanym ruchu czy nieistotnych wejściach. Bardziej chaotyczne trajektorie wystawiły model na większą część zachowania lokalnego środowiska.
Powstały system oparto na LeWorldModel, architekturze predykcyjnej ze wspólnym osadzaniem, czyli JEPA. JEPA przewiduje, jak zmienia się abstrakcyjna reprezentacja, zamiast odtwarzać każdy piksel następnego obrazu.
To rozróżnienie utrzymuje cel treningu skupiony na użytecznej strukturze. Enkoder przekształca zrzut ekranu w osadzenie, czyli numeryczną reprezentację obserwowanego stanu. Predyktor następnie szacuje kolejne osadzenie na podstawie bieżącej reprezentacji i wybranej akcji.
Publiczna relacja z projektu podaje, że końcowa sieć zawierała około 12,5 miliona parametrów i została wytrenowana lokalnie na RTX 3080 Ti. Implementacja jest również dostępna w repozytorium lePokeRed.
Po treningu stmonty sprawdził, czy reprezentacja zachowała informacje o celu. Niewielki klasyfikator potrafił określić, czy drużyna gracza zawierała Pokémona, podczas gdy bazowy enkoder pozostawał zamrożony.
Predyktor radził sobie również lepiej niż punkt odniesienia kopiujący bieżące osadzenie. Podanie niewłaściwej akcji pogarszało jego prognozę, co sugeruje, że nauczył się pewnej relacji między sterowaniem a zmianami w grze.
Testy te nie potwierdziły niezawodnego planowania. Pokazały jedynie, że model reprezentował istotny stan i znacząco reagował na wybrany przycisk.
Prawdziwa ocena nastąpiła, gdy sekwencja planera uruchomiła się w emulatorze. Po dostrojeniu rolloutów jedna z proponowanych sekwencji wybrała Squirtle’a i zmieniła liczbę Pokémonów w drużynie z zera na jeden.
W 100 wyszukiwaniach z użyciem różnych losowych ziaren 52 plany zdobyły startera. Wynik ten wspiera ograniczone twierdzenie: reprezentacja modelu pomogła planerowi znaleźć użyteczne akcje z ustalonego punktu początkowego.
Nie wspiera szerszego twierdzenia, że model samodzielnie opanował Pokémon Red. stmonty wyraźnie przyznał istnienie tej luki, zauważając w dyskusji społeczności, że samo powiększenie obecnego modelu nie rozwiązałoby problemu wielu pośrednich celów gry.
Jak model nauczył się sterowania, przewidując kolejne zdarzenia
Centralnym mechanizmem było przewidywanie bez nagród za zadanie, po którym następowało planowanie w kierunku przykładów pożądanego wyniku.
Zapisy treningowe nigdy nie oznaczały trajektorii jako sukcesu ani nie nagradzały modelu za zdobycie Pokémona. Podczas początkowego treningu system jedynie próbował przewidzieć kolejny osadzony stan.
Jeśli bieżący obraz pokazywał okno dialogowe, a zarejestrowaną akcją było A, predyktor uczył się, jaka reprezentacja zazwyczaj następowała po takim połączeniu. Jeśli postać stała przed ścianą, mógł nauczyć się, że wejście kierunkowe może powodować niewielką widoczną zmianę.
Taka konfiguracja oddziela uczenie się środowiska od wyboru celu. Najpierw model poznaje, jak obserwacje zwykle zmieniają się po akcjach. Później planer wykorzystuje tę maszynerię predykcyjną do wyszukania konkretnego rezultatu.
To rozdzielenie jest istotne, ponieważ deweloperzy mogą teoretycznie ponownie wykorzystać jeden wyuczony model środowiska dla wielu celów. Nowe zadanie wymagałoby nowych przykładów celu lub logiki punktacji, ale niekoniecznie kompletnej rekonstrukcji środowiska.
Architektura wiązała się z poważnym trybem awarii. Enkoder i predyktor trenowane razem mogą zmniejszać stratę, mapując każdy obraz na tę samą reprezentację. Predyktor staje się wtedy idealnie spójny, nie zachowując niczego użytecznego.
Problem ten znany jest jako zapadanie się przestrzeni ukrytej. Projekt LeWorldModel przeciwdziała mu za pomocą SIGReg, regularyzatora, który kieruje wyuczone reprezentacje w stronę rozproszonego kształtu Gaussa.
Źródłowy artykuł o LeWorldModel przedstawia to podejście jako sposób trenowania JEPA od początku do końca na surowych pikselach. Wśród jego autorów są Lucas Maes, Quentin Le Lidec, Damien Scieur, Yann LeCun i Randall Balestriero.
LeWorldModel wykorzystuje stratę przewidywania kolejnego osadzenia wraz z regularyzatorem. Jego oficjalny kod badawczy udostępnia checkpointy, odnośniki do danych i implementację szerszej metody.
stmonty zaadaptował ten kierunek badań do Pokémon Red. Gdy reprezentacja została wytrenowana, deweloper przekazał planerowi osadzenia z udanych wyborów Bulbasaura, Charmandera i Squirtle’a.
Te osadzenia celu opisywały, jak wygląda sukces, bez określania poprawnej trasy. System następnie wyobrażał sobie, jak kandydackie sekwencje przycisków zmienią bieżący stan.
W wyszukiwaniu zastosowano metodę cross-entropy, proces próbkowania, który stopniowo koncentruje się na lepszych kandydatach. W każdej rundzie generowano 512 kompletnych planów zawierających 14 akcji.
Planer porównywał przewidywane stany z trzema osadzeniami celu. Zachowywał 64 plany o najmniejszych odległościach, a następnie zwiększał prawdopodobieństwo ich wyborów przycisków w kolejnej rundzie próbkowania.
Proces ten nie jest tym samym co pytanie chatbota, co należy zrobić. Planer przeszukiwał dynamikę wyuczoną z zarejestrowanych zrzutów ekranu.
Nie było to też klasyczne uczenie ze wzmocnieniem oparte na nagrodach. Model świata nie uczył się za pomocą bieżącego wyniku za dobre i złe akcje. Cel został wprowadzony po treningu poprzez podobieństwo do przykładów udanych rezultatów.
Projekt ten stworzył atrakcyjną formę modułowości. Predykcja odzwierciedlała lokalne środowisko, osadzenia celu definiowały sukces, a algorytm wyszukiwania badał możliwe sekwencje akcji.
Pierwsza próba mimo to zakończyła się niepowodzeniem. Zaplanowana trajektoria wyglądała na udaną w wyuczonej reprezentacji, ale nie zdobyła Pokémona po wykonaniu jej w emulatorze.
Porażka ujawniła niedopasowanie między treningiem a planowaniem. Podczas zwykłego treningu każda jednokrokowa prognoza rozpoczynała się od osadzenia prawdziwego zrzutu ekranu. Każda nowa klatka skutecznie resetowała wcześniejsze błędy predykcji.
Planowanie działało inaczej. Po początkowym zrzucie ekranu predyktor musiał wykorzystywać własny oszacowany stan jako dane wejściowe dla kolejnego kroku. Każdy drobny błąd mógł zniekształcić następną prognozę.
Po kilku wyobrażonych akcjach rollout mógł wejść w reprezentację atrakcyjną dla planera, lecz nieodpowiadającą już rzeczywistej grze. Proces wyszukiwania wykorzystywał wtedy błąd modelu.
To powszechny problem systemów predykcyjnych. Model może dobrze wypadać w odizolowanych prognozach następnego kroku, a jednocześnie stawać się niewiarygodny, gdy jego własne wyjścia zasilają przyszłe predykcje.
stmonty rozwiązał ten problem poprzez dostrajanie rolloutów. Enkoder pozostał zamrożony, podczas gdy predyktor i enkoder akcji ćwiczyły prognozowanie na podstawie własnych wcześniejszych oszacowanych stanów.
Trening zaczynał się od krótkich rolloutów i stopniowo je wydłużał. W dwunastym przewidywanym kroku zgłoszony średni błąd kwadratowy spadł z 0,4224 do 0,3045.
Pierwsza prognoza nieznacznie się pogorszyła, ale błąd kumulował się wolniej w całej sekwencji. Ten kompromis lepiej odpowiadał zadaniu planowania, w którym trwała spójność była ważniejsza niż optymalizacja pojedynczego, odizolowanego kroku.
Dlaczego jedna RTX 3080 Ti ma znaczenie
Konsumencki GPU jest istotny, ponieważ sprawia, że eksperyment jest odtwarzalny w duchu, a nie dlatego, że dowodzi, iż małe modele mogą zastąpić systemy ogólnej AI.
Współczesne relacje o AI często traktują skalę jako główną historię. Liczba parametrów sięga miliardów, klastry treningowe zużywają tysiące akceleratorów, a dostęp zależy od infrastruktury chmurowej.
Model świata Pokémon stmonty’ego przenosi uwagę na mniejszą pętlę rozwojową. Jedna osoba wybrała ograniczone zadanie, zarejestrowała dane treningowe, zaadaptowała najnowsze badania, zdiagnozowała błąd planowania i lokalnie ponownie wytrenowała odpowiednie komponenty.
RTX 3080 Ti nie jest zwykłym urządzeniem z niższej półki. To wydajny gamingowy GPU z 12 GB pamięci. Wciąż jednak należy do innej kategorii niż wyspecjalizowane klastry wykorzystywane do granicznych modeli fundamentowych.
Ta różnica wpływa na to, kto może testować pomysły. Lokalny rozwój daje badaczom bezpośredni dostęp do checkpointów, śladów wykonania, zbiorów danych i błędów. Pozwala też uniknąć przesyłania każdego eksperymentalnego wejścia przez model hostowany.
Korzyść jest szczególnie wyraźna w pracy specyficznej dla danego środowiska. Programista badający robota, grę, interfejs lub symulację może nie potrzebować szerokich kompetencji językowych. Kompaktowy model może przeznaczyć swoją ograniczoną pojemność na dynamikę, która ma znaczenie.
Małe modele ułatwiają również iterację. Nieudany plan może prowadzić do ukierunkowanej zmiany, jak stało się tutaj w przypadku dostrajania rolloutów. Programiści mogą porównywać przebiegi, sprawdzać pokrycie danych i korygować założenia bez przebudowy ogromnego systemu ogólnego przeznaczenia.
Lokalne trenowanie nie oznacza jednak automatycznie szerokiej dostępności. Odtworzenie eksperymentu nadal wymaga wiedzy z zakresu uczenia maszynowego, instrumentacji emulatora, zbierania danych, odpowiedniego sprzętu i cierpliwości.
Opisywany model nauczył się też tylko ograniczonego obszaru jednej gry. Jego zbiór danych nie był kompletną mapą Pokémon Red, a planer zaczynał od ustalonego stanu zapisu.
Projekt najlepiej więc rozumieć jako dostępny prototyp badawczy. Obniża barierę obliczeniową dla określonej klasy eksperymentów, pozostawiając jednocześnie istotne bariery inżynieryjne.
Szersze badania LeWorldModel wzmacniają tę interpretację. W artykule opisano architekturę liczącą około 15 milionów parametrów, trenowaną na pojedynczym GPU dla zadań eksperymentalnych. Ocenia ona środowiska nawigacji, manipulacji i planowania ruchu, nie roszcząc sobie prawa do ogólnej inteligencji.
Dla programistów użytecznym sygnałem jest efektywność architektury. Predykcyjna reprezentacja nie musi generować fotorealistycznych przyszłych klatek ani werbalizować każdego wyboru. Może zachować jedynie tyle struktury, ile potrzeba do planowania.
Może to zmniejszyć rozmiar modelu i koszt oceny wielu kandydatów na działania. Czyni też cel systemu bardziej konkretnym niż w przypadku modelu językowego, któremu poleca się wywnioskować sterowanie na podstawie zrzutów ekranu i tekstu.
Specjalizacja ma jednak własne koszty. Programista musiał zebrać ponad 42 000 klatek dla zadania, które człowiek już rozumie. Model ogólny mógłby wnieść wcześniejszą wiedzę o Pokémonach, menu, dialogach i celach długoterminowych.
Nie jest to zatem po prostu rywalizacja małych i dużych modeli. Chodzi o wcześniejszą wiedzę kontra uczenie specyficzne dla zadania, lokalną kontrolę kontra ogólne kompetencje oraz wydajną predykcję kontra elastyczne rozumowanie.
Niedawne eksperymenty z Pokémonami dobrze pokazują to porównanie. Niektóre systemy wykorzystują modele językowe, pamięć gry, ręcznie opracowane listy działań lub zewnętrzne wskazówki. Inne stosują uczenie ze wzmocnieniem wobec jawnie określonych celów.
Model stmonty’ego obrał bardziej rygorystyczną ścieżkę wizualną. Uczył się na klatkach w skali szarości i zarejestrowanych wejściach, a następnie planował za pomocą powstałej reprezentacji.
Węższy zakres wejścia jest zarazem siłą i ograniczeniem projektu. Nadaje wynikowi techniczną klarowność, ale usuwa informacje, które pomogłyby ukończyć całą grę.
Model odczytujący tekst może zrozumieć, że odznaki z sal gimnastycznych odblokowują dalszy postęp. Model predykcyjny trenowany wokół laboratorium Oaka nie otrzymuje naturalnego wyjaśnienia tej hierarchii.
Sprzęt konsumencki sprawia, że lokalna pętla uczenia jest godna uwagi. Nie eliminuje jednak potrzeby struktury celów, zróżnicowanych danych ani systemów działających przez dłuższe okresy.
Prawdziwym przeciwnikiem jest horyzont planowania
Najtrudniejszym problemem eksperymentu nie było rozpoznawanie przycisków, lecz utrzymanie użyteczności predykcji, gdy plan wykraczał poza znane krótkie sekwencje.
Horyzont 14 działań już powodował wystarczający dryf, by pokonać pierwszy planer. Przewidywany stan modelu stopniowo oddalał się od rzeczywistego stanu emulatora, choć pojedyncze przejścia wyglądały wiarygodnie.
Dłuższe cele w Pokémonach zwielokrotniają ten problem. Przejście przez pomieszczenie wymaga nawigacji przestrzennej. Dialog wymaga kontekstu dotyczącego wcześniejszych wyborów. Walki dodają menu, zdrowie, typy, ruchy i zmieniających się przeciwników.
Pełna gra zawiera również zależności rozciągnięte na wiele godzin. Gracz musi odkrywać cele pośrednie, pamiętać ukończone zadania, zdobywać wymagane przedmioty i dostosowywać się, gdy wcześniejszy plan zawiedzie.
stmonty wskazał ten problem bezpośrednio w dyskusji na Hacker News. Skalowanie do pełnego ukończenia gry wymagałoby reprezentacji dla celów pośrednich oraz sposobu ich układania w czasie.
Większa wersja tej samej sieci o krótkim horyzoncie nadal nie miałaby jawnego mechanizmu obsługi tej hierarchii. Więcej parametrów mogłoby poprawić predykcje, ale nie wskazałoby automatycznie, która odznaka, rzecz lub lokalizacja powinna być kolejnym celem.
To obszar, w którym modele ogólnego przeznaczenia mają przewagę. Mogą wykorzystywać wiedzę językową do rozpoznawania pojęć związanych z grą i rozumowania o sekwencjach opisanych w poradnikach, dialogach lub pamięci.
Ich słabość jest inna. Szerokie modele mogą halucynować działania, tracić orientację w stanie, powtarzać błędy lub zużywać znaczne zasoby na rozumowanie o prostych decyzjach sterujących.
Model świata specyficzny dla zadania może skuteczniej obsługiwać lokalną dynamikę. System wyższego poziomu mógłby wtedy wybierać cele, podczas gdy model predykcyjny obsługiwałby krótkie sekwencje.
Taka warstwowa konstrukcja pojawiła się w dyskusji społeczności. Jeden z uczestników zasugerował hierarchiczne modele świata działające w różnych skalach czasowych. Komponent wysokiego poziomu mógłby rozumować o pokonaniu sali gimnastycznej, podczas gdy model niższego poziomu przewidywałby pojedyncze wejścia.
Taki system przypominałby sposób budowania wielu praktycznych agentów. Jeden komponent utrzymuje cele, inny modeluje środowisko, a kontroler wybiera lub weryfikuje działania.
Obecny eksperyment nie testował jednak tej architektury. Miał trzy początkowe osadzenia celów, jedną pozycję startową i ustalony horyzont planowania.
Wskaźnik sukcesu na poziomie 52 procent również wymaga ostrożnej interpretacji. Był znacznie lepszy niż losowy punkt odniesienia, ale wynikał z powtarzanych wyszukiwań z tego samego stanu początkowego.
Model nie wykazał odporności w różnych pomieszczeniach, przy nieznanych dialogach, zmieniających się ekwipunkach ani w walkach. Takie testy wymagałyby szerszych danych i bardziej zróżnicowanych warunków początkowych.
W eksperymencie istnieje jeszcze jeden istotny punkt odniesienia. Naciśnięcie A 12 razy już wystarczało do ukończenia zadania ze stanu zapisu.
Nie przekreśla to wkładu wyuczonego modelu. Losowe sekwencje działań nadal zawodziły, a wytrenowany predyktor pomógł wyszukiwaniu odnaleźć poprawne plany. Osłabia jednak wszelkie twierdzenia, że system wykazał szerokie zrozumienie strategiczne.
Prawdziwym osiągnięciem było nauczenie reprezentacji wspierającej wyszukiwanie ukierunkowane na cel. Prawdziwa niepewność dotyczy tego, czy reprezentacja ta pozostaje użyteczna, gdy sukces zależy od dłuższych i bardziej zróżnicowanych łańcuchów przyczynowych.
Konwencjonalne uczenie ze wzmocnieniem oferuje kolejne porównanie. Podlinkowany agent Pokémon, przywołany w dyskusji, używał proximal policy optimization dla znacznie szerszego celu w grze.
Ta ścieżka zależy od jawnego projektu nagrody i powtarzanej interakcji. Model świata Pokémon stmonty’ego uczył się natomiast dynamiki bez otrzymania celu związanego ze starterem podczas początkowego treningu.
Żadne z tych podejść nie wygrywa uniwersalnie. Agenci sterowani nagrodą mogą bezpośrednio optymalizować zachowanie, podczas gdy modele świata mogą oddzielić predykcję środowiska od późniejszych celów.
Istotne pytanie brzmi, która metoda pozostaje wydajna wraz z rozbudową środowiska. Szersza ocena porównałaby wymagania dotyczące danych, czas treningu, wskaźniki niepowodzeń oraz uogólnianie między stanami zapisu.
Bez tych pomiarów projekt nie powinien być przedstawiany jako dowód, że małe modele świata przewyższają uczenie ze wzmocnieniem lub modele fundamentowe. Jest dowodem na to, że kompaktowy system predykcyjny może tworzyć użyteczne krótkie plany na podstawie danych wizualnych.
To skromniejszy wniosek, ale zarazem technicznie znaczący.
Co obserwować po modelu świata Pokémon Red
Trzy testy kontrolne pokażą, czy jest to projekt lokalnego agenta nadający się do ponownego wykorzystania, czy udana demonstracja związana z jednym starannie ograniczonym zadaniem.
Pierwszym sygnałem jest wydajność w zróżnicowanych stanach początkowych. Mocniejsza ocena zaczynałaby się z wielu pozycji w laboratorium Oaka, obejmując nieznane orientacje i różne etapy dialogu.
Sukces w takich warunkach pokazałby, że model uchwycił więcej niż wąską ścieżkę przez jeden stan zapisu. Gwałtowny spadek sugerowałby, że planer silnie zależy od dokładnego rozkładu treningowego.
Drugim sygnałem jest dłuższy cel z krokami pośrednimi. stmonty zaproponował rozpoczęcie w innym miejscu laboratorium, dojście do Oaka, ukończenie jego dialogu, a następnie wybranie startera.
To zadanie nadal pozostaje wykonalne, ale zmusza model do utrzymania dłuższego rolloutu. Testuje też, czy planer potrafi połączyć ruch, interakcję i dialog w jedną spójną sekwencję.
Niezawodne wyniki w tym przypadku wzmocniłyby argument za lokalnym planowaniem predykcyjnym. Powtarzające się niepowodzenia potwierdziłyby, że długość horyzontu, a nie liczba parametrów czy wydajność GPU, pozostaje decydującym wąskim gardłem.
Trzecim sygnałem jest hierarchiczny kontroler. Programista stwierdził, że pełna gra wymagałaby wielu celów pośrednich i bardziej zróżnicowanych danych z walk, menu, dialogów i lokalizacji.
Przyszły system mógłby połączyć selektor celów wysokiego poziomu z niskopoziomowym modelem świata. Komponent wysokiego poziomu mógłby zdecydować o dotarciu do Oaka, wybraniu startera lub opuszczeniu budynku. Lokalny predyktor mógłby wyszukiwać wejścia potrzebne do ukończenia każdego kroku.
Taka konstrukcja stworzyłaby również wyraźniejsze punkty oceny. Badacze mogliby osobno mierzyć, czy system wybrał poprawny podcel, oraz czy planer działań go wykonał.
Programiści powinni też obserwować niezależne reprodukcje. Kod jest publiczny, ale wynik jednego autora nie pokazuje, jak wrażliwy jest rezultat na zbieranie danych, ziarna losowości, hiperparametry lub szczegóły implementacji.
Odtworzenie na innym konsumenckim GPU wzmocniłoby twierdzenie o dostępności. Test w innym środowisku wizualnym powiedziałby więcej o tym, czy metoda przenosi się poza Pokémon Red.
Najsilniejszym wkładem projektu nie jest ukończona gra. Jest nim przejrzysty zapis małego modelu, który zawiódł, ujawnił przyczynę niepowodzenia, a następnie poprawił się dzięki ukierunkowanej korekcie.
Ten przepływ pracy ma znaczenie dla lokalnych badań nad AI. Kompaktowe systemy ujawniają błędy, które mogą stać się trudne do zinterpretowania w znacznie większym stosie agentowym.
Model świata Pokémon stmonty’ego daje programistom również konkretne pytanie do dalszego zbadania. Jak wiele planowania może wspierać niewielka reprezentacja predykcyjna, zanim będzie potrzebować języka, pamięci, hierarchicznych celów lub innego sygnału treningowego?
Na razie odpowiedź prowadzi od jednego stanu zapisu w laboratorium do startera Pokémon. Kolejny wartościowy wynik pojawi się wraz z rozszerzeniem tej granicy bez ukrywania w systemie nowej pomocy.
Jeśli budujesz lokalnych agentów, kieruj się dowodami, a nie widowiskiem. Testuj nowe stany początkowe, mierz dryf rolloutu, porównuj znaczące punkty odniesienia i zapisuj każdą interwencję. Dłuższy udany plan wzmocni argument za kompaktowymi modelami świata. Załamanie poza laboratorium Oaka będzie równie użyteczne, ponieważ wskaże architektoniczne ograniczenie, którym musi zająć się następny eksperyment.



