stmonty의 Pokémon World Model은 로컬에서 실행되지만, 진짜 시험대는 장기 계획이다
개발자 stmonty는 RTX 3080 Ti 한 대에서 1,250만 파라미터 규모의 Pokémon world model을 학습시킨 뒤, 이를 이용해 Pokémon Red에서 스타터를 선택했다. 이 모델에는 게임 규칙이나 지도, Pokémon을 얻는 데 대한 보상이 주어지지 않았다. 대신 각 버튼 입력 뒤 어떤 일이 일어날지를 예측하며 학습했다.
이 결과는 AI가 게임을 플레이하는 시연 사례가 늘어나는 흐름의 또 다른 사례처럼 들릴 수 있다. 하지만 흥미로운 쟁점은 AI가 익숙한 게임 시퀀스를 완료할 수 있느냐가 아니다. 더 큰 언어 모델과 기존 강화학습 시스템은 이미 훨씬 폭넓은 Pokémon 과제에 도전해 왔다.
stmonty의 Pokémon world model은 더 좁은 명제를 시험한다. 작은 예측 모델이 스크린샷으로부터 유용한 환경 동역학을 학습하고, 학습한 표현 안에서 계획을 세우며, 독립 개발자가 사용할 수 있는 하드웨어에서 실행될 수 있을까?
답은 조건부로 그렇다. 미세 조정 후 이 모델은 계획된 100회의 시도 가운데 52회에서 스타터를 얻었다. 무작위 버튼 시퀀스에서는 성공이 한 번도 없었고, 학습되지 않은 예측기와 같은 탐색 과정을 결합했을 때는 한 번 성공했다.
이 수치는 학습된 모델이 유용한 정보를 제공했음을 보여준다. 동시에 프로젝트의 한계도 분명히 한다. 시작 위치는 신중하게 선택됐고, 계획은 버튼 입력 14회만을 다뤘으며, A 버튼을 반복해서 누르는 것만으로도 유효한 해법이었다.
따라서 이 프로젝트는 범용 Pokémon 플레이어가 아니라 접근 가능한 world model 실험의 증거를 제시한다. 가장 중요한 교훈은 한 행동을 예측하는 것과 여러 행동에 걸쳐 유용한 예측을 유지하는 것 사이의 격차에서 나온다.
이 격차는 이 실험을 두 AI 경로 간의 더 큰 경쟁 속에 위치시킨다. 한 경로는 언어 지식, 외부 도구, 메모리, 대규모 연산 자원을 갖춘 크고 범용적인 모델을 사용한다. 다른 경로는 특정 환경의 동역학을 중심으로 더 작은 시스템을 구축한다.
stmonty의 프로젝트가 이 경쟁의 승패를 가르는 것은 아니다. 다만 개발자에게 로컬 학습, 빠른 실험, 데이터에 대한 직접적인 통제가 필요할 때 컴팩트한 예측 모델이 왜 여전히 흥미로운지를 보여준다.
stmonty의 Pokémon World Model이 실제로 한 일
이 모델은 짧은 계획을 안내할 만큼의 게임 동역학을 학습했지만, Pokémon Red를 처음부터 끝까지 플레이하는 법을 익힌 것은 아니다.
stmonty는 처음에 훨씬 더 큰 목표를 고려했다. 제안된 시퀀스에는 Professor Oak의 연구실에 도달하고, 대화를 완료하며, 스타터를 선택하고, 건물을 나와 라이벌을 물리치는 과정이 포함됐다.
그 계획은 첫 실험으로는 빠르게 너무 야심 찬 것으로 드러났다. 과제는 Oak의 연구실 안에 있는 세이브 상태로 축소됐으며, 여기서 캐릭터는 Bulbasaur, Charmander, Squirtle 중 하나를 얻을 수 있었다.
그 위치에서는 A 버튼을 12번 누르는 것만으로 충분했다. 모델은 여전히 방향키를 누르거나, B로 대화를 취소하거나, 다른 유효한 시퀀스를 따를 수 있었다. 모델의 과제는 예측된 게임 상태를 성공적인 스타터 선택 사례에 가깝게 만드는 14개 행동 계획을 찾는 것이었다.
개발자는 Pokémon Red 에뮬레이터에서 42,382개의 그레이스케일 프레임을 기록했다. 이 프레임들은 스크린샷, 버튼 입력, 그다음 스크린샷으로 구성된 1,009개의 짧은 궤적을 형성했다.
일부 궤적은 스크립트된 경로를 따랐다. 다른 궤적에는 노이즈나 더 무작위적인 움직임이 추가됐다. 계획기는 합리적인 행동 시퀀스와 좋지 않은 행동 시퀀스를 모두 탐색하기 때문에 이러한 혼합은 중요했다.
완벽한 시연만 포함한 데이터셋은 A 버튼을 진행과 연관지을 수는 있어도, 취소, 막힌 이동, 무관한 입력에 대해서는 거의 학습하지 못할 수 있다. 더 어수선한 궤적은 모델에 지역 환경의 더 다양한 행동 양식을 노출했다.
결과 시스템은 JEPA, 즉 joint-embedding predictive architecture를 기반으로 했다. JEPA는 다음 이미지의 모든 픽셀을 재생성하는 대신 추상적 표현이 어떻게 변하는지를 예측한다.
이 차이는 학습 목표를 유용한 구조에 집중하게 한다. 인코더는 스크린샷을 관측된 상태의 수치 표현인 임베딩으로 변환한다. 이후 예측기는 현재 표현과 선택된 행동으로부터 다음 임베딩을 추정한다.
공개된 프로젝트 설명에 따르면 최종 네트워크는 약 1,250만 개의 파라미터로 구성됐고 RTX 3080 Ti에서 로컬로 학습됐다. 구현체는 lePokeRed repository에서도 확인할 수 있다.
학습 후 stmonty는 표현이 목표와 관련된 정보를 유지하는지 확인했다. 기반 인코더를 고정한 상태에서도 작은 분류기는 플레이어 파티에 Pokémon이 있는지를 식별할 수 있었다.
예측기는 현재 임베딩을 그대로 복사하는 기준선보다도 더 나은 성능을 보였다. 잘못된 행동을 제공하면 예측 성능이 저하됐으며, 이는 모델이 조작과 게임 변화 사이의 일부 관계를 학습했음을 시사한다.
이 테스트가 신뢰할 수 있는 계획 능력을 입증한 것은 아니다. 다만 모델이 관련 상태를 표현하고 선택된 버튼에 의미 있게 반응한다는 점을 보여줬다.
실제 평가는 계획기가 제안한 시퀀스를 에뮬레이터에서 실행했을 때 이뤄졌다. 롤아웃 미세 조정 이후, 제안된 한 시퀀스는 Squirtle을 선택하고 파티 수를 0에서 1로 바꿨다.
서로 다른 무작위 시드를 사용한 100회의 탐색에서 52개 계획이 스타터를 얻었다. 이 결과는 제한적인 주장을 뒷받침한다. 모델의 표현은 계획기가 고정된 시작 지점에서 유용한 행동을 찾는 데 도움을 줬다.
그러나 이것이 모델이 Pokémon Red를 독립적으로 숙달했다는 더 폭넓은 주장을 뒷받침하지는 않는다. stmonty는 커뮤니티 토론에서 현재 모델을 단순히 더 크게 만드는 것만으로는 게임의 수많은 중간 목표를 해결할 수 없다고 언급하며 그 격차를 명시적으로 인정했다.
모델은 다음에 일어날 일을 예측하며 어떻게 조작을 학습했나
핵심 메커니즘은 과제 보상 없이 예측한 뒤, 원하는 결과의 사례를 향해 계획을 세우는 것이었다.
학습 기록은 궤적에 성공 라벨을 붙이지 않았고, Pokémon을 얻었을 때 모델에 보상을 주지도 않았다. 초기 학습 동안 시스템은 다음 임베딩 상태를 예측하기만 했다.
현재 이미지에 대화 상자가 보이고 기록된 행동이 A였다면, 예측기는 일반적으로 그 조합 뒤에 어떤 표현이 나타나는지를 학습했다. 캐릭터가 벽을 마주하고 있다면, 방향 입력이 눈에 보이는 변화를 거의 만들지 않을 수 있다는 점을 학습할 수 있었다.
이 설정은 환경 학습과 목표 선택을 분리한다. 먼저 모델은 행동 후 관측치가 대체로 어떻게 변하는지를 학습한다. 이후 계획기는 이 예측 장치를 사용해 특정 결과를 탐색한다.
이 분리는 개발자가 이론적으로 하나의 학습된 환경 모델을 여러 목표에 재사용할 수 있다는 점에서 중요하다. 새 과제에는 새로운 목표 사례나 점수화 로직이 필요하지만, 반드시 환경 전체를 다시 구축할 필요는 없다.
이 아키텍처에는 심각한 실패 모드가 있었다. 함께 학습되는 인코더와 예측기는 모든 이미지를 동일한 표현으로 매핑함으로써 손실을 줄일 수 있다. 그러면 예측기는 유용한 정보를 보존하지 않은 채 완벽하게 일관된 상태가 된다.
이 문제는 latent collapse로 알려져 있다. LeWorldModel 설계는 학습된 표현을 분산된 Gaussian 형태로 유도하는 정규화 기법 SIGReg로 이를 완화한다.
기반이 된 LeWorldModel 논문은 이 접근법을 원시 픽셀에서 JEPA를 종단 간 학습하는 방법으로 제시한다. 저자는 Lucas Maes, Quentin Le Lidec, Damien Scieur, Yann LeCun, Randall Balestriero다.
LeWorldModel은 정규화 기법과 함께 다음 임베딩 예측 손실을 사용한다. 공식 연구 코드는 체크포인트, 데이터 참조 자료, 더 폭넓은 방법의 구현을 제공한다.
stmonty는 이 연구 방향을 Pokémon Red에 맞게 적용했다. 표현 학습이 끝난 뒤 개발자는 성공적인 Bulbasaur, Charmander, Squirtle 선택에서 얻은 임베딩을 계획기에 제공했다.
이 목표 임베딩은 올바른 경로를 명시하지 않으면서도 성공이 어떤 모습인지를 설명했다. 시스템은 이후 후보 버튼 시퀀스가 현재 상태를 어떻게 바꿀지를 상상했다.
탐색에는 더 나은 후보에 점차 집중하는 샘플링 과정인 cross-entropy method가 사용됐다. 각 라운드에서는 14개 행동을 포함하는 완전한 계획 512개가 생성됐다.
계획기는 예측 상태를 세 개의 목표 임베딩과 비교했다. 가장 낮은 거리를 보인 64개 계획을 유지한 뒤, 다음 샘플링 라운드에서 그 버튼 선택의 가능성을 높였다.
이 과정은 챗봇에게 무엇을 해야 하는지 묻는 것과는 다르다. 계획기는 기록된 스크린샷에서 학습한 동역학 안에서 탐색을 수행했다.
또한 전통적인 보상 기반 강화학습도 아니었다. world model은 좋은 행동과 나쁜 행동에 대한 누적 점수를 통해 학습하지 않았다. 목표는 학습 이후 성공적인 결과 사례와의 유사성을 통해 도입됐다.
이 설계는 매력적인 형태의 모듈성을 만들었다. 예측은 지역 환경을 포착했고, 목표 임베딩은 성공을 정의했으며, 탐색 알고리즘은 가능한 행동 시퀀스를 탐색했다.
첫 시도는 여전히 실패했다. 계획된 궤적은 학습된 표현 안에서는 성공적으로 보였지만, 에뮬레이터에서 실행했을 때 Pokémon을 얻지 못했다.
이 실패는 학습과 계획 사이의 불일치를 드러냈다. 일반 학습 중에는 각각의 한 단계 예측이 실제 스크린샷의 임베딩에서 시작됐다. 새로운 프레임마다 이전 예측 오류가 사실상 초기화됐다.
계획은 다르게 작동했다. 초기 스크린샷 이후 예측기는 다음 단계의 입력으로 자신의 추정 상태를 사용해야 했다. 작은 오류 하나하나가 다음 예측을 왜곡할 수 있었다.
여러 행동을 상상한 뒤 롤아웃은 계획기에는 매력적으로 보이지만 실제 게임과는 더 이상 일치하지 않는 표현으로 진입할 수 있었다. 그러면 탐색 과정은 모델의 실수를 활용하게 된다.
이는 예측 시스템에서 흔히 발생하는 문제다. 모델은 개별적인 다음 단계 예측에서는 좋은 점수를 받을 수 있지만, 자신의 출력이 이후 예측의 입력으로 사용될 때는 신뢰성이 떨어질 수 있다.
stmonty는 롤아웃 미세 조정으로 이를 해결했다. 인코더는 고정한 채 예측기와 행동 인코더가 이전의 추정 상태에서 예측하는 연습을 하도록 했다.
학습은 짧은 롤아웃으로 시작해 점차 길이를 늘렸다. 열두 번째 예측 단계에서 보고된 평균 제곱 오차는 0.4224에서 0.3045로 낮아졌다.
첫 번째 예측은 약간 나빠졌지만, 시퀀스 전반에서 오류는 더 천천히 누적됐다. 이는 하나의 고립된 단계를 최적화하는 것보다 지속적인 일관성이 더 중요한 계획 과제에 더 잘 맞는 절충이었다.
RTX 3080 Ti 한 대가 중요한 이유
이 소비자용 GPU가 중요한 이유는 작은 모델이 범용 AI 시스템을 대체할 수 있음을 증명해서가 아니라, 실험을 정신적으로 재현 가능하게 만들기 때문이다.
현대 AI 보도는 흔히 규모를 중심 서사로 다룬다. 파라미터 수는 수십억 단위에 이르고, 학습 클러스터는 수천 개의 가속기를 소비하며, 접근성은 클라우드 인프라에 좌우된다.
stmonty의 Pokémon world model은 더 작은 개발 루프에 주목하게 한다. 한 사람이 제한된 과제를 선택하고, 학습 데이터를 기록하며, 최신 연구를 적용하고, 계획 실패를 진단한 뒤, 관련 구성 요소를 로컬에서 다시 학습시켰다.
RTX 3080 Ti는 평범한 저사양 장치가 아니다. 12GB 메모리를 갖춘 성능 좋은 게이밍 GPU다. 하지만 최전선 파운데이션 모델에 사용되는 특수 클러스터와는 다른 범주에 속한다.
이 차이는 누가 아이디어를 시험할 수 있는지에 영향을 미친다. 로컬 개발은 연구자에게 체크포인트, 트레이스, 데이터세트, 실패 사례에 직접 접근할 수 있게 해 준다. 또한 모든 실험 입력을 호스팅 모델로 전송하지 않아도 된다.
이점은 특히 환경 특화 작업에서 분명하다. 로봇, 게임, 인터페이스, 시뮬레이션을 연구하는 개발자에게 광범위한 언어 능력이 꼭 필요한 것은 아니다. 소형 모델은 제한된 용량을 중요한 동역학에 집중할 수 있다.
소형 모델은 반복 작업도 쉽게 만든다. 여기서 rollout 파인튜닝이 그랬듯, 실패한 계획은 목표를 정한 변경으로 이어질 수 있다. 개발자는 대규모 범용 시스템을 다시 구축하지 않고도 실행 결과를 비교하고, 데이터 범위를 점검하며, 가정을 수정할 수 있다.
다만 로컬 학습이 자동으로 폭넓은 접근성을 의미하지는 않는다. 실험을 재현하려면 여전히 머신러닝 지식, 에뮬레이터 계측, 데이터 수집, 적절한 하드웨어, 그리고 인내가 필요하다.
보고된 모델 역시 하나의 게임에서 제한된 한 영역만 학습했다. 데이터세트는 Pokémon Red 전체 지도가 아니었고, 플래너는 고정된 세이브 상태에서 시작했다.
따라서 이 프로젝트는 접근 가능한 연구 프로토타입으로 이해하는 것이 가장 적절하다. 특정 실험 부류의 컴퓨팅 장벽은 낮추지만, 상당한 엔지니어링 장벽은 그대로 남아 있다.
더 폭넓은 LeWorldModel 연구는 이런 해석을 뒷받침한다. 논문은 실험 과제를 위해 단일 GPU에서 학습한 약 1,500만 파라미터 아키텍처를 설명한다. 일반 지능을 주장하는 대신 내비게이션, 조작, 모션 플래닝 환경을 평가한다.
개발자에게 유용한 신호는 아키텍처 효율성이다. 예측 표현은 사실적인 미래 프레임을 생성하거나 모든 선택을 언어로 설명할 필요가 없다. 계획에 필요한 만큼의 구조만 보존하면 된다.
이는 모델 크기와 다수의 후보 행동을 평가하는 비용을 줄일 수 있다. 또한 스크린샷과 텍스트 설명을 바탕으로 조작법을 추론하도록 프롬프트된 언어 모델보다 시스템의 목표를 더 구체적으로 만든다.
그러나 특화에는 자체적인 비용도 따른다. 개발자는 사람이 이미 이해하는 과제를 위해 4만 2,000개가 넘는 프레임을 수집해야 했다. 범용 모델은 Pokémon, 메뉴, 대화, 장기 목표에 관한 사전 지식을 활용할 수 있다.
따라서 경쟁 구도는 단순히 소형 대 대형이 아니다. 사전 지식 대 과제 특화 학습, 로컬 제어 대 범용 역량, 효율적 예측 대 유연한 추론의 문제다.
최근 Pokémon 실험은 이런 비교를 눈에 띄게 만든다. 일부 시스템은 언어 모델, 게임 메모리, 수작업으로 만든 행동 목록, 외부 코칭을 사용한다. 다른 시스템은 명시적 목표에 대해 강화학습을 적용한다.
stmonty의 모델은 더 엄격하게 시각적 접근을 택했다. 회색조 프레임과 기록된 입력으로 학습한 뒤, 생성된 표현을 통해 계획을 수립했다.
이처럼 좁은 입력은 프로젝트의 강점이자 한계다. 결과에 기술적 명확성을 부여하지만, 게임 전체를 해결하는 데 도움이 될 정보를 제거한다.
텍스트를 읽는 모델은 체육관 배지가 이후 진행을 해금한다는 점을 이해할 수 있다. Oak의 연구실 주변에서 학습한 예측 모델에는 그러한 위계에 대한 자연스러운 설명이 주어지지 않는다.
소비자용 하드웨어는 로컬 학습 루프를 주목할 만하게 만든다. 그렇다고 목표 구조, 다양한 데이터, 더 긴 기간에 걸쳐 작동하는 시스템의 필요성이 사라지는 것은 아니다.
진짜 상대는 계획 지평이다
이 실험에서 가장 어려운 문제는 버튼을 인식하는 일이 아니라, 계획이 익숙한 짧은 시퀀스를 넘어 확장될 때에도 예측의 유용성을 유지하는 일이었다.
14개 행동의 지평만으로도 첫 번째 플래너를 무너뜨릴 만큼 충분한 드리프트가 발생했다. 개별 전환은 그럴듯해 보였지만, 모델의 예측 상태는 에뮬레이터의 실제 상태에서 점차 멀어졌다.
더 긴 Pokémon 목표는 이 문제를 증폭시킨다. 방을 통과하려면 공간 탐색이 필요하다. 대화에는 이전 선택에 대한 맥락이 필요하다. 전투에는 메뉴, 체력, 타입, 기술, 변화하는 상대가 추가된다.
완전한 게임에는 수 시간에 걸쳐 분산된 의존성도 존재한다. 플레이어는 중간 목표를 발견하고, 완료한 작업을 기억하며, 필요한 아이템을 얻고, 이전 계획이 실패했을 때 조정해야 한다.
stmonty는 Hacker News 토론에서 이 문제를 직접 짚었다. 게임 전체 완료로 확장하려면 중간 목표를 위한 표현과 이를 시간에 따라 배치하는 방법이 필요하다.
같은 단기 지평 네트워크를 더 크게 만든다고 해도 그러한 위계를 위한 명시적 메커니즘은 여전히 부족하다. 파라미터를 늘리면 예측은 개선될 수 있지만, 다음 목표가 되어야 할 배지, 아이템, 위치를 자동으로 식별하지는 못한다.
이 지점에서 범용 모델은 우위를 갖는다. 언어 지식을 활용해 게임 개념을 인식하고, 가이드, 대화, 메모리에 설명된 순서를 추론할 수 있다.
이들의 약점은 다르다. 광범위한 모델은 행동을 환각하거나, 상태를 놓치거나, 같은 실수를 반복하거나, 단순한 조작 판단에 상당한 자원을 사용할 수 있다.
과제 특화 월드 모델은 로컬 동역학을 더 효율적으로 처리할 수 있다. 상위 수준 시스템이 목표를 선택하고, 예측 모델이 짧은 시퀀스를 처리하도록 구성할 수 있다.
이런 계층형 설계는 커뮤니티 토론에서도 등장했다. 한 참여자는 서로 다른 시간 척도에서 작동하는 계층형 월드 모델을 제안했다. 상위 구성요소는 체육관을 이기는 일을 추론하고, 하위 모델은 개별 입력을 예측할 수 있다.
이런 시스템은 많은 실용 에이전트가 구성되는 방식과 닮아 있다. 한 구성요소는 목표를 유지하고, 다른 구성요소는 환경을 모델링하며, 컨트롤러는 행동을 선택하거나 검증한다.
하지만 현재 실험은 이런 아키텍처를 시험하지 않았다. 세 개의 스타터 목표 임베딩, 하나의 시작 위치, 고정된 계획 지평만 사용했다.
52% 성공률도 신중하게 해석할 필요가 있다. 무작위 기준선보다 훨씬 높았지만, 동일한 초기 상태에서 반복 검색한 결과였다.
모델은 서로 다른 방, 보지 못한 대화, 변화하는 인벤토리, 전투 전반에서의 회복력을 보여주지 못했다. 이러한 시험에는 더 폭넓은 데이터와 더 다양한 시작 조건이 필요하다.
실험에는 또 하나의 중요한 기준선이 있다. 해당 세이브 상태에서는 A 버튼을 12번 누르는 것만으로도 과제가 완료됐다.
이 사실이 학습된 모델의 기여를 없애지는 않는다. 무작위 행동 시퀀스는 여전히 실패했고, 학습된 예측기는 검색이 유효한 계획을 발견하도록 도왔다. 하지만 시스템이 폭넓은 전략적 이해를 보였다는 주장은 약화된다.
진정한 성과는 목표 지향적 검색을 뒷받침하는 표현을 학습했다는 데 있다. 진정한 불확실성은 성공이 더 길고 다양한 인과 관계 사슬에 달려 있을 때도 이 표현이 유용한지 여부다.
전통적 강화학습은 또 다른 비교 대상이다. 토론에서 언급된 연결된 Pokémon 에이전트는 훨씬 더 광범위한 게임 목표를 위해 proximal policy optimization을 사용했다.
이 접근은 명시적인 보상 설계와 반복 상호작용에 의존한다. 반면 stmonty의 Pokémon 월드 모델은 초기 학습 중 스타터 목표를 받지 않고도 동역학을 학습했다.
어느 접근도 보편적으로 우세하지는 않다. 보상 기반 에이전트는 행동을 직접 최적화할 수 있고, 월드 모델은 환경 예측을 이후 목표와 분리할 수 있다.
핵심 질문은 환경이 확장될수록 어떤 방법이 효율성을 유지하느냐이다. 더 폭넓은 평가는 데이터 요구량, 학습 시간, 실패율, 세이브 상태 간 일반화를 비교해야 한다.
그러한 측정이 없다면, 이 프로젝트를 소형 월드 모델이 강화학습이나 파운데이션 모델보다 뛰어나다는 증거로 제시해서는 안 된다. 이는 소형 예측 시스템이 시각 데이터로부터 유용한 단기 계획을 만들 수 있다는 증거다.
이는 더 작은 결론이지만, 기술적으로는 더 의미 있는 결론이기도 하다.
Pokémon Red 월드 모델 이후 주목할 점
세 가지 후속 시험은 이것이 재사용 가능한 로컬 에이전트 설계인지, 아니면 신중하게 제한된 하나의 과제에 묶인 성공적 시연인지를 보여줄 것이다.
첫 번째 신호는 다양한 시작 상태에서의 성능이다. 더 강력한 평가는 낯선 방향과 서로 다른 대화 단계까지 포함해 Oak의 연구실 내부 여러 위치에서 시작해야 한다.
그 조건에서 성공한다면 모델이 하나의 세이브 상태를 통과하는 좁은 경로 이상을 포착했다는 뜻이다. 성능이 급격히 떨어진다면 플래너가 정확한 학습 분포에 크게 의존한다는 점을 시사한다.
두 번째 신호는 중간 단계를 포함하는 더 긴 목표다. stmonty는 연구실의 다른 지점에서 시작해 Oak에게 걸어가고, 그의 대화를 완료한 뒤, 스타터를 선택하는 과제를 제안했다.
이 과제는 여전히 관리 가능하지만, 모델이 더 긴 rollout을 유지하도록 강제한다. 또한 플래너가 이동, 상호작용, 대화를 하나의 일관된 시퀀스로 연결할 수 있는지도 시험한다.
여기서 신뢰할 수 있는 결과가 나오면 로컬 예측 계획의 근거가 강화된다. 반복된 실패는 파라미터 수나 GPU 용량이 아니라 지평 길이가 여전히 결정적인 병목임을 확인할 것이다.
세 번째 신호는 계층형 컨트롤러다. 개발자는 게임 전체를 다루려면 여러 중간 목표와 전투, 메뉴, 대화, 위치에서 수집한 더 다양한 데이터가 필요하다고 말했다.
미래 시스템은 상위 수준 목표 선택기와 하위 수준 월드 모델을 결합할 수 있다. 상위 구성요소는 Oak에게 도달할지, 스타터를 선택할지, 건물을 나설지를 결정할 수 있다. 로컬 예측기는 각 단계를 완료하는 데 필요한 입력을 검색할 수 있다.
이 설계는 더 명확한 평가 지점도 만든다. 연구자는 시스템이 올바른 하위 목표를 선택했는지와 행동 플래너가 이를 실행했는지를 별도로 측정할 수 있다.
개발자는 독립적인 재현 사례도 지켜봐야 한다. 코드가 공개돼 있지만, 한 명의 저자가 얻은 결과만으로는 데이터 수집, 시드, 하이퍼파라미터, 구현 세부사항에 결과가 얼마나 민감한지 알 수 없다.
다른 소비자용 GPU에서 재현된다면 접근성 주장이 강화될 것이다. 다른 시각 환경에서 시험한다면 이 방법이 Pokémon Red를 넘어 이전되는지에 대해 더 많은 것을 말해줄 수 있다.
프로젝트의 가장 큰 기여는 완성된 게임이 아니다. 소형 모델이 실패하고, 실패 이유를 드러내며, 목표를 정한 조정을 통해 개선되는 과정을 투명하게 기록했다는 점이다.
이 워크플로는 로컬 AI 연구에서 중요하다. 소형 시스템은 훨씬 큰 에이전트 스택 내부에서는 해석하기 어려워질 수 있는 오류를 드러낸다.
stmonty의 Pokémon 월드 모델은 개발자에게 구체적으로 추구할 질문도 제시한다. 소형 예측 표현은 언어, 메모리, 계층형 목표 또는 다른 학습 신호가 필요해지기 전까지 얼마나 많은 계획을 뒷받침할 수 있을까?
현재로서는 답이 하나의 연구실 세이브 상태에서 스타터 Pokémon까지 이어진다. 다음으로 가치 있는 결과는 새로운 도움을 시스템 내부에 숨기지 않으면서 이 경계를 확장하는 데서 나올 것이다.
로컬 에이전트를 구축한다면, 화려한 장면보다 증거를 따르라. 새로운 시작 상태를 시험하고, rollout 드리프트를 측정하며, 의미 있는 기준선을 비교하고, 모든 개입을 기록하라. 더 긴 성공 계획은 소형 월드 모델의 근거를 강화할 것이다. Oak의 연구실 밖에서 붕괴한다 해도 그만큼 유용하다. 다음 실험이 해결해야 할 아키텍처적 한계를 식별해 줄 것이기 때문이다.



