top of page

stmontyのPokémon World Modelはローカルで動作するが、本当の試練は長期計画だ

10月1日
読了時間: 18分

開発者のstmontyは、RTX 3080 Ti 1基で1,250万パラメータのPokémon world modelを訓練し、Pokémon Redでスターターを選ぶために使った。このモデルにはゲームのルールもマップも、Pokémonを入手した際の報酬も与えられていない。各ボタン操作の後に何が起きるかを予測することで学習した。

この結果は、AIがゲームをプレイするデモの増加に加わるものに聞こえるかもしれない。しかし興味深い論点は、AIがよく知られたゲーム内の一連の手順を完了できるかどうかではない。より大規模な言語モデルや従来型の強化学習システムは、すでにPokémonにおけるはるかに広範な課題に取り組んでいる。

stmontyのPokémon world modelは、より限定的な仮説を検証している。小規模な予測モデルは、スクリーンショットから有用な環境ダイナミクスを学び、学習済みの表現空間内で計画を立て、個人開発者が利用できるハードウェア上で動作できるのか。

答えは条件付きでイエスだ。ファインチューニング後、モデルは計画された100回の試行のうち52回でスターターを入手した。ランダムなボタン列では成功が記録されず、未訓練の予測器と同じ探索プロセスを組み合わせた場合の成功は1回だった。

これらの数値は、学習済みモデルが有用な情報を提供したことを示している。同時に、このプロジェクトの境界も明確にしている。開始位置は慎重に選ばれ、計画はわずか14回のボタン操作に限られ、Aを繰り返し押すだけでも有効な解法だった。

したがって、このプロジェクトが示すのは、誰もが利用しやすいworld model実験の証拠であって、汎用的なPokémonプレイヤーではない。最も重要な教訓は、1つの行動を予測することと、多数の行動にわたって有用な予測を維持することの隔たりにある。

この隔たりにより、この実験は2つのAIアプローチのより大きな競争の中に位置づけられる。一方は、言語知識、外部ツール、記憶、大規模な計算資源を備えた大規模な汎用モデルを用いる。もう一方は、特定の環境のダイナミクスを中心に小規模なシステムを構築する。

stmontyのプロジェクトは、この競争に決着をつけるものではない。ただし、特に開発者がローカルでの訓練、迅速な実験、データへの直接的な制御を必要とする場合に、コンパクトな予測モデルが依然として注目に値する理由を示している。

stmontyのPokémon World Modelは実際に何をしたのか

このモデルは短い計画を導くのに十分なゲームダイナミクスを学んだが、Pokémon Redを最初から最後までプレイすることを学んだわけではない。

stmontyは当初、はるかに大きな目標を検討していた。想定された手順には、Professor Oakの研究所に到達し、会話を完了し、スターターを選び、建物を出て、ライバルを倒すことが含まれていた。

この計画は、最初の実験としてはすぐに野心的すぎると判明した。課題はOakの研究所内のセーブ状態まで縮小され、そこではキャラクターがBulbasaur、Charmander、Squirtleを入手できた。

その位置からは、Aを12回押せば十分だった。モデルは方向入力を行ったり、Bで会話をキャンセルしたり、別の有効な手順をたどったりすることもできた。その仕事は、予測されたゲーム状態をスターター選択成功例に近づける14アクションの計画を特定することだった。

開発者はPokémon Redエミュレーターから42,382枚のグレースケールフレームを記録した。これらのフレームは、スクリーンショット、ボタン操作、その次のスクリーンショットを含む1,009本の短い軌跡を構成した。

一部の軌跡はスクリプト化されたルートに従った。ほかにはノイズや、よりランダムな移動が加えられた。この混合は、プランナーが合理的な行動列と不適切な行動列の両方を探索するため重要だった。

完全な実演だけを含むデータセットでは、Aと進行を関連付けられても、キャンセル、移動不能な状況、無関係な入力についてはほとんど学べない可能性がある。より雑然とした軌跡により、モデルは局所環境のより幅広い挙動に触れられた。

得られたシステムは、joint-embedding predictive architecture、すなわちJEPAであるLeWorldModelを基盤としていた。JEPAは、次の画像のすべてのピクセルを再現するのではなく、抽象的な表現がどのように変化するかを予測する。

この違いにより、訓練目標は有用な構造に集中できる。エンコーダーはスクリーンショットをembedding、すなわち観測状態の数値表現に変換する。続いて予測器が、現在の表現と選択した行動から次のembeddingを推定する。

公開されたプロジェクトの説明によると、最終ネットワークは約1,250万パラメータで構成され、RTX 3080 Ti上でローカルに訓練された。実装はlePokeRed repositoryでも公開されている。

訓練後、stmontyは表現が目標に関する情報を保持しているかを確認した。基盤となるエンコーダーを凍結したまま、小規模な分類器でプレイヤーのパーティにPokémonがいるかどうかを特定できた。

予測器は、現在のembeddingをコピーするベースラインよりも優れた性能も示した。誤った行動を与えると予測が悪化したことから、操作とゲーム内変化の関係をある程度学んだことが示唆される。

これらのテストは、信頼できる計画能力を立証したものではない。モデルが関連する状態を表現し、選択されたボタンに意味のある反応をしたことを示したにすぎない。

真の評価は、プランナーの行動列をエミュレーター内で実行したときに行われた。ロールアウト・ファインチューニング後、提案されたある行動列はSquirtleを選択し、パーティ数をゼロから1へと変化させた。

異なるランダムシードを使った100回の探索では、52の計画がスターターを入手した。この結果は限定的な主張を支持する。すなわち、モデルの表現が、固定された開始地点から有用な行動を見つけるプランナーを支援したということだ。

これは、モデルがPokémon Redを独力で習得したというより広範な主張を支持するものではない。stmontyはこの隔たりを明確に認め、コミュニティでの議論で、現在のモデルを単に大きくするだけではゲームにある数多くの中間目標を解決できないと述べている。

次に起きることを予測してモデルが操作を学んだ仕組み

中心となった仕組みは、タスク報酬なしの予測と、それに続く望ましい結果の例に向けた計画だった。

訓練記録では、軌跡に成功というラベルを付けたり、Pokémonの入手に対してモデルへ報酬を与えたりしていない。初期訓練中、システムは次の埋め込み状態を予測することだけを試みた。

現在の画像に会話ボックスが表示され、記録された行動がAだった場合、予測器はその組み合わせの後に一般的に続く表現を学習する。キャラクターが壁に向いていれば、方向入力をしても見た目の変化がほとんど生じないことを学べる可能性がある。

この設定は、環境学習を目標選択から分離する。まずモデルは、行動の後に観測がどのように変化する傾向があるかを学ぶ。後にプランナーが、その予測機構を使って特定の結果を探索する。

この分離は重要である。理論上、開発者は1つの学習済み環境モデルを複数の目標に再利用できる。新しいタスクには新しい目標例やスコアリングロジックが必要になるが、必ずしも環境全体の再構築は必要ない。

このアーキテクチャには重大な失敗モードがあった。共同で訓練されたエンコーダーと予測器は、すべての画像を同じ表現に写像することで損失を減らせる。すると予測器は、何ら有用な情報を保持せずとも完全に一貫したものになる。

この問題はlatent collapseとして知られている。LeWorldModelの設計は、学習された表現を分散したガウス型の形状へと押し出す正則化手法SIGRegでこれに対処する。

基礎となるLeWorldModel論文は、このアプローチを生のピクセルからJEPAをエンドツーエンドで訓練する方法として提示している。著者にはLucas Maes、Quentin Le Lidec、Damien Scieur、Yann LeCun、Randall Balestrieroが含まれる。

LeWorldModelは、正則化手法と並行して次のembeddingの予測損失を用いる。公式の研究コードには、チェックポイント、データ参照、より広範な手法の実装が用意されている。

stmontyは、この研究の方向性をPokémon Redに適用した。表現の訓練後、開発者はBulbasaur、Charmander、Squirtleの選択成功時のembeddingをプランナーに与えた。

これらの目標embeddingは、正しい経路を指定せずに成功の姿を記述した。システムはその後、候補となるボタン列が現在の状態をどのように変えるかを想定した。

探索にはcross-entropy methodが用いられた。これは、より良い候補へと徐々に集中するサンプリングプロセスである。各ラウンドでは、14の行動を含む512の完全な計画が生成された。

プランナーは予測状態を3つの目標embeddingと比較した。距離が最も小さい64の計画を保持し、次のサンプリングラウンドではそれらのボタン選択の確率を高めた。

このプロセスは、チャットボットに何をすべきか尋ねることとは異なる。プランナーは、記録されたスクリーンショットから学習したダイナミクスの内部で探索していた。

また、これは古典的な報酬駆動型強化学習でもなかった。world modelは、良い行動と悪い行動に対する継続的なスコアによって学習したわけではない。目標は訓練後、成功した結果の例との類似性を通じて導入された。

この設計は魅力的なモジュール性を生んだ。予測が局所環境を捉え、目標embeddingが成功を定義し、探索アルゴリズムが可能な行動列を調べた。

最初の試みは依然として失敗した。計画された軌跡は学習済み表現の中では成功しているように見えたが、エミュレーターで実行してもPokémonを入手しなかった。

この失敗は、訓練と計画の間にある不一致を浮き彫りにした。通常の訓練では、各1ステップ予測は実際のスクリーンショットのembeddingから始まる。新しいフレームが現れるたびに、それまでの予測誤差は実質的にリセットされた。

計画は異なる仕組みで動く。最初のスクリーンショット以降、予測器は次のステップへの入力として自らが推定した状態を使わなければならない。小さな誤差一つひとつが、次の予測を歪めうる。

複数の行動を想定した後、ロールアウトはプランナーには魅力的に見えても、実際のゲームと一致しない表現に入り込む可能性がある。すると探索プロセスはモデルの誤りを利用してしまう。

これは予測システムに共通する問題だ。モデルは個別の次ステップ予測で高いスコアを出せても、自身の出力が将来の予測へ入力されると信頼性を失うことがある。

stmontyはロールアウト・ファインチューニングでこれに対処した。エンコーダーは固定したまま、予測器と行動エンコーダーに、以前に推定した状態から予測する訓練を行わせた。

訓練は短いロールアウトから始まり、徐々に延長された。予測の12ステップ目では、報告された平均二乗誤差は0.4224から0.3045へ低下した。

最初の予測はわずかに悪化したが、行動列全体での誤差蓄積はより緩やかになった。このトレードオフは、単独の1ステップを最適化することより持続的な一貫性が重要となる計画タスクに、より適していた。

RTX 3080 Ti 1基が重要な理由

このコンシューマーGPUが重要なのは、実験を精神的な意味で再現可能にするためであり、小規模モデルが汎用AIシステムを置き換えられることを証明するからではない。

現代のAI報道では、規模が中心的な物語として扱われることが多い。パラメータ数は数十億に達し、訓練クラスターは数千のアクセラレーターを消費し、利用可否はクラウドインフラに依存する。

stmontyのPokémon world modelは、より小さな開発サイクルへと注目を移す。1人の人間が制約されたタスクを選び、訓練データを記録し、近年の研究を適用し、計画の失敗を診断し、関連するコンポーネントをローカルで再訓練した。

RTX 3080 Tiは、ありふれた低性能デバイスではない。12 GBのメモリを備えた、十分に高性能なゲーミングGPUだ。それでも、最先端の基盤モデルに使われる専用クラスタとは別のカテゴリーに属する。

この違いは、誰がアイデアを検証できるかに影響する。ローカル開発では、研究者がチェックポイント、トレース、データセット、失敗例に直接アクセスできる。また、実験の入力をすべてホスト型モデルへ送る必要もない。

この利点は、環境固有の作業で特に明確になる。ロボット、ゲーム、インターフェース、シミュレーションを調べる開発者に、幅広い言語能力は必ずしも必要ない。コンパクトなモデルなら、限られた能力を重要なダイナミクスに集中させられる。

小型モデルは反復も容易にする。今回のロールアウト・ファインチューニングのように、失敗した計画は的を絞った変更につながる。開発者は巨大な汎用システムを作り直さずに、実行結果を比較し、データのカバレッジを調べ、前提を見直せる。

ただし、ローカル学習が自動的に幅広い利用可能性を意味するわけではない。この実験を再現するには、依然として機械学習の知識、エミュレータの計測、データ収集、適切なハードウェア、そして忍耐が必要だ。

報告されたモデルが学習したのも、1本のゲームにおける限定的な1つの領域だった。データセットは『Pokémon Red』の完全なマップではなく、プランナーは固定されたセーブ状態から開始している。

したがって、このプロジェクトは利用しやすい研究プロトタイプとして捉えるのが適切だ。特定の実験クラスにおける計算資源の障壁を下げる一方で、相当なエンジニアリング上の障壁は残している。

より広範なLeWorldModel研究も、この解釈を裏づけている。この論文は、実験タスク向けに単一GPUで学習した、約1,500万パラメータのアーキテクチャを説明している。一般知能を主張するのではなく、ナビゲーション、操作、モーションプランニングの環境を評価対象としている。

開発者にとって有益な示唆は、アーキテクチャの効率性にある。予測表現は、写実的な未来フレームを生成したり、あらゆる選択を言語化したりする必要はない。計画に必要な構造を十分に保持すればよい。

それにより、モデル規模と多数の候補行動を評価するコストを削減できる。また、スクリーンショットと文章から操作方法を推測するよう促された言語モデルよりも、システムの目的を具体的にできる。

一方で、特化には固有のコストもある。開発者は、人間ならすでに理解しているタスクのために4万2,000フレーム以上を収集しなければならなかった。汎用モデルなら、Pokémon、メニュー、会話、長期目標に関する事前知識を持ち込める可能性がある。

したがって、対比は単純に小型対大型ではない。事前知識対タスク固有学習、ローカル制御対汎用的能力、効率的な予測対柔軟な推論の問題だ。

近年のPokémon実験は、この比較を可視化している。一部のシステムは言語モデル、ゲームメモリ、手作業で作成した行動リスト、外部コーチングを使用する。別のシステムは、明示的な目標に対して強化学習を用いる。

stmontyのモデルは、より厳格に視覚情報へ依存する方式を取った。グレースケールフレームと記録された入力から学習し、得られた表現を通じて計画した。

この狭い入力範囲は、プロジェクトの強みであると同時に限界でもある。結果に技術的な明確さを与える一方、ゲーム全体を解く助けとなる情報を取り除いている。

テキストを読めるモデルなら、ジムバッジが後の進行を解放することを理解できる。Oakの研究所周辺で学習した予測モデルには、その階層構造を自然に説明する手がかりがない。

コンシューマー向けハードウェアによって、ローカル学習のループは注目に値するものになった。ただし、目標構造、多様なデータ、より長い期間にわたって動作するシステムの必要性をなくすわけではない。

真の相手は計画ホライズン

この実験で最も難しかったのはボタンの認識ではなく、計画が身近な短いシーケンスを超えても予測を有用に保つことだった。

14アクションのホライズンでも、最初のプランナーを失敗させるのに十分なドリフトが生じた。個々の遷移はもっともらしく見えても、モデルが予測した状態は徐々にエミュレータの実際の状態から離れていった。

より長いPokémonの目標では、この問題が増幅する。部屋を歩くには空間ナビゲーションが必要になる。会話には、それ以前の選択に関する文脈が求められる。バトルでは、メニュー、体力、タイプ、技、変化する相手が加わる。

ゲーム全体には、数時間にまたがる依存関係も存在する。プレイヤーは中間目標を発見し、完了済みのタスクを記憶し、必要なアイテムを入手し、以前の計画が失敗した際には修正しなければならない。

stmontyはHacker Newsでのやり取りで、この問題を直接指摘した。完全クリアへ拡張するには、中間目標の表現と、それらを時間軸上で配置する手段が必要になる。

同じ短期ホライズンのネットワークを大型化しても、この階層を扱う明示的な仕組みは依然として欠ける。パラメータを増やせば予測は改善するかもしれないが、次の目標としてどのバッジ、アイテム、場所を選ぶべきかを自動的に特定するわけではない。

ここでは、汎用モデルが優位性を持つ。言語知識を用いてゲームの概念を認識し、攻略ガイド、会話、記憶に記述された一連の手順について推論できるからだ。

弱点は別のところにある。幅広い能力を持つモデルは、行動を幻覚したり、状態を見失ったり、同じ失敗を繰り返したり、単純な操作判断に多大なリソースを費やしたりする可能性がある。

タスク固有のワールドモデルなら、局所的なダイナミクスをより効率よく処理できる。上位システムが目標を選択し、予測モデルが短いシーケンスを扱うことも可能だ。

この階層化された設計は、コミュニティの議論にも登場した。ある参加者は、異なる時間スケールで動作する階層型ワールドモデルを提案した。上位コンポーネントがジムを攻略することを考え、下位モデルが個別の入力を予測する、といった構成だ。

このようなシステムは、多くの実用的なエージェントの構成に似ている。あるコンポーネントが目標を維持し、別のコンポーネントが環境をモデル化し、コントローラーが行動を選択または検証する。

しかし、現在の実験はそのアーキテクチャを検証していない。開始時の目標埋め込みは3つ、開始位置は1つ、計画ホライズンは固定だった。

成功率52%も慎重に解釈する必要がある。ランダムベースラインを大きく上回ったが、同じ初期状態に対する反復探索から得られた結果だった。

モデルは、異なる部屋、未見の会話、変化する所持品、バトルをまたいだ頑健性を示してはいない。そうしたテストには、より広いデータと多様な開始条件が必要になる。

実験には、もう1つ重要なベースラインがある。セーブ状態からは、Aを12回押すだけでタスクを完了できた。

この事実は、学習済みモデルの貢献を消し去るものではない。ランダムな行動列は依然として失敗し、学習済み予測器は探索が有効な計画を見つける助けとなった。ただし、このシステムが幅広い戦略的理解を示したという主張は弱まる。

真の成果は、目標指向の探索を支える表現を学習したことだ。真の不確実性は、より長く多様な因果連鎖に成功が依存する場合にも、その表現が有用であり続けるかどうかにある。

従来の強化学習も、別の比較対象となる。議論内で引用されたリンク先のPokémon agentは、より広範なゲーム目標に対して近接方策最適化を用いた。

この方法は、明示的な報酬設計と反復的な相互作用に依存する。一方、stmontyのPokémonワールドモデルは、初期学習時にはスターター選択という目標を受け取らずにダイナミクスを学習した。

どちらの手法も普遍的に優れているわけではない。報酬駆動型エージェントは行動を直接最適化でき、ワールドモデルは環境予測を後の目標から分離できる。

重要な問いは、環境が拡大した際にどの手法が効率を維持できるかだ。より広範な評価では、データ要件、学習時間、失敗率、セーブ状態をまたぐ汎化を比較すべきだろう。

こうした測定がない以上、このプロジェクトを、小型ワールドモデルが強化学習や基盤モデルを上回る証拠として位置付けるべきではない。視覚データから、コンパクトな予測システムが有用な短期計画を生成できる証拠ではある。

これはより限定的な結論だが、技術的に意味のある結論でもある。

Pokémon Redワールドモデルの後に注目すべきこと

これは再利用可能なローカルエージェント設計なのか、それとも慎重に範囲を限定した1つのタスクに結び付いた成功例なのか。3つの追試がその答えを示すだろう。

最初の指標は、多様な開始状態での性能だ。より強い評価では、見慣れない向きや異なる会話段階を含め、Oakの研究所内にある複数の位置から開始する。

こうした条件で成功すれば、モデルが1つのセーブ状態における狭い経路以上のものを捉えたことを示す。急激に性能が低下するなら、プランナーが正確な学習分布に強く依存している可能性を示唆する。

2つ目の指標は、中間ステップを含むより長い目標だ。stmontyは、研究所内の別の場所から始め、Oakのもとまで歩き、会話を完了し、それからスターターを選ぶことを提案している。

このタスクは依然として扱いやすいが、モデルにより長いロールアウトを維持させる。また、プランナーが移動、相互作用、会話を1つの首尾一貫したシーケンスに接続できるかも検証する。

そこで信頼できる結果が得られれば、ローカル予測プランニングの根拠は強まる。繰り返し失敗すれば、パラメータ数やGPU能力ではなく、ホライズン長が決定的なボトルネックであることを裏づける。

3つ目の指標は階層型コントローラーだ。開発者は、ゲーム全体には複数の中間目標と、バトル、メニュー、会話、場所に関するより多様なデータが必要になると述べた。

将来のシステムは、上位の目標選択器と下位のワールドモデルを組み合わせられる。上位コンポーネントはOakに到達する、スターターを選ぶ、建物を出るといった判断を担い、ローカル予測器は各ステップを完了するために必要な入力を探索できる。

この設計は、より明確な評価ポイントも生む。研究者は、システムが正しいサブゴールを選んだかと、行動プランナーがそれを実行できたかを分けて測定できる。

開発者は独立した再現実験にも注目すべきだ。コードは公開されているが、単一の著者による結果だけでは、データ収集、シード、ハイパーパラメータ、実装の詳細に結果がどれほど敏感かは分からない。

別のコンシューマーGPUで再現できれば、利用しやすさに関する主張は強まる。別の視覚環境で試験すれば、この手法がPokémon Redを超えて移転可能かについて、より多くを語れる。

このプロジェクトの最大の貢献は、ゲームを完了したことではない。小型モデルが失敗し、失敗理由を明らかにし、的を絞った調整によって改善していく過程を透明に記録したことだ。

このワークフローは、ローカルAI研究にとって重要である。コンパクトなシステムでは、はるかに大きなエージェントスタックの内部では解釈が困難になり得るエラーが露出する。

stmontyのPokémonワールドモデルは、開発者に具体的な問いも与えている。小さな予測表現は、言語、記憶、階層的目標、あるいは別の学習信号を必要とするまでに、どれほどの計画を支えられるのか。

現時点では、その答えは研究所の1つのセーブ状態からスターターPokémonまでに及ぶ。次に価値ある成果は、新たな支援をシステム内に隠すことなく、その境界を拡張することから生まれるだろう。

ローカルエージェントを構築するなら、見世物ではなく証拠に従うべきだ。新しい開始状態をテストし、ロールアウトのドリフトを測定し、意味のあるベースラインを比較し、すべての介入を記録する。より長い成功計画は、コンパクトなワールドモデルの有効性を強める。Oakの研究所の外で破綻したとしても、それは同じくらい有用だ。次の実験で対処すべきアーキテクチャ上の限界を特定できるからである。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)とM-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page