WorldWeaverはマルチエージェント動画モデルに共有メモリを与えるが、Minecraftは最初の試験場にすぎない
- Aisha Washington

- 1 時間前
- 読了時間: 19分
WorldWeaverは、直近のフレームだけから世界を再構築するパイプラインに異を唱え、2エージェント動画モデルに明示的な共有メモリを導入した。W²とも呼ばれるこのモデルは、同期したMinecraftの視点を生成しながら、世界の状態レジスタに変化し続ける情報を保存する。その結果は、永続的なインタラクティブ世界にとって、もっともらしい動画だけでは不十分であることを示唆している。
この研究はUCLAとAdobe Researchの研究者によるものだ。研究チームは2026年7月23日、WorldWeaver paperを投稿した。その中心的な争点はアーキテクチャにある。すなわち、永続的な共有状態と、ローリングするコンテキストウィンドウ内に圧縮された観測履歴の対比だ。
この違いが重要なのは、複数のエージェントがまったく同じ場面を見ることはないためだ。あるプレイヤーが壁の裏へ移動する一方で、別のプレイヤーは外で建築を続けることができる。見えているピクセルしか記憶しないモデルは、これらの視点が再びつながったとき、隠れた変化を再構成しなければならない。
これに対しWorldWeaverは、共有環境と各エージェントの状態を要約する学習可能なトークンを維持する。生成チャンクのたびにそれらのトークンを更新する。次のチャンクは直近のフレームと、最新の確定済み状態の両方に依存する。
研究者による2人プレイヤーMinecraft評価の範囲では、報告された改善は大きい。WorldWeaverは総合世界スコア105.1に到達し、再訓練したSolarisベースラインの81.0を上回った。ただし、この実験は依然として限定的で、シミュレータに基づいており、現実環境ではほとんど得られない教師信号に依存している。
WorldWeaverは生成器の内部に共有状態を持ち込む
重要な変更は動画メモリのさらなる改善ではなく、エージェントとロールアウトの各ステップをまたいで持続する独立した状態経路である。
ストリーミング自己回帰拡散モデルは、動画を連続したチャンクとして生成する。各チャンクは、直近のフレームと、中間的な注意情報を保存するキー・バリューキャッシュを通じて、次のチャンクを条件付ける。この設計により、履歴全体を開き直すことなく生成を扱いやすくしている。
制約は、ある観測がその直近のウィンドウから消えたときに現れる。生成器は、残っているピクセルから不足した情報を再び推論しなければならない。その再構成により、位置、オブジェクト状態、アイデンティティ、関係性に矛盾が生じる可能性がある。
この問題はマルチエージェント設定で大きくなる。各カメラは、1つの基盤環境を部分的に投影したものだからだ。有効なモデルは、特定のカメラの視野外で起こる変化を追跡しながら、それらの投影を整合させなければならない。
WorldWeaverは、環境の変化する状態のために確保された学習可能なトークンである世界状態レジスタを追加する。これらは視覚トークンの隣に置かれるが、目的は異なる。レジスタは、個々のフレームがアクティブなコンテキストから外れても残るべき情報を要約する。
ロールアウトの各ステップで、生成器は前のレジスタ、直近のフレーム、現在のアクションを読み取る。そして新しい視覚チャンクを生成した後、更新済みレジスタを確定する。そのレジスタが次のチャンクを条件付ける。
このプロセスは、観測と状態更新が交互に並ぶ系列を作り出す。直近のフレームは詳細な局所的証拠を提供する。レジスタは、時間と視点をまたぐコンパクトな連続性の仕組みを提供する。
この構造は、単にフレームキャッシュを拡張することとは異なる。より大きなキャッシュはより多くの観測を保持するが、それらの観測は依然としてカメラ依存であり、視覚的に符号化されている。モデルは、その情報が必要になるたびに関連する状態を抽出しなければならない。
WorldWeaverは、その抽象化をモデルに継続的に維持させる。研究者らはレジスタを、永続的であると同時に動的に更新可能なものと説明している。ロールアウトが進むにつれて、すべてのエージェントが共有表現に証拠を提供する。
このアプローチは、古いレジスタ履歴も抑える。推論時、システムはすべての中間状態を蓄積する代わりに、初期レジスタと最新の確定済みレジスタを保持する。この選択により、この仕組みは拡張し続けるメモリアーカイブよりも再帰的状態に近づく。
プロジェクトのmethod overviewでは、同期した2人プレイヤーMinecraftのロールアウトを示している。両プレイヤーは1つの生成環境内で行動し、その位置と周囲の場面を隠れた表現が追跡する。
Minecraftが有用なのは、環境が正確なシミュレータ状態を公開するためだ。研究者はエージェントの位置、速度、向き、コントローラー入力を測定できる。また、いずれのプレイヤーにも見えない俯瞰視点も取得できる。
これらの信号により、隠れた状態を検証可能にできる。チームは、生成動画が両方のカメラを通じて同じ基盤世界に対応しているかを問える。ピクセル品質だけでは、その問いには答えられない。
したがって、このニュースの本質は、より美しいMinecraft映像ではない。一貫性を期待される副次効果から、生成における教師ありコンポーネントへと移すことにある。
複数エージェントではフレーム履歴が負債になる理由
観測履歴はカメラが見たものを記録する一方、インタラクティブな世界モデルは、それらの観測が消えた後も真であり続けるものを保持しなければならない。
単一カメラの動画モデルは、小さな論理エラーをしばしば隠せる。離れたフレーム間でオブジェクトがわずかにずれても、系列全体はもっともらしく見える場合がある。マルチエージェント生成では、こうしたエラーが露呈しやすい。
Alphaがブロックを設置している間、Bravoが別の方向を見ているとしよう。後でBravoがカメラを戻したとき、その視点にはそのブロックが映っているべきだ。Alphaのアクションは、Alphaの動画ストリームだけでなく、1つの共有環境を変化させなければならない。
次に、プレイヤーたちが離れた場合を考える。彼らの直近フレーム履歴には、異なる地形、オブジェクト、カメラ移動が含まれる。再会したとき、モデルは矛盾するジオメトリを作り出すことなく、両方の履歴を整合させなければならない。
ローリングする視覚キャッシュでは、このタスクへの支援は弱い。これは直近の観測を優先し、状態を外観と絡み合わせる。見えていないプレイヤーや隠れた構造に関する情報は、新しいフレームが古いフレームを置き換えるにつれて薄れていく可能性がある。
明示的な状態は、現在のカメラから独立した事実を保持できる。位置、向き、近傍のレイアウト、完了したアクションは、その元となるピクセルがウィンドウから外れても利用可能なままにできる。
WorldWeaverは、3種類のターゲットでレジスタを教師あり学習する。エージェント統計は位置、速度、向きを捉える。鳥瞰図はグローバルなレイアウトを制約し、シーンテキストは現在の行動を意味的に記述する。
各ターゲットは異なる失敗モードに対応する。エージェント統計は局所的な動きとアイデンティティの維持に役立つ。俯瞰表現は両エージェントに共通の幾何学的基準を与える。
シーンテキストは、低レベルの視覚特徴だけでなく、意味のある関係性を保持するようレジスタを促す。論文のキャプション生成プロセスでは、各プレイヤーの行動、相対位置、距離、視線方向を記述している。
これらのアノテーションは、同期されたエージェント視点、俯瞰フレーム、コントローラー入力を利用する。各生成チャンク内で何が起きたかについて、異例なほど直接的な知識を提供する。
この教師信号は重要だ。動画生成の目的関数は、レジスタが何を記憶すべきかを規定していない。教師なしトークンは、有用な情報、無関係なテクスチャ、あるいはロールアウト中に不安定になる混合物を吸収し得る。
研究者らは、状態ターゲットが生成と解釈可能性の両方を変えることを確認した。学習時のみ使われるデコードヘッドは、レジスタからエージェント座標、俯瞰特徴、シーン記述を復元できる。これらのヘッドは推論時に削除されるため、デプロイ時のデコード処理は増えない。
ここで、このアプローチは既存のストリーミングパイプラインにも圧力をかける。コンテキストウィンドウを拡張すれば過去の観測へのアクセスは改善するが、正準的な共有状態が作られるわけではない。
この比較は、2026年2月のマルチプレイヤー世界モデルであるSolarisにとりわけ関係が深い。Solarisは、同期されたマルチプレイヤーデータ収集と、プレイヤー視点をまたぐ協調生成を導入した。
Solarisは、1,264万枚のマルチプレイヤーフレームを含むデータセットを報告した。また、移動、記憶、グラウンディング、建築、視点一貫性を対象とする評価カテゴリも定めた。
WorldWeaverはこの設定を採用し、比較のために同じ学習データでSolarisを再訓練する。その上で、生成中の情報の永続化方法を変更する。
Solarisは、視覚トークンに対するプレイヤー間アテンションを通じて観測を同期する。WorldWeaverはこの相互作用を保ちながら、独立した共有状態チャネルを導入する。問題は、明示的な状態が視覚コンテキストよりも確実に長く持続するかどうかだ。
論文の結果は、この実験では状態を持つ経路を支持している。ただし、トークンレジスタが常に長いコンテキスト、外部メモリ、構造化マップを上回ることを示したわけではない。
示しているのは、より限定的ながら依然として価値ある点だ。2つの動画ストリームが1つの変化する環境を記述しなければならない場合、明示的な状態教師信号は測定可能な論理的一貫性を改善できる。
世界状態レジスタが生成の仕組みを変える
WorldWeaverは視覚合成と状態維持を分離し、その後、両方の経路が自ら蓄積するエラーに耐えられるよう学習させる。
モデルは3段階の学習プロセスに従う。第1段階では、事前学習済みのシングルプレイヤー動画モデルを、同期したマルチプレイヤー教師モデルへ適応させる。双方向アテンションにより、この教師モデルは完全なクリップを観測しながら、エージェント間のシーン構造を学習できる。
第2段階では、教師モデルを因果的な生成器へ変換する。因果生成とは、各出力が系列内のその時点で利用可能な情報だけに依存することを意味する。これは未来のフレームを参照できないインタラクティブなストリームに必要だ。
この段階では、フレームトークンは直近の視覚コンテキストと最新レジスタを用いる。レジスタトークンは局所的なフレームウィンドウと先行するレジスタを読み取る。モデルは観測の予測と状態の更新を交互に行う。
レジスタは、確定されるすべてのステップで補助的な教師信号を受ける。回帰ヘッドはエージェント統計を予測する。別のデコーダは、整列された俯瞰図に対応する特徴を予測する。
テキストヘッドはシーン記述を予測する。全体の学習目的関数は、これらの状態損失と拡散モデルのフレーム生成損失を組み合わせる。
この結合された目的関数には、潜在的な衝突がある。ピクセル生成は詳細な視覚再構成を報いる一方、状態モデリングはコンパクトで安定した情報を報いる。そうでなければ、1組のTransformer重みが両方の役割を満たさなければならない。
WorldWeaverは、Mixture-of-Transformers設計によってこの衝突に対処する。このアーキテクチャは、レジスタトークンとフレームトークンに別々のパラメータ分岐を与えながら、両者の共同アテンションを維持する。
この分離は、独立したモデルを使うことと同じではない。視覚トークンと状態トークンは、同じインターリーブされた系列内で依然として情報を交換する。ただし、各トークン種別はその役割に合わせた重みを受け取る。
この設計は、レジスタの教師信号がより豊かになるほど有用になる。論文は、同一の経路がピクセル生成と検証可能な世界意味論の符号化を担う必要がある場合、高密度の共有重みでは苦戦し得ると報告している。
第3段階は、別の失敗要因に対処する。モデルは通常、正しい過去フレームで学習するが、デプロイ時には自らの不完全な出力で動作する。すると、小さなエラーが累積する。生成されたフレームがすべて、次のフレームのコンテキストになるためだ。
WorldWeaverは、モデル自身が生成した出力に基づいてモデルを先へ進める訓練手法であるSelf Forcingを応用している。この技術により、システムは推論前に実運用時の条件にさらされる。
ここでの課題には、フレームのドリフトとレジスタのドリフトの両方が含まれる。誤って生成された視点は、次の状態更新を損なう可能性がある。損なわれた状態はその後、すべてのエージェントに対する後続の視点を歪めかねない。
そのためモデルは、訓練中にフレームと確定済みレジスタの両方をロールアウトする。クリーンな参照データだけでなく、自らが実際に生成した履歴から継続することを学習する。
推論スケジュールでは、4回のデノイジングステップを用いる。各フレームのデノイジング後、モデルはそれをローリングビジュアルキャッシュへ追加する。続いて、次の生成ステップを始める前にレジスタを更新する。
このサイクルが論文の中核的な仕組みだ。WorldWeaverは、単に過去の観測を検索したり、生成後にメタデータを付与したりしているわけではない。状態更新が自己回帰ループに直接参加する。
他の研究では、より明示的な外部メモリを用いて同じ問題に取り組んできた。たとえばMultiGenは、編集可能なマルチプレイヤー拡散世界に向け、メモリ、観測、ダイナミクスを分離している。
MultiGenの外部表現では、ユーザーが環境構造を変更できる。WorldWeaverは状態を学習済みトークンとして生成器内部に保持する。そのためメモリはコンパクトだが、直接編集しにくい。
この対比は重要な設計上の選択を示している。構造化された外部マップは、検査可能な制御をもたらす一方で、システム側にその表現を維持する負担を課す。内部レジスタは柔軟性をもたらすが、曖昧または誤った状態を隠してしまう可能性がある。
WorldWeaverは中間的な立場を目指している。レジスタは推論中には潜在的なままだが、明示的な訓練ターゲットによって内容は部分的に復元可能になる。システムは検証可能性を完全に放棄せず、内部状態を学習する。
この仕組みは、合成ゲームを超える用途も示唆する。ロボット群シミュレータなら、共有された物体位置を保ちながら個別の観測を生成できる。訓練環境では、あるエージェントの行動が後に他のエージェントの遭遇する状況をどう変えるかをモデル化できる。
デジタルツインシステムも、異なるセンサーが不完全な視点を提供する場合に類似の問題に直面する。永続状態は、シミュレートされた環境が進化を続ける間に、それらの視点をまたいで証拠を統合できる。
ただし、WorldWeaverはこれらの用途を検証していない。その根拠は、2エージェント、同期された行動、そして極めて取得しやすいグラウンドトゥルースを備えた、制御されたMinecraftセッションから得られている。
このアーキテクチャは明確な技術的主張を行っている。より広範な用途に関する主張は、なお未解決のままだ。
スコアは改善したが、現実世界とのデータギャップは残る
報告された改善は明示的な状態モデリングを支持するが、シミュレータによる監督なしにWorldWeaverが複雑な状態を復元できることを示してはいない。
研究者らは、移動、グラウンディング、メモリ、建築、一貫性を評価している。視覚言語モデルの精度と、生成画像と参照画像の視覚分布を比較するFréchet Inception Distance、すなわちFIDを用いる。
また、これらの測定値を統合した総合ワールドスコアも使用する。WorldWeaverはこの指標で105.1に到達した。再訓練したSolarisモデルは81.0、フレーム連結ベースラインは49.1だった。
精度の最大の改善は、状態に敏感なカテゴリで見られる。グラウンディングはSolarisの81.3からWorldWeaverでは93.8へ上昇した。建築は9.4から28.1へ増加した。
一貫性は57.8から76.6へ上昇した。移動も改善し、Solarisの79.7に対して82.8に達した。
メモリでの優位性は小さい。WorldWeaverは46.9、Solarisは43.8を記録した。フレーム連結ベースラインのスコアは37.5だった。
FIDの結果はより入り混じっている。WorldWeaverは移動や一貫性を含む複数カテゴリで改善したが、すべての視覚比較で首位ではない。メモリのFIDは64.8で、Solarisの61.2と比べると高い。
この分離は重要だ。論理的な状態と視覚的な品質は関連しているが、同一ではない。モデルは正しい出来事を保持しつつ、描画品質を損なうことがある。逆に、過去の行動と矛盾する魅力的なフレームを作ることもある。
WorldWeaverのより強い総合結果は、レジスタが複合的な目的に役立つことを示唆する。ただし、あらゆる品質上のトレードオフを解消するものではない。
アブレーション実験も状態メカニズムを支持している。研究者らは監督の種類を変え、共有された高密度重みと分離型Transformerアーキテクチャを比較した。
結果は、異なる状態ターゲットが異なる振る舞いに役立つことを示している。単一のシグナルがすべてのカテゴリを支配するわけではない。組み合わせた監督が、報告された中で最も強力な総合構成を生み出した。
半教師あり実験は、最も明白なスケーリング上の懸念に取り組んでいる。チームはラベル付きセットを1,000クリップに固定し、ラベルなし動画を増やして追加した。
ラベルなしクリップがない場合、総合ワールドスコアは63.2だった。ラベルなしクリップを5,000本追加すると82.3へ上昇した。10,000本のラベルなしクリップでは、スコアは90.3に達した。
この結果は、より少数のラベル付きコレクションでもレジスタの意味論を定着させられ、通常の動画が生成を改善できることを示唆する。ラベル付き状態の必要性をなくすものではないが、この制御された設定では必要な割合を減らす。
いくつかの注意点は残る。
第一に、この論文はarXivのプレプリントであり、まだ査読を通過していない。評価フレームワーク、総合スコア、アーキテクチャに関する結論には、独立した再現が必要だ。
第二に、モデルはMinecraftで動作する。この環境には離散的なブロック、利用可能なコントローラー入力、クリーンな同期、正確なシミュレータ状態がある。現実のシーンで同等のアノテーションが得られることはほとんどない。
倉庫ロボットは、反射面、変形可能な物体、人、移動する設備を観測するかもしれない。信頼できる俯瞰視点や、隠れた相互作用の完全な記録が存在しない場合もある。
第三に、実験対象は2エージェントである。視点を増やすと、情報と競合の両方が増える。レジスタは、追加されたアイデンティティ、観測、相互作用を曖昧な要約へと潰さずに保持しなければならない。
第四に、レジスタ自体がドリフトする可能性がある。Self Forcingはモデルを自身の誤りにさらすが、誤った更新後の回復を保証するものではない。1つの誤った状態が、その後のすべてのエージェントに影響を及ぼしうる。
第五に、報告された状態は部分的にしか解釈可能ではない。訓練ヘッドは選択されたターゲットをデコードするが、それらのプローブがレジスタに保存されたすべてを明らかにするわけではない。高いプローブ精度は、完全または因果的に正しい表現を保証しない。
モデルは自動化されたシーン記述にも依存している。これらのキャプションは、視覚的な観測に加えてグラウンドトゥルースのコントローラー入力を用いる。現実世界のデータでは、より弱く、よりノイジーで、あるいは推定されたアクションラベルが必要になる。
著者らは論文で中心的な限界を認めている。主な改善は追加の状態監督に依存している一方、現実世界の状態はより複雑で、しばしば利用できない。
この認識が、この研究の実際のフロンティアを定義している。WorldWeaverは、強い観測可能性の下で信頼できる状態アーキテクチャを提示する。真実が隠された環境における状態発見は、まだ解決していない。
共有状態がスケールするかを示すもの
次に必要な証拠は、2人用Minecraftを超えて状態レジスタを検証し、その計算上のトレードオフを切り分け、誤った更新後の回復を測定することだ。
最初の指標は、公開されたコードと評価設定による独立した再現である。研究者は報告された105.1のワールドスコアを検証し、カテゴリごとの改善が異なる乱数シードでも維持されるかを調べるべきだ。
再現では、総合指標も精査すべきである。複合スコアは広範な性能を明確にできる一方、論理的精度と視覚的忠実度の間にあるトレードオフを覆い隠す可能性がある。
第二の指標は、不完全な監督を伴うより広範な環境である。有用な追試では、同期されたエージェントを維持しつつ、正確な俯瞰マップやシミュレータ座標を取り除くことになる。
このテストは、レジスタが推定ジオメトリ、ノイジーな言語、部分的な行動記録から安定した状態を学習できるかを明らかにする。成功すれば、ロボティクスや身体性シミュレーションへの適用可能性を強める。
失敗すれば、WorldWeaverの改善がレジスタ設計そのものよりも特権的なアノテーションに依存していることを示唆する。その結果も将来のシステムに情報を与えるが、アーキテクチャの実用的な到達範囲は狭まる。
第三の指標は、エージェント数と時間軸にまたがるスケーリングである。2つの視点は重要な出発点だが、追加のアクターが同じ環境を変更するにつれ、共有状態はより困難になる。
将来の評価では、4体以上のエージェントで一貫性がどう変化するかを追跡すべきだ。また、レジスタ容量、キャッシュサイズ、あるいは累積誤差が制約となる地点も報告すべきである。
より長いロールアウトには、狙いを定めたストレステストが必要だ。あるエージェントが物体を隠し、その場を離れ、元のフレームがキャッシュから外れた後に戻ることが考えられる。別のエージェントは、最初のエージェントが不在の間にその物体を変更できる。
これらのテストは、永続状態と短期的な視覚記憶を分離する。また、レジスタが見えない関係性を更新しているのか、それとも圧縮された直近の履歴を保存しているにすぎないのかも明らかにする。
研究者は訂正の振る舞いも測定すべきだ。ある視点が誤った物体や位置を生成した場合、後続の証拠は共有状態を修復するべきである。そうでなければ、明示的なメモリが局所的な幻覚をシステム全体の確定事項へ変えてしまう可能性がある。
外部メモリシステムは有用な比較対象となる。構造化マップはジオメトリを強制し、直接編集を支援できるが、独自の再構築負担を伴う。学習済みレジスタは柔軟性を保つが、監査はより難しい。
説得力のあるベンチマークでは、同一のデータと計算資源の下で両方のアプローチを比較すべきだ。1つのベースラインを決定版として扱うのではなく、長いコンテキスト、潜在レジスタ、明示的な外部状態を含める必要がある。
計算に関する報告も重要になる。論文によれば、訓練専用の監督ヘッドは推論の計算量を追加しない。しかし、レジスタトークンと分離されたTransformerの重みは、依然としてメモリ、訓練コスト、生成スループットに影響する。
リアルタイムの対話システムでは、これらのコストと一貫性の向上を両立させなければならない。動作が遅すぎる共有状態では、応答性の高いエージェント、ゲーム、ロボティクスシミュレーションを支えられない。
WorldWeaverは、1つの限定的な問いに有用な答えを示している。直近の動画フレームは、共有世界を十分に定義するものではない。そのレジスタは、生成器が視点をまたいで事実を維持する明示的な場所を提供する。
より難しい問いは、シミュレータが答えを明かさない場合にも、これらの事実を学習できるかどうかだ。マルチエージェント世界モデルを評価する開発者は、この境界を注意深く見守るべきである。
将来のシステムは、特権的なラベルがなくなっても状態を維持できるのか。1つのエージェントが誤りを導入した後、共有メモリを訂正できるのか。エージェント数が増えても一貫性を保てるのか。
これらのテストが、WorldWeaverが再利用可能なアーキテクチャなのか、それともMinecraftにおける強力な結果なのかを決めるだろう。現時点では、この研究は議論をより精密にしている。世界モデルは、最新の画像だけでなく、世界そのものを記憶しなければならない。


