Kunlun Techは2026年をワールドモデル元年と宣言、しかしMatrix-Game 3.5にはなおリアルタイム性能の検証が必要
更新日:7月20日
Kunlun Techは、上海で開催された世界人工知能大会で2026年を「ワールドモデル元年」と宣言し、Matrix-Game 3.5を発表した。同社によると、50億パラメータのこのモデルは、1基のGPUで毎秒約20フレームのインタラクティブな720p動画を生成できるという。この主張は、視覚的な華やかさだけでなく、効率性を今回のリリースの中心に据えるものだ。
Matrix-Game 3.5は、音楽生成モデルMureka V9.5および音楽推論モデルMureka O3とともに登場した。Kunlun Techはまた、視覚的予測とロボットの動作を結びつけるために設計されたモデル、Riemann-1.0も発表した。これらのリリースは総じて、ワールドモデリングをゲーム、メディア、シミュレーション、ロボティクスに共通する基盤として位置づけている。
しかし、現時点で得られる証拠が裏づけているのは、その広範な構想の一部にすぎない。Kunlun TechはMatrix-Game 3.5のコードとベースモデルの重みを公開しているが、リポジトリによると、蒸留されたリアルタイムモデルはまだ公開されていない。したがって、当面の焦点は、Kunlun Techのオープンで効率的なインフラ戦略と、現在のリリースが抱える実用上の限界とのせめぎ合いにある。
Google DeepMindのGenie 3はすでに、移動可能なAI環境における明確なベンチマークを確立している。NvidiaのCosmosプラットフォームは、ワールドモデルをロボティクス、自動運転車、合成訓練データへと展開している。Kunlun Techは、単一のアーキテクチャでこれらの方向性を橋渡しすると同時に、そのアーキテクチャを外部の開発者が利用できるようにしようとしている。
Kunlun Techの2026年ワールドモデル戦略はMatrix-Game 3.5から始まる
この発表が重要なのは、Kunlun Techがワールドモデルを、単に性能を高めた動画生成モデルではなく、インフラとして提示したからだ。
ワールドモデルは、ある行動の後に環境がどのように変化するかを予測する。従来の動画生成モデルとは異なり、オブジェクト、幾何学的構造、過去の出来事を維持しながら、操作入力に応答しなければならない。システムは、現在のフレームを超えて何が起きたかを記憶する必要がある。
Kunlun Techの会長兼最高経営責任者であるFang Hanは、同社のWAICイベントで2026年を「ワールドモデル元年」と位置づけた。この表現は戦略的な主張であり、業界の総意ではない。生成AIが、個別のメディアを生成する段階から、ユーザーや機械が継続的に探索できる環境を維持する段階へ移行しつつある、という見方を示している。
Matrix-Game 3.5は、その主張の技術的な中核をなす。Kunlun Techはこれを、長時間にわたり動作し、カメラ操作が可能な動画生成向けのメモリ拡張モデルと説明している。繰り返し登場するキャラクターを中心とした、一人称視点のナビゲーションと三人称視点のシーンの両方に対応する。
同社のモデル発表の詳細では、3つの主要な変更点が説明されている。幾何学的メモリ、カメラを考慮した位置エンコーディング、動く被写体の個別処理である。それぞれの変更は、生成された世界が一貫性を失う異なる原因に対処する。
第1の問題は、空間的な忘却である。従来の動画モデルが参照できるのは、直近の限られたフレーム範囲にすぎない。カメラが建物から離れ、後で戻ってくると、モデルはその建物を異なる姿で描き直す可能性がある。ドアの位置が変わり、看板が別物になり、経路がつながらなくなる。
第2の問題はカメラ操作である。動画モデルは、カメラとシーンの安定した関係を構築しなくても、動きを模倣できる。方向転換を指示すると、もっともらしい画像遷移を生成しながら、密かに環境の幾何学的構造を破綻させる可能性がある。
第3の問題は、動くオブジェクトに関するものだ。すべてを保存するメモリシステムは、人物や車両の古い位置を保持してしまう場合がある。そのメモリを再利用すると、オブジェクトが動いた際に重複、視覚的な残像、または「ゴースト」が生じる。
Kunlun Techによると、Matrix-Game 3.5は、比較的小規模な50億パラメータのバックボーンを維持しながら、これらの不具合に対処する。同社の公開リポジトリでは、基盤となるテキスト・画像から動画を生成するための足場としてWan2.2-TI2V-5Bが示されている。一人称視点と三人称視点のチェックポイントは、Apache 2.0ライセンスの下で利用できる。
同社はまた、1基のGPUで720p動画を毎秒約20フレーム生成できると主張している。この仕様については慎重な表現が必要だ。現在の公開パッケージだけでは、完全な結果がまだ実証されていないためである。ドキュメントによると、現在利用可能なベースモデルの推論には、少なくとも40GBのメモリを備えたNvidia製GPUが1基必要となる。
さらに重要なのは、リポジトリに、蒸留されたリアルタイム自己回帰モデルは後日公開されると記載されている点だ。現在ドキュメント化されている推論処理では、デフォルトで25回のノイズ除去ステップが使用される。アンカー画像、カメラ経路、テキストプロンプトから、80フレーム単位のブロックを生成する。
したがって、このリリースは実質的にオープンではあるものの、完全ではない。開発者はアーキテクチャを調査し、ベースの重みをダウンロードし、提供されたサンプルを実行できる。しかし、公開済みのパッケージだけでは、発表の目玉であるリアルタイム構成をまだ再現できない。
この違いが、本記事の中心的な緊張関係を生み出している。Kunlun Techは、効率的で再利用可能なワールドモデル基盤を発表した。そのコードは本格的な技術検証を可能にする一方、商業的に最も重要な性能上の主張については、再現可能な一般公開をなお待つ必要がある。
Patch MemoryがMatrix-Game 3.5の最大の賭けである理由
Matrix-Game 3.5は、直近のフレーム内に世界全体を保持するようモデルに求めるのではなく、メモリを幾何学的な検索問題として扱う。
その主要な仕組みはPatch Memoryと呼ばれる。パッチとは、過去の画像から切り出した小さな領域である。システムはそのパッチの深度を推定し、記録されたカメラ位置と組み合わせる。
その後、Matrix-Game 3.5はパッチを3次元座標系に投影する。後にカメラが同じ領域へ近づくと、システムは過去に表示されたパッチを特定し、新しい視点へ投影する。検索された細部は、生成モデルに提供されるメモリキャンバスとなる。
この仕組みは、フレーム全体を保存する方法とは異なる。フレーム全体には有用な風景情報が含まれるが、その風景は古い視点に固定されてしまう。パッチ単位で保存することで、システムは現在のカメラ視点に合った、より小さな断片を検索できる。
また、永続的な単一の3次元再構成を構築する方法とも異なる。グローバルな再構成では、深度推定やカメラ位置にずれが生じた場合、誤差が蓄積する可能性がある。これに対し、Patch Memoryは局所的な観測情報を柔軟な集合として保持する。
この手法は、ナレッジシステムにおける検索に似ている。生成モデルは、過去のすべての観測情報をアクティブなコンテキスト内に保持する必要はない。必要なのは、現在の要求と位置に合致した関連情報である。
この類似性は、動画生成以外でも重要になる。長時間動作するAIシステムは、過去の情報を忘れるか、関連性の低い履歴を過剰に読み込むことで失敗する場合が多い。選択的検索を利用すれば、毎回すべての過去情報をモデルに処理させることなく、有用なコンテキストを維持できる。
こうしたコンテキストの問題に関心を持つ開発者は、この手法を検索可能なナレッジベースと比較できる。基盤となるデータは異なるが、どちらのシステムも、適切なタイミングで適切な記憶を検索することに依存している。
Kunlun Techは、Patch Memoryと、カメラを考慮した位置エンコーディング手法であるWarped PRoPEを組み合わせている。位置エンコーディングは、時間と空間においてトークン同士がどのように関係するかをTransformerに伝える。標準的な動画エンコーディングは、一般に時間と2次元画像座標を表現する。
Warped PRoPEは、カメラの投影行列から導出された情報を追加する。これにより、視点間の回転、平行移動、遠近関係をモデルが表現できるようになる。Kunlun Techによると、この手法ではバックボーンに追加のパラメータを必要としない。
この組み合わせには明確な役割分担がある。Patch Memoryは、正しい領域から過去の視覚的証拠を提供する。Warped PRoPEは、その証拠を現在の視点にどのように対応づけるべきかをアテンションシステムに伝える。
このアーキテクチャは、静的な風景と動的な被写体も分離する。建物、地形、固定されたオブジェクトは幾何学的メモリに入る。人物、車両、その他の動く被写体には、個別のマルチビュー参照トークンが割り当てられる。
動きの検出とセグメンテーションによって、動く被写体がPatch Memoryから除外される。そうしなければ、車が移動した後も、過去の車の画像が道路に埋め込まれたままになる可能性がある。代わりに、参照トークンの分岐が、シーケンス全体を通して被写体の同一性と外観を保持する。
公開されたPatch Memoryのコードは、基本的なアーキテクチャの説明を裏づけている。メモリ再投影コンポーネント、深度推定の依存関係、一人称視点のサンプル、三人称視点のワークフローが含まれている。リポジトリでは、両方の表示モード向けに個別のチェックポイントも提供されている。
これらの仕組みにより、Matrix-Game 3.5は単に名称を変更した動画モデル以上のものになっている。魅力的な動画クリップと探索可能な環境を分ける状態管理の問題に、直接対処しているためだ。このモデルは、直近数フレームがどう見えたかだけでなく、物がどこにあるべきかを記憶しようとする。
しかし、幾何学的構造は物理的な理解と同じではない。モデルはドアの位置を維持できても、衝突、オブジェクトの挙動、因果的な結果を誤って生成する可能性がある。パッチ検索は視覚的な連続性を向上させるが、モデルが信頼できる物理法則を学習したことを証明するものではない。
この仕組みは、上流工程の推定にも依存している。深度やカメラ情報が不正確であれば、記憶されたパッチが誤った位置に配置される可能性がある。動きがわずかな場合、一部が遮蔽されている場合、またはカメラの動きと重なっている場合には、動的オブジェクトのフィルタリングが失敗する可能性もある。
こうした限界によって、アーキテクチャの価値が失われるわけではない。それらは、独立した評価で何を測定すべきかを明確にする。有用なテストには、以前の場所への繰り返しの帰還、動く被写体、カメラの方向反転、遮蔽、構造変化を伴う長いシーケンスを含めるべきだ。
Kunlun Techの効率性に関する主張がクローズドなワールドモデルに圧力をかける
Google DeepMindにとって戦略的な脅威となるのは、Matrix-Game 3.5が明らかに優れた世界を生成することではなく、Kunlun Techが利用しやすいハードウェアで同等のインタラクションを実現しようとしていることだ。
Google DeepMindは2025年8月、汎用ワールドモデルとしてGenie 3を発表した。そのインタラクティブ環境は、720p、毎秒24フレームで動作する。Googleによると、このシステムは数分間にわたって一貫性を維持できるという。
これは有用な比較基準となるが、厳密なベンチマーク比較ではない。Googleは、Genie 3のモデル規模、ハードウェア要件、訓練データ、完全なアーキテクチャを公開していない。また、プロンプト、操作入力、レイテンシーの定義、出力パイプラインの違いによって、直接比較はさらに難しくなる。
Kunlun Techが掲げる主要な生成速度は、毎秒約20フレームとわずかに低い。その一方で、同社が主張するデプロイ時の規模は、より注目に値する。50億パラメータのモデルが1基のGPUで動作するなら、クローズドなホスティングシステムよりも幅広い層が実験できるようになる。
Matrix-Game 3.5は、ベースチェックポイントと実装へのアクセスも提供している。研究者はメモリ検索を変更し、入力を置き換え、不具合事例を評価し、コンポーネントをファインチューニングできる。Genie 3は、オープンに調査できる研究基盤ではなく、依然として管理された製品体験にとどまっている。
だからといって、Matrix-Game 3.5の方が強力なシステムであるとは限らない。Genie 3は、多様な移動可能環境を生成するためのテキストプロンプトを受け付け、Project Genieを通じてより広く一般に公開されている。Kunlun Techは、同じ範囲にわたる汎化性能について、同等の証拠を提示していない。
この比較からは、むしろ競合する2つの道筋が明らかになる。Googleは、大規模な独自データセット、特化型インフラ、統合された消費者向けアクセスを組み合わせることができる。Kunlun Techは、より小規模なモデル、ダウンロード可能なコンポーネント、再現可能な研究によって、単一企業の外部での改善が加速すると見込んでいる。
Matrix-Gameの進化は、その効率性をめぐる主張を裏付けている。Matrix-Game 2.0は、少数ステップの自己回帰型拡散プロセスを用いて、毎秒25フレームのインタラクティブ動画を生成した。そのトレーニングパイプラインには、アノテーション付きのUnreal Engineおよびゲーム映像が約1,200時間含まれていた。
その後、Matrix-Game 3.0は長期記憶と高解像度生成に重点を置いた。その技術論文では、50億パラメータのモデルにより、720pで最大毎秒40フレームを達成したと報告されている。ただし、この結果では1基のGPUではなく、マルチGPU推論構成が使用されていた。
したがって、バージョン3.0の毎秒40フレームからバージョン3.5の20フレームへの見かけ上の低下は、単純な性能後退ではない。ハードウェア条件が変わった一方で、メモリ設計はより複雑になった。バージョン3.5では、明示的な視点ジオメトリと独立した被写体追跡も追加されている。
リアルタイム性能は、単一のフレームレート値で示せるほど単純ではない。入力処理、深度推定、メモリ検索、動画デコード、表示遅延のすべてが応答性に影響する。高速な生成を報告するシステムでも、操作を変更した際には遅延を感じることがある。
Kunlun Techのリリースがクローズドシステムに圧力をかけられるのは、外部の開発者が完全なパイプラインを再現できる場合に限られる。最終的なリアルタイムチェックポイントは、短いシーケンスだけでなく、長時間のインタラクション中もその速度を維持する必要がある。また、メモリコレクションが増大しても品質を保たなければならない。
公開によって、その検証を加速できる。研究者は、カンファレンスでのデモンストレーションでは避けられるような障害モードをテストできる。記憶されたオブジェクトがカメラの旋回後も保持されるか、動的な被写体が安定したままか、操作に対して一貫した応答が得られるかを調査できる。
同社の立場は、ライセンスと実装の明確さにも左右される。Matrix-Game 3.5プロジェクトにはApache 2.0が適用される一方、複数のサードパーティ製コンポーネントにはそれぞれ独自の条件が適用される。開発者は商用展開の前に、依存関係と基盤となるWanモデルを確認する必要がある。
ゲームスタジオにとって、その魅力は明らかだ。ローカル環境に展開可能な世界モデルがあれば、すべてのフレームをホスティングサービスに送信することなく、探索的なプロトタイプ、インタラクティブな背景、シミュレーションのバリエーションを生成できる可能性がある。ただし、現在のモデルは決定論的なゲームエンジンを代替するものではない。
従来のエンジンは、衝突ルール、スクリプト化された状態、再現可能な結果を保証する。一方、生成型世界モデルは、もっともらしい次のフレームを予測する。その柔軟性は迅速な制作に役立つが、多くの製品レベルのゲームメカニクスにおいて、予測誤差は依然として許容できない。
短期的な機会はハイブリッドシステムにある。従来型エンジンが権威ある状態を維持し、世界モデルがビジュアル、代替シーン、トレーニング用のバリエーションを提供できる。Matrix-Game 3.5のカメラ制御とメモリ設計は、完全なゲームを生成するという主張よりも、こうした実験的な役割に適している。
オープンコードだけでは、展開可能な世界モデルであることはまだ証明されない
最大の不確実性は、Kunlun Techが発表したリアルタイム性能と、外部の開発者が現在実行できる正確な構成との隔たりにある。
公開リポジトリでは、2つの50億パラメータのベースモデルが提供されている。一方は一人称視点の生成を処理し、もう一方は参照画像を任意で使用できる三人称視点のシーンに対応する。どちらもWan2.2動画モデル基盤と外部のメトリック深度モデルに依存している。
文書化されたハードウェア要件は相当に高い。704×1280ピクセルでの生成では、GPUメモリ使用量が約40GBでピークに達する。プロジェクトのドキュメントによると、ホストマシンにも少なくとも64GBのシステムメモリが必要である。
これらの仕様は、それでも1基のプロフェッショナル向けGPUに収まっており、実験的な世界モデリングとしては注目に値する。ただし、一般的な消費者向けノートPCや主流のゲーミングカードで実用的に動作するわけではない。「シングルGPU」を一般的なローカルハードウェアと解釈すべきではない。
より大きな留意点は速度に関するものだ。公開リポジトリには、蒸留済みのリアルタイム自己回帰モデルが近日中にリリースされると明記されている。つまり、ダウンロード可能なベースチェックポイントだけでは、発表された毎秒20フレームのモードを研究者が独立して検証することはまだできない。
蒸留は、低速な生成プロセスをより少ないステップに圧縮する。Matrix-Game 3.5では、より高コストな双方向拡散モデルを因果生成器に模倣させる段階的な手法が採用されている。同社によれば、このプロセスによって、より長いロールアウトでもカメラ制御とメモリ条件付けが維持される。
それらの重みが公開されるまで、開発者はメモリシステムを研究し、サンプルを生成することはできる。しかし、展開に関する主張全体を公正に検証することはできない。これはリリース順序の問題であり、主張された結果が虚偽であることを示す証拠ではない。
評価には別の課題もある。世界モデルには、画質を超えた測定基準が必要だ。視覚的に鮮明なシーケンスであっても、部屋を忘れたり、アクションを無視したり、オブジェクトを誤って移動させたり、一貫性のないジオメトリを生成したりする可能性がある。
長期テストでは、カメラがシーンを離れて戻った後も、そのシーンが安定しているかを測定すべきだ。アクションテストでは、要求された動作が予測世界を確実に変化させるかを算出すべきである。動的テストでは、遮蔽が発生しても被写体の同一性と位置を追跡すべきだ。
物理的一貫性には、独立したテスト層が必要となる。システムは、接触、移動、環境変化の後に、もっともらしい影響を予測すべきである。視覚的記憶だけでは、因果推論を立証できない。
Kunlun Techのデモンストレーションには、オープンな環境や一人称視点のゲームシーンが含まれていたと報告されている。これらの例は想定用途の理解には役立つが、選別されたデモンストレーションは独立したベンチマークではない。同社は、Matrix-Game 3.5の性能順位を確立するのに十分な第三者による結果を公開していない。
同じ注意は、より広範な製品群にも当てはまる。Mureka V9.5は、ボーカル品質、プロンプトへの忠実性、アレンジ、知覚されるリアリズムを改善したと報告されている。Mureka O3は、生成中の音楽的判断を見直して調整するため、推論時に追加の計算を行う。
Kunlun Techは、これらの音楽モデルについて社内評価の割合を報告した。同社によれば、Mureka V9.5はボーカル性能で61パーセント、プロンプト制御で97パーセントの許容率を達成した。これらの数値は同社の評価プロセスに基づくものであり、独立した市場ベンチマークとして扱うべきではない。
同社によれば、Mureka O3によってリスニング品質の許容率は35パーセントから43パーセントに上昇した。また、ボーカルの許容率も60パーセントから68パーセントへ向上したと報告している。公開テストデータと第三者による再現がない限り、これらの数値は主にKunlun Techが選定した開発目標を示すものにすぎない。
音楽関連のリリースは発表の範囲を広げるものだが、世界モデルの主張を裏付けるものではない。一貫した楽曲の生成と、移動可能な環境の維持では、状態、遅延、評価に関する問題が異なる。その結びつきは戦略的なものであり、統合システムを技術的に証明するものではない。
Riemann-1.0は、ロボット制御が物理的な結果の予測に依存するため、この主張をより直接的に検証するものとなる。Kunlun Techはこれを、動画、ロボットの状態、アクションを共同で表現する世界アクションモデルと説明している。
同社はロボティクスの各種ベンチマークにおける結果を報告し、人間とロボットの混合データ23万2,000時間を用いてトレーニングしたと説明している。これらは同社が提示した主張である。独立した再現には、モデルへのアクセス、評価の詳細、比較可能なテスト条件が必要となる。
企業の購入担当者は、この検証上の隔たりを調達時の質問に反映すべきだ。チームは、完全な遅延測定値、対応GPU、消費電力、シーケンス時間、障害率を要求すべきである。また、利用可能なベースモデルと、発表済みの最適化チェックポイントを区別する必要がある。
開発者は、カンファレンスの例に依存せず、自らの環境でテストすべきだ。ゲームを中心にトレーニングされた世界モデルは、倉庫、道路、住宅、産業プロセスでは異なる性能を示す可能性がある。カメラ制御が可能でも、対象領域での正確な動作が保証されるわけではない。
それでも、このリリースは実験のための具体的な基盤を確立している。コードは公開され、アーキテクチャは検証可能で、チェックポイントも利用できる。これは、技術的なアクセス手段がないデモンストレーションより有用である。
慎重に導ける結論は限定的だ。Kunlun Techは、長期的な動画生成向けのオープンな幾何学的メモリシステムをリリースした。しかし、シングルGPUでのリアルタイム性能という主張を独立して確認するために必要なものすべてを、まだ提供してはいない。
世界モデル競争はゲームとフィジカルAIへ分岐しつつある
Kunlun Techのより大きな賭けは、メモリを中心とする1つの基盤がインタラクティブメディアと機械学習の両方に対応できる一方で、競合各社は異なる展開市場に特化していくというものだ。
Google DeepMindは、世界モデルをエージェントとユーザーのための環境として提示している。Genie 3は、ユーザーが移動するにつれてカメラの前方に世界を生成する。その価値は、幅広い制作、インタラクション、そして潜在的に無制限のトレーニング環境にある。
Nvidiaは、フィジカルAIを通じてこの分野に取り組んでいる。同社の世界モデルプラットフォームは、生成モデル、データキュレーションツール、評価システム、ポストトレーニングのワークフローを組み合わせている。Cosmosは、ロボット、自動運転車、スマートインフラを対象としている。
2026年にリリースされたCosmos 3は、知覚、予測、ポリシー開発のためのモデルとワークフローによって、そのスタックを拡張している。Nvidiaの強みは、世界モデルをシミュレーションソフトウェア、アクセラレーテッドコンピューティング、ロボティクスフレームワーク、展開用ハードウェアに接続できることにある。
Kunlun Techは、これら2つの立場の中間に位置する。Matrix-Gameは、ゲームのような環境とインタラクティブ動画から始まった。Riemann-1.0は、世界予測をロボットのアクションへ移転しようとしている。Murekaと同社の動画モデルは、その中核の周囲にメディア生成アプリケーションを加えている。
この中間的な立場は、機会とリスクの両方を生み出す。共有モデルでは、表現学習、データインフラ、動画生成研究を再利用できる。しかし、ゲーム、音楽、ロボティクスでは、求められる精度も商流も同一ではない。
ゲームのプロトタイプは、視覚的な即興を許容できる。倉庫ロボットは、架空の障害物位置を許容できない。音楽制作者は感情的・美的品質を評価する一方、ロボット開発者はタスクの成功と安全性を測定する。
「世界モデル」という表現は、こうした違いを曖昧にする可能性がある。将来のセンサー観測を予測するシステムもあれば、プレイ可能な動画ストリームを生成するものもある。さらに、エージェントによるアクション選択を支援する、圧縮された内部状態を学習するものもある。
Matrix-Game 3.5は、主にインタラクティブ動画の系統に属する。その入力には、アンカー画像、カメラ軌道、テキストプロンプトが含まれる。出力は、可視化されたメモリ状態を伴う生成動画シーケンスである。
これは合成環境を支援できるが、記号的または物理的に権威あるシミュレーションを自動的に提供するものではない。カメラの移動に応じて、シーンがどのように見えるべきかを予測する。開発者は依然として、アクション、オブジェクト、衝突、測定可能な状態を扱う仕組みを必要とする。
短期的に最も有力なユースケースは、環境のバリエーションを迅速に生成することだ。スタジオは、画像とカメラパスからシーンのコンセプトを検討できる。ロボティクスチームは、対象領域での検証を条件として、知覚実験向けの視覚条件を生成できる。
デジタルツインの開発者は、このシステムを利用して代替的な視覚軌道を作成できる。それでも、工学的な意思決定には、検証済みのジオメトリとセンサーモデルが必要となる。もっともらしい画像は、較正されたシミュレーションデータを代替できない。
オープンモデルという道筋により、Kunlun Techは成熟した商業市場が成立する前に影響力を築くことができる。研究者はシステムを適応させ、拡張機能を公開し、Matrix-Gameを共通のベースラインにできる。その認知度は、直接的な収益が依然として不透明な段階でも、開発者を引き付ける可能性がある。
以前のバージョンのMatrix-Gameは、すでに後続研究や比較評価に登場しています。同社は、以前のリリースを基にマルチプレイヤーシステムや効率的なインタラクションシステムを構築した学術プロジェクトを挙げています。こうした採用実績は、外部チームがそのアーキテクチャを有用だと判断しているかを示すため、宣伝目的のランキングよりも重要です。
しかし、Nvidiaは強力なオープンな代替手段を提供しています。Cosmosには、オープンモデルライセンスの下でコード、モデル、データセット、評価ツールが含まれています。そのエコシステムは、確立されたハードウェアとシミュレーションのワークフローを持つフィジカルAIの購入者に直接焦点を当てています。
Googleは、消費者への配信力とモデル規模を通じて異なる圧力をかけています。Project Genieは、ユーザーにチェックポイントやプロフェッショナル向けGPUの設定を求めることなく、インタラクティブ生成を提供できます。多くのクリエイターにとって、ホスト型製品によるアクセスのしやすさは、ソースへのアクセスよりも重要になり得ます。
したがってKunlun Techには、技術的に興味深いリリース以上のものが必要です。信頼性の高い開発者体験、継続的に保守されるチェックポイント、明確な評価、そして既存の制作システムとの統合が求められます。オープンコードはエコシステムを立ち上げますが、それを存続させるのは継続的なサポートです。
同社はまた、クロスドメイン戦略が技術的な相乗効果を生み出すことを示さなければなりません。共有された動画表現は有用ですが、それぞれの製品には依然として専門的なデータ、制御、安全対策が必要です。複数のモデルからなるポートフォリオが、自動的に一貫した単一のワールドモデルプラットフォームになるわけではありません。
これらのリリースを追うナレッジワーカーにとって、情報源の管理は評価プロセスの一部になりつつあります。主張、チェックポイント、論文、ベンチマークの改訂内容は急速に変化する可能性があります。パーソナルナレッジベースを使えば、それらの資料を、その後のテスト結果やデプロイメントノートと併せて保存できます。
業界の方向性は、最終的な勝者が誰になるかよりも明確です。インタラクティブな世界生成は、短いデモンストレーションから、永続的なメモリ、リアルタイム制御、用途別の評価へと移行しています。現在の競争は、動画品質だけでなく、インフラストラクチャと使いやすさにも及んでいます。
Matrix-Game 3.5リリース後に注目すべきこと
Kunlun Techの「ワールドモデル元年」が技術的な節目となるのか、それとも野心的なカンファレンステーマにとどまるのかは、3つのシグナルによって決まります。
第1のシグナルは、提供が予告されているリアルタイムチェックポイントです。Kunlun Techは、蒸留済み自己回帰モデルの重み、正確なハードウェア構成、完全なレイテンシ測定手法を公開する必要があります。外部チームが、サポート対象のGPU 1基で720p、毎秒約20フレームの性能を再現できなければなりません。
一時的なピーク値よりも、持続的なパフォーマンスが重要です。テストは、メモリ検索を有効にした状態で、数分間にわたるシーケンスを対象に実施すべきです。生成速度、エンドツーエンドの制御レイテンシ、GPUメモリ使用量、そしてシーケンスが長くなるにつれて生じる品質変化を測定する必要があります。
リリースが成功すれば、クローズドシステムに対するKunlun Techの効率性に関する主張が強化されるでしょう。リリースが遅れたり、再現が困難だったりすれば、主要な差別化要因が弱まります。ベースモデルだけでは、この問いに決着をつけることはできません。
第2のシグナルは、独立した長時間評価です。研究者は、再訪した場所、難しいカメラ経路、遮蔽、移動する被写体、環境の変化をテストする必要があります。結果では、シーンの想起と物理予測を区別すべきです。
有用なベンチマークでは、モデルにある場所を離れさせ、多数のフレームを生成した後に戻らせます。そのうえで、再構築されたシーンと以前のビューを比較します。別のテストでは、移動する被写体が、メモリ内に複製を残すことなく同一性を維持できるかを追跡します。
これらの評価には、同等の条件下でMatrix-Game 3.0、Matrix-Game 3.5、その他の利用可能なワールドモデルを含めるべきです。また、ハードウェア、入力解像度、シーケンス長、サンプリング設定を開示する必要があります。共通条件がなければ、フレームレートや品質に関する主張を解釈することは依然として困難です。
独立した評価で優れた結果が得られれば、Patch Memoryが厳選された事例を超えて測定可能な改善をもたらすことが示されます。結果が振るわなければ、幾何学的検索が解決するのは長時間整合性の問題の一部にすぎないことを示唆します。
第3のシグナルは、外部での採用です。最も説得力のある証拠は、開発元チームが想定していなかったアプリケーションを開発者が構築することから得られるでしょう。ゲームのプロトタイプ、シミュレーションツール、ロボティクス用データセット、研究拡張によって、このモデルがインフラストラクチャとして機能するかどうかが明らかになります。
採用状況は、リポジトリのスター数だけで判断すべきではありません。継続的に保守される統合機能、公開された実験、ファインチューニング済みチェックポイント、査読付き研究での反復利用のほうが、より強力なシグナルになります。制約条件が開示された商用パイロットがあれば、さらに別の証拠が加わります。
関連するリリースも注視に値しますが、この流れから注意をそらすべきではありません。Mureka V9.5とO3には、独立したリスニングテストとクリエイターによる採用が必要です。Riemann-1.0には、再現可能なロボティクスの結果と明確なアクセス条件が必要です。
Kunlun Techが2026年をワールドモデル元年と宣言するのは、メモリ、予測、インタラクションが1つの共通AIレイヤーへと統合されつつあると見ているからです。Matrix-Game 3.5は、その主張に具体的なアーキテクチャとオープンリポジトリを与えています。
未解決の問題は実行力です。公開されたシステムは、Kunlun Techのデモンストレーション以外でも、一貫性のある世界を維持し、インタラクティブな速度で応答し、明示されたハードウェア上で動作できるのでしょうか?
開発者は、まず利用可能なベースモデルから始め、再現可能な失敗事例を記録し、蒸留済みチェックポイントの公開後に結果を比較すべきです。そのプロセスによって、Patch Memoryが永続的な基盤なのか、それとも極めて難しい問題に対する有望な回答の1つにすぎないのかが明らかになるでしょう。



