top of page

Kunlun TechがMatrix-Game 3.5をオープン化、ただしリアルタイム性能の主張には依然として公開テストが必要

7月21日
読了時間: 23分

Kunlun Techは、非常に具体的な性能を掲げてMatrix-Game 3.5をリリースした。それは、1基のGPUで毎秒約20フレームのインタラクティブな720p世界生成を実現するというものだ。Kunlun Techのオープンソース世界モデルMatrix-Game 3.5には、約1分にわたる動画シーケンスで位置情報を保持するために設計された幾何学的メモリも追加されている。しかし、公開パッケージには、目玉となる速度を支える蒸留モデルがまだ含まれていない。

この隔たりにより、今回の発表は単なる新モデルのリリース以上の意味を持つ。Kunlun Techは、コード、ベースウェイト、検証可能なメモリアーキテクチャを公開した。開発者は、システムがどのようにシーンを想起し、カメラを制御するかを調べられる。しかし、利用可能なチェックポイントだけでは、完全なリアルタイム構成をまだ再現できない。

したがって、当面の競争はKunlun Techとあらゆる世界モデル開発者との対決ではない。Google DeepMindのGenie 3のようなクローズドで統合されたシステムに対して、オープンな技術アクセスが挑む構図だ。Googleが洗練されたナビゲーション可能な体験を提供する一方、Kunlun Techは、外部の開発者がアーキテクチャを制御できる代わりに、より多くのセットアップ作業を受け入れることに賭けている。

Kunlun Techはオープンな世界モデルをリリースしたが、完全なリアルタイムスタックではない

Matrix-Game 3.5は、持続的な視覚メモリをインタラクティブ動画モデルの中核機能に据えている。

Kunlun Techは、上海で開催された2026 World Artificial Intelligence Conferenceの7月19日のイベントで、このモデルを発表した。Skyworkの主任科学者であるCheng Yuが、Matrix-Gameシリーズの最新版として同システムを紹介した。

同社の公式発表記事では、一人称および三人称モードでカメラ制御可能な動画を生成する、50億パラメータのモデルとして説明されている。Kunlun Techによれば、約1分間の生成にわたって有用な記憶を維持できるという。

このリリースは、動画生成モデルが単独のクリップ生成を超えつつある中で登場した。従来の動画モデルは、フレームから次のフレームへと自然に見えるシーケンスを作成する。インタラクティブな世界モデルは、それに加えて、位置、被写体、過去の出来事を保持しながら、アクションに応答しなければならない。

この違いは、仮想カメラが振り返ったときに明確になる。動画生成モデルは、視聴者の背後にある通りをひそかに別のものへ置き換えながらも、説得力のある旋回映像を生成できる。インタラクティブ環境は、元の通りを記憶し、新しい視点から再構築しなければならない。

Matrix-Game 3.5は、Patch Memoryによってこの問題に対処する。パッチとは、過去のフレームから抽出された小さな領域である。モデルは、その領域を推定深度およびカメラ位置と関連付け、メモリに三次元空間上の位置を与える。

カメラが戻ると、システムは現在位置から見えると予測されるパッチを取得する。その後、それらを新しいビューに再投影し、生成されたモザイクを動画生成モデルに供給する。

Kunlun Techは、このメモリシステムをWarped PRoPEと組み合わせている。位置エンコーディングは、視覚トークンが時間と空間をまたいでどのように関係するかをtransformerに伝える。Warped PRoPEは、視点や遠近感の変化を含むカメラ投影情報を、それらの関係に追加する。

このリリースでは、静的な風景と動く被写体も分離されている。地形、建物、固定物は長期的な幾何学メモリに格納できる。キャラクターや車両には、古い位置を固定することなく外観を保持することを目的とした、別個の参照トークンが与えられる。

この分離が重要なのは、無差別な記憶がそれ自体でエラーを生み出すからだ。システムが車を通りの一部として記憶すると、その車は別の場所に移動した後で再び現れる可能性がある。その結果、複製、視覚的な軌跡、あるいは静止した幽霊のような像が生じかねない。

公開リポジトリには、Apache 2.0ライセンスの下で、一人称および三人称のベースチェックポイントが含まれている。また、メモリ再投影コンポーネント、入力例、設定ファイル、推論コードも収録されている。

利用可能なモデルは、テキストおよび画像から動画を生成する基盤モデルWan2.2-TI2V-5Bをベースとしている。ユーザーは、そのテキストエンコーダー、動画オートエンコーダー、transformerコンポーネント、トークナイザーを別途ダウンロードする必要がある。このパイプラインは、メートル単位の深度推定にDepth Anything 3も利用する。

これは意義のあるリリースだ。開発者は実装を調査し、メモリの挙動を変更し、独自のシーケンスを生成できる。また、選別されたデモ動画だけに全面的に頼ることなく、システムの失敗も研究できる。

しかし、Kunlun Techは主要な性能主張に関係するすべてのコンポーネントを公開したわけではない。リポジトリによれば、蒸留されたリアルタイム自己回帰モデルは後日提供される予定だ。現在利用可能なベースモデルは、より低速な双方向生成プロセスを使用している。

この違いによって、今回の発表をどう受け止めるべきかが変わる。Matrix-Game 3.5はアーキテクチャを評価できるほどにはオープンだが、発表された毎秒20フレームのモードを独立して検証できるほど完全ではない。

Patch MemoryがMatrix-Game 3.5の最大の賭けである理由

Kunlun Techは、単一の動画コンテキストウィンドウに世界全体を記憶させるのではなく、長期的な一貫性を検索の問題として扱っている。

多くの生成動画システムは、限られた直近のコンテキストで動作する。動きをある程度滑らかに保つのに十分な先行フレームを保持するが、そのウィンドウの外にある細部は置換や歪みにさらされやすくなる。

コンテキストウィンドウを拡張しても、問題が自動的に解決するわけではない。追加されるすべてのフレームが計算資源を消費し、現在のビューには関係のない情報を含む可能性がある。また、古いフレームは過去のカメラ位置から環境を捉えている。

そこでPatch Memoryは、選択的な想起を利用する。システムは局所的な観測結果を保存し、カメラの現在の表示領域に関連するものだけを取得する。これにより、生成モデルは何が表示されるべきかについて、的を絞った根拠を得られる。

このプロセスは、過去のフレームの深度を推定することから始まる。深度は、目に見える各点がカメラからどの程度離れているかを示す。システムはその推定結果を、カメラの位置と向きを記録するカメラポーズと組み合わせる。

これらの入力により、Matrix-Game 3.5は画像パッチを共有空間座標系へ持ち上げることができる。カメラの位置が変化すると、モデルは記憶されたパッチのうち、どれが引き続き表示されるべきかを特定できる。

その後、システムはそれらのパッチを現在のカメラビューへ再投影する。これによって生成されるのは、完全にレンダリングされたシーンではなく、部分的なモザイクだ。空白の領域や不確かな領域は、依然として生成する必要がある。

この役割分担は重要だ。メモリがすべての出力ピクセルを厳密に決定するわけではない。メモリは、基盤となる動画モデルに動きや新しいコンテンツを生成する余地を残しつつ、diffusion transformerに関連する過去の根拠を与える。

Warped PRoPEは、この仕組みのもう一つの部分を担う。標準的なロータリー位置エンコーディングは、attention層がトークン間の相対位置を表現するのに役立つ。カメラ対応版では、そのエンコーディングに投影行列が組み込まれる。

実用的に言えば、Patch Memoryは「この領域は以前どのように見えていたか?」という問いに答える。Warped PRoPEは「その観測結果は、現在の視点とどのように対応するべきか?」という問いへの回答を助ける。

Kunlun Techによれば、この設計ではbackboneに追加のパラメータを必要としない。これは、より大規模なメモリ機構が効率性の主張を容易に損なう可能性があるため重要だ。パラメータを持たない幾何学レイヤーであれば、主要モデルを拡大せずに構造を追加できる。

モデルの静的ブランチと動的ブランチは、別の緊張関係にも対処する。幾何学は恒久的な物体には有用だが、動く被写体へ不用意に適用すると有害になる。

Matrix-Game 3.5は、動体検出とセグメンテーションを使用して、動的オブジェクトを幾何学メモリから除外する。その後、マルチビュー参照トークンが被写体のアイデンティティと外観をフレーム間で維持する。

このアプローチは、一人称世界と三人称シーンの両方をサポートする。三人称チェックポイントは、主人公について最大4枚の切り抜かれた参照画像を受け入れられる。これらの参照画像は、モデルが服装、体形、その他のアイデンティティを示す特徴を保持するのに役立つ。

この設計は、検索可能なナレッジベースにおける検索と似ている。AIシステムが、過去のすべての項目を一度に読み込む必要はほとんどない。必要なのは、現在のタスクに関連する根拠を検索することだ。

ただし、視覚メモリにはさらに厳しい制約がある。取得した情報を幾何学的に整合させなければならない。正しい建物のパッチであっても、道路の反対側に投影されれば有害になる。

したがって、深度エラーはメモリエラーへ波及する可能性がある。不正確な推定によって、パッチは誤った距離に配置される。カメラポーズのドリフトによって、パッチが誤って回転または移動することもある。

オクルージョンも別の課題をもたらす。車両の背後にあると記憶された建物が、その車両を透過して見えてはならない。システムには、有用な過去情報と現在隠れているコンテンツを区別する可視性ロジックが必要だ。

動的オブジェクトのフィルタリングも失敗する可能性がある。わずかな動き、影、反射、植生、カメラの動きによって、セグメンテーションは複雑になり得る。誤分類によって、有用な風景が消去されたり、被写体の古い位置が保存されたりする可能性がある。

モデルの技術レポートでは、これらのコンポーネントを、シーンの想起、カメラ制御、アイデンティティの一貫性を実現する統合ソリューションとして位置付けている。このアーキテクチャは、長時間動作する生成動画で一般的に見られる障害を直接対象としている。

それでも、幾何学的一貫性は物理的理解と同じではない。システムはドアの位置を記憶しながら、その周囲であり得ない衝突を生成することがある。キャラクターのジャケットを保持しながら、そのキャラクターの行動がもたらす結果を無視することもあり得る。

したがって、Patch Memoryは信頼できる仕組みではあるが、完全なシミュレーションエンジンであることの証明ではない。その価値は、困難な再訪、方向転換、オクルージョン、環境変化において測定可能な改善を示せるかどうかに左右される。

単一GPUという主張がクローズドな世界モデルに圧力をかける

Matrix-Game 3.5が戦略的に重要なのは、Kunlun Techが検証可能なアーキテクチャと、プロ向け単一GPUでのデプロイ目標を組み合わせているからだ。

Google DeepMindは、Genie 3によって明確な比較対象を確立した。GoogleのGenie 3の詳細によると、このシステムは毎秒24フレームで、ナビゲーション可能な720p環境を生成する。

Googleはまた、Genie 3が数分間にわたって一貫性を保持できるとしている。テキストプロンプトから環境を作成し、生成されたシーン内でのリアルタイムナビゲーションをサポートする。

これらの数値を単純なランキングにしてはならない。Googleは、Genie 3のモデルサイズ、完全なアーキテクチャ、トレーニングデータ、ハードウェア要件を公開していない。また、両システムは異なる制御方式、パイプライン、評価条件を使用している。

Matrix-Game 3.5が主張する速度は、毎秒約20フレームとわずかに低い。より特徴的なのは、アクセシビリティに関する主張だ。Kunlun Techによれば、50億パラメータのシステムが1基のGPUでその速度に到達するという。

「1基」という言葉には文脈が必要だ。リポジトリでは、少なくとも40GBのビデオメモリを搭載したNvidia GPUが必要とされている。Kunlun Techの報告によれば、704×1280ピクセルでの生成時には、メモリ使用量がその上限近くに達する。

推奨環境には、Linuxと少なくとも64GBのシステムメモリも含まれる。チームはNvidiaのAシリーズおよびHシリーズのハードウェアでテストした。これはプロ向けのインフラであり、一般的なノートパソコンや主流のゲーミングカードではない。

それでも、1枚のカードで動作する構成は、研究室や開発チームにとって参入障壁を下げるだろう。マルチGPU環境で必要となる調整、通信、メモリ管理の負担を回避できる。

オープンアクセスには、もう一つの利点があります。研究者は、メモリ検索を調整し、カメラ軌道を置き換え、中間モザイクを検証し、敵対的テストを導入できます。クローズドなインターフェースでは、このような実験が制限されます。

Googleの優位性は依然として大きなものです。Genie 3は、実証済みのシーンの多様性がより幅広く、ユーザー体験もより統合されています。Googleは、独自データ、専用インフラ、直接的な製品流通を組み合わせることができます。

Kunlun Techが提示するのは、別の選択肢です。開発者は、より大きな制御権と、より大きな責任を得ます。依存関係を構築し、大規模なチェックポイントを管理し、カメラデータを準備し、失敗事例を自ら解釈しなければなりません。

Nvidiaは、ワールドモデル競争におけるもう一つの潮流を代表しています。同社のCosmos platformは、合成データ、ロボティクス、自動運転車、フィジカルAIのワークフローに重点を置いています。

Cosmosは、Matrix-Gameのインタラクティブでゲームのような生成とは直接比較しにくいものです。しかし、開発者の関心とインフラ予算をめぐって競合しています。両社とも、ワールドモデルを単一用途の動画ツールではなく、再利用可能な基盤として提示しています。

こうした違いは、市場の分化が進んでいることを示しています。Googleは汎用的で探索可能な体験を重視しています。NvidiaはフィジカルAIのトレーニングとシミュレーションを中心に据えています。Kunlun Techは、インタラクティブメディアを長期的なロボティクス構想へと結び付けようとしています。

Matrix-Gameのこれまでの歩みは、こうしたインフラとしての位置付けを裏付けています。初代モデルでは、大量のMinecraft映像とアクション注釈が使用されました。Matrix-Game 2.0では、リアルタイムで長時間持続するインタラクティブ生成へと拡張されました。

その後、Matrix-Game 3.0では、高解像度出力と長期的なメモリが重視されました。同モデルの以前の技術論文では、50億パラメータのモデルを使用し、720pで最大毎秒40フレームを達成したと報告されています。

この数値は、バージョン3.5で報告された毎秒20フレームより高く見えます。ただし、同一条件下で新モデルのほうが遅いことを示すものではありません。

バージョン3.0の結果では、文書化された高速構成における複数のGPUを含め、異なる推論構成が使用されていました。バージョン3.5では、より明示的な幾何学的メモリ、カメラエンコーディング、被写体処理が追加されています。

また、フレームレートが捉えるのは、インタラクティブ性能の一部にすぎません。深度推定、パッチ検索、動画デコード、入力処理、表示のすべてが、体感レイテンシに影響します。

システムはフレームを高速に生成できても、変更されたコマンドへの応答が遅い場合があります。また、生成ブロックの間で一時停止しながら、高い平均レートを維持することもあります。

現在のMatrix-Game 3.5ベースモデルは、80フレーム単位のブロックを生成します。デフォルト構成では25回のノイズ除去ステップを使用しており、これは予告されている少数ステップのリアルタイム処理ではありません。

未公開の蒸留モデルは、この処理負荷を軽減するとされています。蒸留では、より高速な生成モデルを訓練し、低速な教師モデルの挙動を近似させます。Kunlun Techは、ガイダンス、カメラ制御、メモリ条件付けを段階的に移行するプロセスについて説明しています。

外部の開発者が公称性能を再現できれば、このリリースは効率性とアクセス性の面でクローズドなプロバイダーに圧力をかけるでしょう。蒸留済みチェックポイントの公開が遅れたり、性能に一貫性がなかったりすれば、目玉となる優位性は弱まります。

オープンコードだけでは、展開可能なインタラクティブワールドはまだ証明されていない

最大の不確実性は、Kunlun Techが有用なコードを公開したかどうかではなく、公開された完全なシステムが、入念に選別されたデモの外でもその主張を維持できるかどうかへと移っています。

利用可能なパッケージは、本格的な検証を可能にします。そこには、2つのベースチェックポイント、推論のエントリーポイント、カメラの例、深度関連の依存関係、メモリの可視化が含まれています。

一人称視点の実行は、アンカー画像、テキストプロンプト、カメラ軌道から始まります。軌道には、レンズの幾何学とカメラの動きを記述するカメラの内部パラメータと外部パラメータが含まれています。

三人称視点の生成では、主人公の参照クロップを追加できます。出力ディレクトリには、生成された動画とモザイクメモリの診断用可視化が含まれます。この診断ビューは、開発者がアライメントの失敗を追跡するのに役立ちます。

こうした機能により、Matrix-Game 3.5はデモのみのシステムより透明性が高くなっています。しかし、透明性が自動的に実用性を証明するわけではありません。

最初に不足しているテストは、速度に関するものです。発表された構成を検証するには、公開チェックポイント、正確なハードウェア情報の開示、完全なレイテンシ測定手法が必要です。

毎秒20フレームという報告値には、複数の意味があり得ます。入力の準備後に行われるニューラル生成のみを測定している可能性があります。深度処理、メモリ更新、デコード、表示が除外されている可能性もあります。

より強力なテストでは、ユーザーのコマンドから目に見える応答までのループ全体を測定する必要があります。また、平均レイテンシ、最悪時の停止時間、メモリ使用量、数分間にわたる性能も報告すべきです。

2つ目に不足しているテストは、長期的一貫性に関するものです。1分間のシーケンスが有用なのは、以前のシーンを再訪した際に認識可能な状態が保たれている場合に限られます。

独立した評価では、カメラをある場所に移動させ、そこから離れ、再び戻すべきです。そして、ドア、窓、道、標識、オブジェクトの配置などの構造要素を比較する必要があります。

テストには、前進だけでなくカメラの反転も含めるべきです。生成環境は、視聴者が新たに創作される空間へ進み続ける間は安定して見えることがよくあります。振り返ることで、システムが一貫した世界を保持していたかどうかが明らかになります。

動く被写体には、別のテストが必要です。キャラクターは、幾何学的メモリ内で静止したままになることなく、方向転換や遮蔽を経ても同一性を維持すべきです。車両は、シーンを横切った後に複製されてはなりません。

3つ目に不足しているテストは、アクションに関するものです。ワールドモデルは、カメラ軌道に沿って魅力的な動画を生成するだけでなく、操作に確実に応答しなければなりません。

評価では、要求された移動によって、意図した方向に出力が変化するかどうかを測定すべきです。比較可能な条件下では、同じコマンドが一貫した効果を生み出す必要があります。

4つ目の問題は、物理的挙動です。Patch Memoryは、信頼できるシミュレーション状態を維持することなく、視覚的な表面を呼び戻すことができます。

従来のゲームエンジンは、オブジェクト、衝突ボリューム、インベントリ、スクリプト化されたイベント、決定論的ルールを追跡します。生成動画モデルは、次のフレームがどのように見えるべきかを予測します。

この予測は、柔軟なビジュアルと迅速なプロトタイピングを支援できます。しかし、正確で再現可能な結果を必要とする多くのゲームメカニクスには、依然として適していません。

ハイブリッドアプリケーションは、短期的により現実的な道筋を示します。従来型エンジンが信頼できる状態を保持し、ワールドモデルが背景、視覚的バリエーション、探索用コンテンツを生成できます。

ゲームスタジオは、Matrix-Game 3.5を使用してシーンのコンセプトをテストしたり、インタラクティブなプリビジュアライゼーションを制作したりできます。研究者は、メモリアーキテクチャやカメラ認識型生成の研究に使用できます。

シミュレーションチームは、制御された状態を中心に生成されたバリエーションを検討できるでしょう。ロボティクス研究者は、メモリシステムの一部をセンサー予測や合成データ生成に転用できるかどうかを調査できます。

こうした用途のいずれにも、このモデルがUnreal Engineやその他の決定論的プラットフォームを置き換えると信じる必要はありません。必要なのは、インタラクション下でも視覚的な有用性を維持する、制御可能な生成モデルです。

ハードウェア要件も、当面の対象ユーザーを狭めています。40GBのGPU要件は、大半のコンシューマー向けシステムを対象外にします。単一GPUという説明自体は正確ですが、あらゆる環境でローカル展開できるという意味に受け取るべきではありません。

ライセンスについても確認が必要です。コアプロジェクトにはApache 2.0が使用されていますが、同梱またはダウンロードされるコンポーネントには、それぞれ独自の条件があります。チームは商用利用の前に、Wan基盤モデル、深度モデル、サンプルアセット、サポートライブラリを確認する必要があります。

この公開リリースには、広範な第三者ベンチマークも不足しています。Kunlun Techのデモは意図された挙動を示していますが、入念に選別された例が、難しい入力や持続的な失敗を網羅することはほとんどありません。

これらの制約は、同社の主張が誤りであることを証明するものではありません。公開と検証が異なるマイルストーンであることを示しています。

Kunlun Techは、アーキテクチャとベースウェイトを公開することで、最初のマイルストーンに到達しました。2つ目のマイルストーンは、独立したチームが、開示された条件下で蒸留モデルを実行できるようになった時点から始まります。

Matrix-Game 3.5は、競争の焦点を動画品質からインフラへと移す

より本質的な変化は、ワールドモデルが、メモリ、制御、データパイプライン、展開上の制約を備えたシステムとして評価されるようになっていることです。

動画品質は依然として重要です。ぼやけた表面、不安定な被写体、反復的な動きは、インタラクティブ体験を損なう可能性があります。しかし、視覚品質だけでこのカテゴリが定義されることは、もはやありません。

信頼できるワールドモデルは、アクションを未来の状態と結び付けなければなりません。過去のすべてのフレームを保持することなく、関連する履歴を維持する必要があります。また、ユーザーやエージェントが反応できるほど高速に生成しなければなりません。

Matrix-Game 3.5は、これらの要件をメモリ中心のアーキテクチャとしてまとめています。Patch Memoryは、局所的なシーンの想起を処理します。Warped PRoPEは、視点の変化を表現します。参照トークンは、繰り返し登場する動的な被写体を支援します。

Kunlun Techは、このモデルをより大規模なデータ戦略にも結び付けています。同社によると、動画、ポーズ、アクション、言語データを生成する3つの自動化パイプラインを構築しています。

同社によれば、これらのパイプラインには、500万を超える動画セグメント、1万時間を超える有効トレーニング時間、1,200を超えるゲーム環境が蓄積されています。

これらの数値はKunlun Techが公表したものであり、独立した監査は受けていません。それでも、同社の目的は明確になります。Matrix-Gameは、単なるメディア生成モデルではなく、データおよびシミュレーションのレイヤーとして位置付けられています。

この位置付けにより、同社はゲーム生成とフィジカルAIの中間に置かれます。インタラクティブなゲーム映像は、アクションと結び付いた豊富な視覚データを提供します。ロボティクスでは、より強い因果的・物理的精度が求められます。

一方の領域から他方の領域への移行は、自動的に実現するものではありません。ゲーム動画には、物理世界とは異なる、設計されたルールや視覚効果が含まれています。カメラの動きは、ロボットのアクションと同じではありません。

しかし、どちらの領域にもメモリと予測が必要です。ロボットは、オブジェクトが視界から外れた後も、それを記憶すべきです。インタラクティブ動画モデルは、カメラが別の方向を向いた後も、建物を記憶すべきです。

この共通する技術的課題は、多くの企業が異なる製品に同じ「ワールドモデル」という呼称を使用する理由を説明しています。この呼称は、探索可能な動画、合成トレーニングシステム、予測センサーモデル、エージェントの内部表現を指す場合があります。

Matrix-Game 3.5は、最も明確にはインタラクティブ動画の分野に属します。公開されている入力は、画像、カメラ軌道、テキストプロンプト、任意の被写体参照です。出力は生成動画です。

これを完全なシミュレーターと呼ぶのは、証拠を誇張することになります。通常の動画生成モデルと呼ぶのは、その明示的なメモリと制御の仕組みを無視することになります。

このリリースは、持続性のあるインタラクティブ生成をテストするためのオープンなインフラとして理解するのが最も適切です。その重要性は、他のチームが検証し、異議を唱え、拡張できる具体的な設計を公開した点にあります。

Matrix-Gameが主要製品にならなかったとしても、そのアーキテクチャは競合他社に影響を与える可能性があります。パッチレベルの幾何学的検索は、より大きなコンテキストウィンドウや永続的に再構築されたシーンに依存する手法に対する、検証可能な代替案を提供します。

また、より明確な評価項目も生み出します。研究者は、検索されたパッチがシーンの想起を改善するかどうかを測定できます。カメラエンコーディングが幾何学的ドリフトを減らすかどうかをテストできます。

静的要素と動的要素の分離が失敗する事例を特定することもできます。オープンコードにより、こうした発見をパッチ、フォーク、代替チェックポイントへとつなげられます。

このフィードバックループこそが、今回のリリースを支持する最も強い根拠です。クローズドなシステムは印象的な体験を提供できますが、外部の研究者がその仕組みを切り分けることは容易ではありません。

Kunlun Techがオープン性の恩恵を得るには、依然として普及、ドキュメント、信頼性の高いチェックポイントが必要です。保守された統合機能のないリポジトリは、すぐに過去の記録物となりかねません。

次の段階では、Matrix-Game 3.5が外部での取り組みの基盤となるのか、それとも主にカンファレンス期のリファレンス実装にとどまるのかが明らかになる。

Matrix-Game 3.5リリース後に注目すべき点

オープンリリースがKunlun Techの効率性に関する主張を裏付けるのか、それともそのアーキテクチャとデプロイメントに関する主張の間にある、より大きな隔たりを露呈するのかは、3つのシグナルによって決まる。

最初のシグナルは、蒸留されたリアルタイムチェックポイントである。Kunlun Techは、正確なハードウェアおよびソフトウェア構成とともに、予告した自己回帰型の重みをリリースする必要がある。

独立したチームは、メモリを有効にした状態で、Kunlun Tech Matrix-Game 3.5のオープンソース世界モデルを720pでテストすべきである。結果には、エンドツーエンドのレイテンシ、持続フレームレート、ビデオメモリ使用量、操作応答性を含めるべきだ。

毎秒約20フレームでの再現に成功すれば、Kunlun Techによるクローズドシステムへの挑戦を裏付けることになる。チェックポイントの公開が遅れたり、結果に一貫性がなかったりすれば、今回のリリースにおける主要な効率性の主張は弱まるだろう。

2つ目のシグナルは、独立した長期ホライズン評価である。研究者は、同じ場所への繰り返しの帰還、カメラの反転、オクルージョン、移動する被写体、構造的変化をテストすべきである。

これらのテストでは、視覚的な記憶と物理的な予測を切り分けなければならない。壁を記憶しているからといって、モデルが衝突を理解していることにはならない。人物の顔を保持しているからといって、その人物の状態を追跡していることにはならない。

Matrix-Game 3.0を明確に上回る改善が見られれば、Patch Memoryの仮説を裏付けることになる。改善が小さい、または一貫性がない場合、幾何学的検索が解決するのは、永続的な世界生成における課題の一部にすぎないことが示唆される。

3つ目のシグナルは、外部での採用である。有用な証拠には、継続的に保守されている統合機能、公開された実験、ファインチューニング済みチェックポイント、Kunlun Techの直接的な関与なしに作成されたアプリケーションが含まれる。

リポジトリのスター数が示すのは注目度であって、インフラストラクチャとしての価値ではない。研究、ゲームのプロトタイプ、シミュレーションワークフロー、ハイブリッドエンジンシステムで繰り返し使用されることのほうが、より強いシグナルとなる。

Matrix-Game 3.5を評価する開発者は、範囲を絞ったテストから始めるべきである。カメラの移動経路、プロンプト、ハードウェア、レイテンシ、目に見える不具合を記録する。蒸留モデルが公開されたら、それらのテストを再度実施する。

中心的な問いは、今や具体的である。オープンな50億パラメータのシステムは、1基のプロフェッショナル向けGPU上でインタラクティブな速度で応答しながら、生成した世界を記憶できるのか。その答えによって、Matrix-Game 3.5が再利用可能なインフラストラクチャとなるのか、それとも野心的なプレビューにとどまるのかが決まる。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)とM-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page