世界モデルレース:Fei-Fei LiのMarbleはゲームチェンジャーか?
- Aisha Washington

- 6月6日
- 読了時間: 11分
更新日:6月17日

remioから1年強でステルスモードを解除し、多額の資金調達を発表してから、AIのパイオニアであるFei-Fei Li氏が設立したスタートアップ、World Labsは、生成ワールドモデル構築競争の号砲を鳴らしました。同社の最初の商用製品であるMarbleが一般公開され、テキストプロンプト、画像、動画を編集・ダウンロード可能な3D環境に変換するプラットフォームを提供します。このローンチにより、World LabsはGoogleのGenieのような競合他社に先んじますが、初期のユーザーフィードバックは、この新興技術を定義する信じられないほどの可能性と実用的なハードルの両方を明らかにしています。これは単なる画像ジェネレーターではなく、機械に書くだけでなく構築することを教えるための野心的な一歩です。
商用ワールドモデルの夜明け

Marbleの重要性を理解するには、まずワールドモデルという概念を把握する必要があります。単語間の統計的関係を学習する大規模言語モデル(LLM)とは異なり、a World Model はAIシステムです環境の内部表現を構築します。空間的関係、オブジェクトの永続性、および空間の物理学を理解するように設計されており、将来の状態を予測し、そのシミュレートされた現実内でアクションを計画することができます。部屋を説明することと、機能的なデジタルレプリカを構築することの違いです。
これは、AIとコンピュータビジョンの第一人者であるFei-Fei Liによって共同設立されたWorld Labsのコアミッションです。最近のマニフェストで、Liは、機械がLLMのテキストベースの推論を超えて、真に「見て構築する」ことができる「空間的知能」を達成するビジョンを明確にしました。彼女は、機械が真にインテリジェントになるためには、3次元空間で物事がどのように存在し、相互作用するかを理解しなければならないと主張しています。Marbleは、そのビジョンを実現するための最初の大きな一歩として提示されており、空間的創造を大衆にもたらすために設計されたツールです。
Marbleの内部:最初の商用World Modelを詳しく見る
Marbleは、Decartなどのスタートアップからのデモがある状況に参入します。Odyssey は未来の断片を垣間見せてくれましたが、Googleの印象的なGenie は限定的なリサーチプレビューにとどまっています。Marbleが際立っているのは、ユーザーが探索するにつれてその場でワールドを生成するのではなく、永続的でダウンロード可能な3Dアセットの作成に焦点を当てている点です。World Labsの共同創設者であるJustin Johnson氏によると、このアプローチにより、モーフィングや一貫性のなさが軽減され、既存のクリエイティブワークフローに統合できる具体的なアセットが得られます。
このプラットフォームの入力の柔軟性は、大きなセールスポイントです。初期のベータ版では単一の画像しか受け付けず(モデルは360度のビューの詳細を考案する必要がありました)、フルローンチではユーザーが複数の画像や短いビデオクリップをアップロードできるようになります。これにより、モデルは空間のより完全な理解を統合し、現実世界の場所のかなりリアルなデジタルツインを生成できます。ユーザーは、作成したものをGaussian splats、メッシュ、またはビデオとしてエクスポートでき、他のアプリケーションでの使用準備が整います。
生成を超えて:AIネイティブワールドモデルエディタの力
おそらくMarbleの最も革新的な機能は、そのAIネイティブ編集ツールのスイートです。これは、プラットフォームが単純な生成を超えて共創の領域に進む場所です。その中心にあるのは"Chisel"remioは、シーンの構造とそのビジュアルスタイルを切り離す実験的な3Dエディターです。ユーザーは、壁、家具、その他のオブジェクトを配置すべき場所を単純な平面やボックスで定義して、大まかな空間レイアウトをブロックアウトし、その後、テキストプロンプトを適用して美的感覚を指示できます。
Johnson氏は、このプロセスを、HTMLがウェブサイトの構造を提供し、CSSがビジュアルスタイリングを追加する方法に例えています。オブジェクトを適切な位置に配置するためにプロンプトを延々と再ロールする代わりに、ユーザーはソファを表す3Dブロックを掴んで移動するだけで済みます。この直接的な操作により、クリエイターは、完全にプロンプトベースの生成ツールではしばしば欠けているレベルの制御を得ることができ、アーティストやデザイナーにとっての主な不満に対処しています。AIに支援してもらいたい創造的な意図を置き換えるのではなく。
このコントロールをさらに強化するのが、ワールドを拡張する機能です。ユーザーが生成されたシーンの端に移動し、詳細が崩壊していることに気づいた場合、「そこに拡張」と指示することで、その周辺の環境をさらに生成できます。さらに大きな空間のために、「コンポーザーモード」を使用すると、クリエイターは複数の生成されたワールドを縫い合わせ、広大で多様な仮想風景を作成できます。
ユーザーレビュー:熱狂と現実の出会い
画期的なテクノロジーでは、初期のローンチは、洗練されたデモとユーザーエクスペリエンスの厄介な現実が出会う場所です。からのフィードバックMarbleの最初のユーザーこの「World Model」の状態について、バランスの取れた現実的な視点を提供します。World Model.
その結果は息をのむほど素晴らしいものになる可能性があります。あるコメント者は「VRでは、シーンが非常に印象的です!」と述べています。これはWorld Labsにとって重要な成功であり、MarbleはすでにVision ProおよびQuest 3ヘッドセットと互換性があり、写真から生成した世界に足を踏み入れることができるのは強力な体験です。この技術は、Johnsonが「コンテンツに飢えている」と表現するVR業界にとって、明らかに計り知れない可能性を秘めています。
幻想を打ち破る:なぜこれが(まだ)真のワールドモデルではないのか
しかし、多くのユーザーはすぐにこの技術の現在の限界に直面しました。フィードバックで繰り返し見られるテーマは、Marbleが真の、連続的に生成されるワールドモデルというよりも、「3D単一シーンジェネレーター」であるということです。ユーザーが最初の生成ポイントからあまりにも遠くへ移動したり、オブジェクトをあまりにも近くで調べようとすると、完全な世界の幻想はすぐに崩壊します。あるユーザーが観察したように、「それらを調査して視点を変えると、品質は急速に低下します。」
このフィードバックは、すべての企業が直面している中核的な課題を指摘していますWorld Model開発者イリュージョンを維持するためには、システムはオンデマンドで詳細を動的に補完する必要があります。ユーザーがドアに向かって歩くと、その向こうの部屋が生成される必要があります。壁を詳しく見ると、高解像度のテクスチャが表示される必要があります。単一の永続的なシーンの生成に焦点を当てたMarbleの現在のアーキテクチャは、このようなオンザフライレンダリングをまだサポートしていません。ユーザーは、美しくレンダリングされているものの、最終的には限定的なジオラマに閉じ込められています。
その他の実用的な問題も表面化しています。一部のユーザーは技術的な不具合を報告しており、シーンの生成を試みた際に「world failed」というメッセージを受け取っています。また、ビジネスモデルに対する不満を表明し、価格に関する詳細を取得する前にサインアップする必要があることを批判し、無料ティアの制限(例:マルチ画像入力なし)では、製品の最も強力な機能の徹底的な評価が妨げられると指摘しています。
新しい種類のWorld Modelでクリエイティブパイプラインを再定義する

現在の制限にもかかわらず、プロフェッショナルなクリエイティブ分野におけるMarbleの即時の有用性は明らかです。Johnson氏は、初期のユースケースはゲーム、映画のビジュアルエフェクト(VFX)、バーチャルリアリティに集中していると見ています。
ゲームにおける生成AIに関する議論は複雑です。最近のGame Developers Conferenceの調査開発者の3分の1が、生成AIが業界に悪影響を与えると考えていることが明らかになりました。その理由として、知的財産、品質、雇用の喪失に関する懸念が挙げられています。Johnson氏は、Marbleがゲーム開発パイプライン全体を置き換えるようには設計されていないことを明確にしています。むしろ、開発者が背景環境やアンビエントスペースを迅速に生成するためにMarbleを使用することを想定しています。これらのアセットは、UnityやUnrealのようなゲームエンジンにインポートでき、開発者はインタラクティブな要素、ロジック、ゲームプレイコードを追加します。これはパイプラインを自動化するのではなく、拡張するためのツールです。
VFX作業において、Marbleは多くのプロジェクトを悩ませる一貫性のなさやカメラ制御の悪さに対するソリューションを提供します。AI動画生成これにより、アーティストは完全な3Dアセットを作成することで、シーンを正確に演出したり、フレーム単位の精度でカメラの動きを制御したりすることができ、これは現在のテキストから動画へのモデルではほぼ不可能です。
エンターテイメントにとどまらず、ロボット工学も予期せぬ恩恵を受ける可能性があります。現実世界でロボットをトレーニングするのは高価で時間がかかります。ジョンソンが指摘するように、ロボット工学には画像モデルや言語モデルのブレークスルーを促進したような膨大なデータセットがありません。Marbleのような生成プラットフォームは、それを劇的に改善する可能性があります。シミュレートするトレーニング環境を無数に用意するのが、より簡単かつ安価になり、この分野の進歩を加速させます。
真の空間的知性への道
Marbleは、デジタル情報とのインタラクションを根本的に再構築する可能性のあるテクノロジーへの最初の商用参入を表しています。これは、次世代のAIは空間的理解の基盤の上に構築されなければならないというFei-Fei Liの信念の具体的な現れです。LLMが機械に言語で推論することを教えたとすれば、この新しいクラスのWorld Model空間について推論することを教えることを目指しています。
ユーザーからのフィードバックは、旅はまだ終わっていないことを示しています。真に動的で永続的、そして無限に探索可能な世界を創造するための技術的なハードルは計り知れません。しかし、これらのツールを今クリエイターの手に委ねることで、World Labsは、テクノロジーの進化に不可欠なフィードバックループをキックスタートさせています。今後の道筋は、Marble の永続的なアセット生成と、リサーチプレビューで見られるオンザフライレンダリングを組み合わせたハイブリッドアプローチになる可能性が高いです。
当面の疑問は、この技術が人間のアーティストに取って代わるかどうかではなく、どのように彼らを力づけるかということです。Chisel のようなツールの導入は、クリエイティブなコントロールが最重要視され、AI が切り離された自動機械ではなく強力な協力者として機能する未来を示唆しています。次の動きは研究室からではなく、これらの新しいツールを手にして、モデルの開発者でさえ予測できなかった何かを構築する最初のクリエイターの波から生まれるかもしれません。
Marble と World Models に関するよくある質問

Marble の 3D 環境生成アプローチは、Google の Genie とどのように異なりますか?
Marble は、さまざまな入力(テキスト、画像、ビデオ)から、永続的でダウンロード可能な3D 環境の作成に焦点を当てています。これらは静的ですが編集可能なアセットです。Google の Genie、リサーチプレビューに基づいたリアルタイムモデルであり、ユーザーの移動に合わせてインタラクティブでプレイ可能な世界をその場で生成しますが、まだ一般公開されている製品ではありません。
World Labs の「Chisel」エディタは、クリエイターにとって具体的にどのような問題を解決しますか?
Chisel は、純粋にプロンプトベースの生成における細かい制御の欠如に対処します。クリエイターは、まず簡単な 3D ブロック(構造)を使用してシーンの空間レイアウトを定義し、次にテキストプロンプトを適用してビジュアルスタイルを定義できます。これにより、オブジェクトの配置を調整するために無限にプロンプトを再ロールする必要がなくなり、ユーザーはシーンの構成を直接、実際に制御できるようになります。
一部のゲーム開発者が Marble のような生成 AI ツールを懸念しているのはなぜですか?
「ゲーム開発コミュニティ」内の懸念は、知的財産権の盗難(モデルが著作権で保護されたアセットでトレーニングされている場合)、アートの品質の低下の可能性、スタジオが人間アーティストを支援するのではなく、AI を使用して手抜きをしたり、人間アーティストを解雇したりするリスクに関連することがよくあります。これらのツールがクリエイティブな役割を強化するのか、それとも自動化するのかについての議論があります。A recent GDC survey also highlighted these concerns.
Marbleの現在のバージョンでユーザーが経験する主な制限は何ですか?
主な制限は、動的なオンザフライ生成がないことです。ユーザーは、3Dシーンが完全に探索可能ではなく、初期生成ポイントから離れるにつれて品質が大幅に低下し、完全な世界の幻想が壊れると感じています。その他の報告されている問題には、時折発生する生成の失敗や、無料利用ティアの制限が含まれます。
Marbleで生成されたアセットは、UnrealやUnityのようなプロフェッショナルなゲームエンジンで使用できますか?
はい、これは主要なユースケースです。World Labsは、ユーザーが生成されたシーンをメッシュやその他の3Dアセットとしてエクスポートし、UnityやUnreal Engineのようなゲームエンジンに直接インポートできるようにすることを意図しています。そこで開発者は、カスタムコード、ロジック、インタラクティブなゲームプレイ要素を追加できます。
Fei-Fei Liは、World Modelの文脈で「空間知能」をどのように意味していますか?"
「空間知能」とは、AIが世界を3次元で理解する能力を指します。画像内のオブジェクトを認識するだけでなく、それらのサイズ、位置、他のオブジェクトとの関係、および特定の環境の物理法則の中でそれらがどのように振る舞うかを理解することを超えています。Liは、これが物理世界と対話できる真にインテリジェントなマシンを作成するための基本的かつ必要なステップであると考えています。


