top of page

MineExplorer、タスク深度の増加に伴いマルチモーダルエージェントが失速することを示す

AnthropicのClaude Opus 4.6はMineExplorerで首位となったものの、成功率は1ホップタスクの77%から4ホップタスクでは12%へと低下した。MeituanのLongCatチームが公表した結果によれば、同モデルがベンチマーク全体で完了できたのは41%にとどまった。

この急落こそが、Anthropic MineExplorerをめぐる本質的な物語だ。Claudeは、目標の達成に直接的な1ステップだけを要する場合には好成績を収めた。一方、変化する世界の中で、明示されていない複数の前提条件を発見し、連携させる必要がある場合には苦戦した。

MineExplorerは、最大3分間に及ぶ人間検証済みのMinecraftシナリオ813件を通じて、この差を測定する。Claude、GPT、Geminiのシステムを含む、8つのモデルファミリーにまたがる18のマルチモーダルモデルを試験するものだ。ベンチマークの著者らは、コード、データセット、タスク生成ワークフロー、評価環境を公開している。

この結果は、マルチモーダルエージェントに関する一般的な前提に疑問を投げかける。脅威、物体、資源を認識できることは、環境が変化する中でも有用な計画を維持できることを意味しない。MineExplorerは、その違いを測定可能な失敗曲線として示した。

従来のMinecraftベンチマークは、計画、指示追従、建設、ゲーム知識を検証してきた。それに対してMineExplorerは、Minecraft固有のルールに大きく依存するタスクを多数除外している。掲げる対象はより広い。すなわち、持続的な軌跡にわたり知覚、推論、行動を組み合わせる探索である。

このベンチマークはまだプレプリントであり、Minecraftがあらゆる物理環境を表現できるわけではない。それでも、この知見は、より強力な視覚能力やより長いコンテキストが自律エージェントの信頼性を自動的にもたらすという主張に、直ちに圧力をかける。

MineExplorer、3分間を本格的なエージェント試験に変える

MineExplorerは、評価対象をシーン認識から、相互依存する意思決定の連続を乗り切る能力へと転換する。

LongCatチームは、2026年5月のプレプリントでMineExplorerを発表した。第2版は6月12日に公開され、Meituanの技術チームは7月に詳細な結果概要を公表した。

各エピソードは、環境内で最大1,800ステップ実行できる。1ステップは0.1秒を表し、3分間の連続的な相互作用となる。世界は行動のたびに更新されるため、モデルは見えているものと次にすべきことを繰り返し再考しなければならない。

この長さは、人間の基準では短く聞こえるかもしれない。しかし、画像を観察し、状態を維持し、行動を選び、数百回の相互作用にわたって誤りから回復しなければならないエージェントにとっては長い。

タスクはホップ数で分けられる。1ホップタスクでは、エージェントが明示されていないサブタスクを推論する必要のない目標が提示される。2ホップから4ホップのシナリオでは、環境を通じて発見しなければならない隠れた前提条件が加わる。

たとえば、保護された場所へ到達するよう指示されたエージェントを考えてみよう。目の前の経路は塞がれているかもしれず、必要な道具は別の場所にあるかもしれず、敵対的な存在が移動を制約するかもしれない。指示には目的地が示されているが、そこへ着くために必要なすべての行動は示されていない。

MineExplorerは、各複合タスクを初期状態、自然言語による指示、依存関係グラフ、ルールベースのマイルストーンで表現する。依存関係グラフは隠れたタスク構造を記録する。モデルがその完全なグラフを受け取ることはない。

マイルストーンにより、評価者は別の言語モデルに軌跡全体を判定させることなく、部分的な進捗を測定できる。マイルストーンは、エージェントが物体を発見したか、エリアに入ったか、必要な中間行動を完了したかを検出できる。

著者らは、これらの自動評価結果を、Claude Opus 4.6の軌跡に対する人間の評価と比較した。完了したマイルストーンの組み合わせには、5点満点で平均4点近い人間評価が付いた。完全に失敗した組み合わせは3点未満にとどまった。

この一致によって、評価器が完全なものになるわけではない。それでも、マイルストーンの達成が恣意的なゲーム内イベントではなく、意味のある進捗を捉えていることを示す証拠にはなる。

チームはまた、探索と記憶されたMinecraftの専門知識を切り分けようとした。候補となる原子的タスクは、ゲーム固有の慣習への依存度について審査された。専門的知識が支配的なタスクは除外された。

この設計上の選択は重要だ。エージェントがMinecraftの目標に失敗する理由は、大きく異なる2つの場合がある。ゲームのwikiに載っているレシピを知らない可能性もあれば、目に見える証拠と実行可能な計画を結び付けられない可能性もある。

MineExplorerは後者の問題を重視しようとしている。14の能力カテゴリーは、知覚、推論、行動を網羅する。これには、空間的・時間的知覚、エンティティ追跡、資源認識、因果推論、移動、収集、配置、クラフティング、戦闘が含まれる。

公開された813件の例は、1ホップから4ホップの依存関係にまたがる。オープンデータセットには、タスク文、シーン設定コマンド、選定された原子的タスク、マイルストーン、依存関係グラフ、設計ノートが含まれる。

これは単なる静的な質問セットではない。研究者は、シーンの構築方法を調べ、評価を再実行し、より難しいバリアントを作成し、あるいはこの環境を訓練に利用できる。

このオープン性は、このベンチマークがエージェント開発に影響を与える可能性をもたらす。また、探索について広範な主張を行うベンチマークにとって重要な特徴である、その前提を検証しやすくもしている。

Anthropic MineExplorerでの首位がなお警告である理由

Claude Opus 4.6は比較で勝利したが、その首位は、試験されたすべてのモデルが信頼できる長期的挙動からどれほど遠いかを示している。

このベンチマークは、8つのファミリーにわたる18の先進的なマルチモーダルモデルを評価した。Claude Opus 4.6は、41%に達して最も高い総合タスク成功率を達成した。

リーダーボード上の順位だけを見れば、41%という結果はまずまずに見えるかもしれない。だが、タスク深度別に分けると、はるかに弱く見える。

Claude Opus 4.6は、1ホップタスクの77%を完了した。4ホップタスクでは成功率が12%まで低下した。この65ポイントの下落は、依存関係が増えることが、わずかに難易度を上げるだけではないことを示している。

隠れた前提条件が一つ増えるたびに、計画を見失う機会が新たに生じる。モデルは関連する証拠を見つけ、中間目標を推論し、それを正しく実行し、最終目標との関係を維持しなければならない。

初期の誤りは、エピソード全体に波及し得る。必要な資源を通り過ぎれば、次の行動は実行できない。誤った経路を選べばステップを消費し、エージェントの視界が変わる。その後の観察は、すでに誤った内部状態に基づいて解釈される可能性がある。

これが、Anthropic MineExplorerの結果がAnthropicだけに圧力をかける理由だ。Claudeはこの試験で最も強いモデルだった。したがって、その失敗曲線は、孤立したClaudeの弱点の証拠ではなく、この特定の設定における上限として機能する。

この知見は、標準的なモデルスケーリングの物語も複雑にする。論文によれば、より大規模なモデルや専用の思考モードは、一貫して性能を改善しなかった。

パラメータの増加は、限定されたプロンプトにおける知覚や推論を強化し得る。動的な環境では、別の能力が求められる。すなわち、記憶、現在の観察、変化する目標の間で有用な整合性を維持する能力だ。

コンテキストを長くしても、その整合性は保証されない。現在のシーンをもはや表していない古い画像が残る可能性がある。そうした観察は、モデルを助けるのではなく、より新しい証拠と競合するかもしれない。

著者らは、履歴として与える視覚フレーム数を増やして、この問題を試験した。古い観察がモデルの現在状態の理解を妨げるにつれ、性能はいずれ低下した。

また、モデルに単により多くの時間が必要なのかも検証した。エピソードで最大1,800ステップを許可しても、失敗したエージェントはなお失敗した。解決可能なタスクは早い段階で完了する傾向があり、追加の相互作用によって破綻した軌跡が救われることは多くなかった。

これらの結果は、二つの安易な解決策を崩す。エージェントにより多くのコンテキストを与えることは、より良い記憶を与えることと同じではない。より多くの行動を与えることは、より良い計画を与えることと同じではない。

この圧力は、コンピュータ操作エージェント、ロボティクスシステム、自動化された研究ツールを構築する開発者にも及ぶ。こうした製品は、固定されたスクリーンショットの外で動作する。その環境は、エージェント自身と外部イベントの双方に応じて変化する。

ブラウザエージェントは、記録を見つけ、フィルターを変更し、更新されたページを解釈し、最終送信を検証する必要があるかもしれない。倉庫ロボットは、通路が塞がれていることを見つけた後に経路を変更する必要があるかもしれない。研究エージェントは、矛盾する証拠を見つけた後に検索を見直す必要があるかもしれない。

いずれの場合も、目に見える目標の背後には前提となる意思決定が隠れている。モデルは個々の行動をすべて正しく実行できても、完全な仕事には失敗し得る。

MineExplorerは、失敗率がブラウザやロボットへ直接移転すると証明するものではない。隠れた依存関係が蓄積すると、短時間のマルチモーダル試験での成功が示す保証は限定的であることを示している。

この違いは、調達と導入の判断に影響すべきだ。購入者は、モデルが画面を認識できるか、もっともらしい次の行動を生成できるかだけでなく、完了したワークフロー全体でエージェントがどのように機能するかを問うべきである。

本当の問題は視覚認識ではなくナビゲーションにある

Claude Opus 4.6の失敗のほぼ60%はナビゲーションに起因するとされ、状態を伴う移動がこのベンチマークにおける最も明確なボトルネックとなっている。

LongCatチームの失敗分析は、ナビゲーションの誤りを、物体との相互作用やタスク推論といった問題から分けている。ナビゲーションは、分析対象となった失敗のほぼ60%を占めた。

この数値は、モデルが単に道順を知らなかったという意味ではない。オープンワールドでのナビゲーションは、空間記憶、視覚認識、行動制御、目標管理を組み合わせる。

エージェントは、自分がどこにいるかを把握し、どこを通ってきたかを覚え、移動が意図した結果を生んだかを判断しなければならない。また、経路を諦めるべき時や代替ルートを探索すべき時も決める必要がある。

静的な視覚テストは、このループの一部だけを切り出す。モデルは画像を見て質問に答える。その回答によってシーンが変わることはなく、一度の誤答が次の観察を歪めることもない。

Minecraftではフィードバックが生じる。エージェントが誤った方向へ曲がれば、次の画像には異なる証拠が映る。障害物に引っかかれば、移動コマンドを繰り返してもタスクを進めずに時間を消費する。

その後、モデルは、経路が失敗したのか、行動が失敗したのか、それとも当初の計画が間違っていたのかを診断する必要がある。観察が安定した内部地図ではなく別々のフレームとして届く場合、この区別は難しい。

MineExplorerの能力スコアも、この解釈を裏付ける。Claude Opus 4.6は、知覚スコア61.91、推論スコア54.71を得た。評価されたモデルの大半で、知覚は行動を上回り、行動は推論を上回った。

モデルは、多くの場合で関連する詳細を特定できた。しかし、それらの詳細を環境変化に耐える協調的な戦略へと変換することには、より大きな困難を抱えていた。

これは、マルチモーダルの進歩が通常どのように示されるかに重要な逆転をもたらす。画像理解の向上は、エージェントが気付ける対象を広げるが、同時に、それらの観察を処理する計画システムの弱さも露呈させる。

関連する物体を10個検出できるモデルでも、今どれが重要かを決めなければならない。その選択を最終目標へ結び付け、視点が変わった後もそのつながりを保つ必要がある。

このベンチマークは、推論と行動、新たな観察を交互に行うReActアプローチを採用している。元のReActフレームワークは、環境からのフィードバックを通じてモデルが推論を修正できるよう設計された。

MineExplorerは、そのループがより長い軌跡の中でどこで破綻しうるかを示している。推論が現在の状態から乖離し、行動が当初の目標に資さなくなり、新たな観測が必要な修正につながらない。

ナビゲーションは、この3つの問題すべてを増幅する。誤った位置にいるエージェントは誤った証拠を見て、誤った状態推定を構築し、劣化した状況からさらに行動を選択する。

これは、より長い思考の連鎖を生成するより難しい問題だ。エージェントには、持続するエンティティ、位置、完了済みのマイルストーン、失敗した経路、未解決の依存関係を構造化して表現する必要がある。

生の視覚履歴は、その代替としては不十分だ。カメラが見たものは保存できても、エージェントが記憶すべきことまでは保存しない。

同じ区別はエンタープライズ向けエージェントにも当てはまる。過去のすべての画面の記録があっても、信頼できるワークフロー状態が自動的に得られるわけではない。エージェントは、どのフォームが送信済みか、どのフィルターが有効なままか、どの要件が未解決かを把握しなければならない。

身体性を持つシステムにとって、ナビゲーションは物理的かつ認知的なテストとなる。モデルは、タスクの論理構造を保ちながら空間を移動しなければならない。

したがってMineExplorerで失敗の60%をナビゲーションが占めることは、システムレベルの取り組みの必要性を示している。より優れたローカルコントローラー、明示的な地図、因果的メモリ、進捗監視、復旧ポリシーは、より強力な基盤モデルと同じくらい重要になる可能性がある。

ベンチマークが測定するものと、測定しないもの

MineExplorerは有用なストレステストを提供するが、その結果は単一のシミュレーション世界と研究者が定義したタスク分布に限定される。

最も強い懐疑的な論点は、外的妥当性に関するものだ。Minecraftは一貫したルールを持つ動的な3D世界を提供するが、家庭、工場、オフィス、公共空間で見られるあらゆる困難を再現するわけではない。

現実のロボットは、不確実な物理法則、センサーノイズ、物理的損傷、安全上の制約に直面する。コンピューター操作エージェントは、隠れたアプリケーション状態、認証の障壁、ポップアップ、変化するインターフェースに遭遇する。

Minecraftは、こうした複雑さの多くを取り除いている。オブジェクトは離散的で、物理法則は再現可能であり、環境は完全にリセットできる。

この制御可能性は利点でもある。研究者は同一条件下でモデルを比較し、機器やユーザーを危険にさらすことなく失敗を追跡できる。

重要なのは、MineExplorerを身体性知能の万能スコアではなく、診断機器として扱うことだ。41%という結果は、Claudeが無関係な現実世界のワークフローの41%を完了できるという意味ではない。

ベンチマークの知識フィルタリングも精査が必要だ。著者らは言語モデルによる判断を用いて、原子的タスクが主に一般知識に依存するのか、Minecraft固有の慣習に依存するのかを分類している。

このプロセスにより、明白なゲーム知識による交絡要因は減少する。しかし、保持されたすべてのタスクが親しみやすさの影響から完全に自由であるとは保証できない。

Minecraftの動画、ガイド、ゲームプレイに関する議論で訓練されたモデルは、一般的なレイアウトや挙動を依然として認識する可能性がある。モデルファミリーごとに、こうした素材への接触量が異なる可能性もある。

arXivの記録によれば、ベンチマーク自体は現在も進行中の取り組みだ。今後の改訂で、タスク、プロンプト、コントローラー、評価手順が変更される可能性がある。

コントローラー設計は特に重要だ。マルチモーダルモデルが抽象的な推論だけでゲームを操作することはほとんどない。周囲のエージェントシステムが、モデル出力を移動・操作コマンドへと変換する。

したがって、性能は基盤となるモデルとその足場の両方を反映する。より優れたマッピングシステムや低レベルコントローラーなら、モデルを変更せずに結果を改善できるかもしれない。

ベンチマークの著者らは、別の制約も認めている。MineExplorerは現在、実証的評価に焦点を当てているが、そのインフラは訓練にも利用できる。

ベンチマーク環境で訓練することには、独自のリスクがある。開発者が公開タスクに対して直接最適化し始めると、リーダーボードの向上は一般的な探索能力ではなく、ベンチマークへの特化を反映する可能性がある。

完全に公開された MineExplorer code により、再現と拡張は容易になる。同時に、将来のモデルリリースにおける汚染や過学習の問題もより重要になる。

独立した評価では、隠されたテストシナリオを維持すべきだ。また、シーンのレイアウト、依存関係の構造、コントローラー実装、プロンプト形式も変えるべきである。

歴史的な文脈も、この慎重さを裏付ける。MinePlannerは以前、長期的な計画のために45件のMinecraftタスクを公開し、多数のオブジェクトを含む大規模環境では既存のプランナーが苦戦することを示した。

MinePlanner benchmark は、対話的なマルチモーダル探索ではなく、命題的・数値的な計画に焦点を当てていた。それでも、その結果は、Minecraftがより小規模な計画領域では隠れていたスケーリング問題を露呈させうることを示している。

他のシステムでは、指示追従、構築、メモリ、オープンエンドなスキルが検討されてきた。これらのプロジェクトは同じゲームを異なる問いに利用しているため、見出しとなるスコアを直接比較すべきではない。

MineExplorerの具体的な貢献は、連続的な視覚的インタラクション、隠れた前提条件、マルチホップのタスク構築、ルールベースのマイルストーン評価を組み合わせた点にある。

その「初」の主張は、この定義の範囲内で読むべきだ。MineExplorer以前にも、Minecraftでは長期的な研究が行われてきた。チームの新規性に関する主張は、特定の評価構造の下での分単位のオープンワールド・マルチモーダル探索に関するものだ。

もう一つの制約は、公開直後であるため、広範な独立系の反応が不足していることだ。現時点で詳細な解釈の大半は、著者らとその関連技術チャネルからのものとなっている。

測定結果は検証可能だが、因果的な説明は一部が解釈的なままである。たとえばナビゲーションが大きな失敗割合を占めることは、根本原因がマッピング、メモリ、計画、行動実行のどれなのかを完全には切り分けていない。

こうした不確実性は中心的な発見を損なうものではない。隠れた前提条件が積み重なるほど、成功率は急激に低下する。それらは、今後の実験で何を分離すべきかを定めている。

オープンソース化により、MineExplorerはリーダーボード以上のものになる

このリリースが重要なのは、より優れたメモリ、コントローラー、訓練手法が長期的な失敗曲線を平坦化できるかを研究者が検証できるためだ。

チームは、ベンチマークのインスタンスを構築するためにマルチエージェントのワークフローを使用した。5つの専門エージェントが、順序を制御するオーケストレーターの下で協働する。

ワークフローは初期タスク案から始まる。続いて専門エージェントと検証エージェントが設計を議論し、不整合を特定し、シーン、依存関係グラフ、マイルストーン評価器を改訂する。

著者らの人手評価によると、このプロセスは単一エージェントのベースラインと比べ、インスタンスの妥当性をおよそ30ポイント向上させた。また品質スコアも約0.5ポイント上昇し、4ホップタスクで最も大きな効果が見られた。

最終リリースには、人手で検証された813件のインスタンスが含まれる。別の高難度サブセットでは、難易度がより高い100件のシナリオが提供される。

この生成パイプラインは、長年続くベンチマークの問題に対処している。何百もの対話的環境を手作業で構築するのは遅く、制約のないモデル生成タスクには、不可能な目標や壊れた評価が含まれがちだ。

自動合成と人手検証を組み合わせることで、中間的な道筋が得られる。このアプローチは、品質ゲートを維持しながら、より多くのタスクを生み出せる。

同じ手法は、テストケースだけでなく訓練シナリオも生成できる。研究者は依存関係グラフを作成し、サンドボックスのシーンをインスタンス化し、決定論的なマイルストーン確認を付与できる。

これは、長期的なエージェントには時間の経過とともに展開する失敗への練習が必要だからだ。静的な視覚データセットでは、誤った曲がり角や見落とした前提条件からの復旧を教えられない。

オープンなインフラは、エンドツーエンドのモデルスケーリング以外の代替策も招く。チームは基盤モデルを固定したまま、明示的な空間地図、エピソード記憶、因果グラフ、階層型プランナーを検証できる。

別の実験では、高レベルの計画と低レベルの移動を分離できる。モデルが目標を選び、専門コントローラーが障害物回避と経路実行を担う形だ。

その後、研究者はナビゲーションの失敗が、知能の弱さ、運動制御の弱さ、それとも両者の間の不安定なインターフェースを反映しているのかを問える。

このベンチマークはカリキュラム設計も支援しうる。エージェントは1ホップタスクから始め、完了率が安定するにつれて、より深い依存関係グラフへ進める。

ただし、訓練セットと評価セットは区別されたままでなければならない。公開シナリオを再利用すれば、MineExplorerは暗記テストになってしまう。

最も有益な将来の結果は、小さなリーダーボード上の向上ではない。1ホップから4ホップまでの低下がより緩やかになることだ。

全体の成功率を上げながら同じ崩壊曲線を維持するシステムは、局所的な能力を改善したにすぎない。依存関係が深くなっても性能を維持するシステムは、長期的な協調を改善している。

この区別は、今後の報告のあり方を形作るべきだ。全体のタスク成功率は複数の行動を一つの数値に圧縮する。ホップ別の性能は、エージェントがどこで信頼して機能しなくなるかを明らかにする。

オープンリリースにより、外部チームはこれらの主張を検証するための手段を得る。また、Minecraftのスタック全体を再構築せずに、より難しい評価を提案することも可能になる。

AnthropicのMineExplorer結果の後に注目すべきこと

次の段階では、独立した再現、改善されたナビゲーションシステム、未見のマルチホップタスクでの安定した性能に焦点を当てるべきだ。

最初のシグナルは、41%の総合スコアと77%から12%への低下を独立して再現できるかどうかだ。研究者は、文書化されたコントローラー、プロンプト、環境設定の下で、Claude Opus 4.6や他のモデルを再実行すべきである。

近い結果が再現されれば、隠れた前提条件が一般的な失敗パターンを引き起こすという主張は強化される。大きな差が出れば、エージェントの足場が初期のリーダーボードが示す以上に寄与していることを示唆する。

2つ目のシグナルは、明示的な状態・ナビゲーションシステムが支配的な失敗カテゴリを減らせるかどうかだ。有用な実験では、生のフレーム履歴と、地図、構造化メモリ、因果的タスクグラフ、経路復旧ポリシーを比較すべきである。

意味のある改善とは、推論や行動の性能を犠牲にせずにナビゲーションの失敗を減らすことだ。単にコンテキストウィンドウを拡大しても、このベンチマークの中心的な批判には答えられない。

3つ目のシグナルは、未公開の4ホップシナリオにおける新しいモデルの性能だ。開発者は、総合平均だけでなく、ホップ数ごとのタスク成功率を報告すべきである。

1ホップタスクで高得点を出しながら、4ホップタスクでは12%前後にとどまるモデルは、長期的な隔たりを埋めていない。未見の依存関係構造でより強い結果を示せれば、一般的な探索能力に関するより良い証拠となる。

読者は、モデル開発者がMineExplorerまたは関連する評価を公式のシステムカードに採用するかどうかにも注目すべきだ。採用されれば、長時間にわたるマルチモーダルなインタラクションが標準的な能力目標になりつつあることを示す。

開発者にとって、実務上の教訓はすでに明確だ。孤立した行動や洗練されたデモだけでエージェントを評価してはならない。

隠れた前提条件、変化する状態、復旧の機会を含む完全なワークフローをテストする。エージェントがどこで目標を見失うかを測定し、知覚エラーをナビゲーション、推論、制御の失敗と区別する。

エンタープライズの購入者も同じ証拠を求めるべきだ。モデルのベンチマーク順位から、統合されたエージェントが多段階のプロセスを一貫して完了できるかどうかはほとんど分からない。

MineExplorerは身体性AIをめぐる議論に決着をつけるものではない。ただし、一つの弱点を見過ごしにくくする、再現可能な方法を提供する。

AnthropicのMineExplorer結果が特に示唆的なのは、Claude Opus 4.6が首位を獲得したからだ。テストされた最強のモデルでさえ、タスクの深さが1ホップから4ホップに上がると65ポイントを失った。

これがこのベンチマークの中心的な逆転だ。現在のマルチモーダルモデルは、しばしば、確実にナビゲートできない世界を説明することはできる。

したがって、次に信頼できるエージェントの到達点は、完璧なスクリーンショットの回答をもう一つ示すことではない。未知の環境の中で持続的に前進し、誤った方向へ進んだことに気づいて、タスクが終わる前に立て直せる能力を備えることだ。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page