MineExplorerタスクの複雑化でClaude Opus 4.6が65ポイント下落
AnthropicのClaude Opus 4.6はMineExplorerで首位となったものの、成功率は1ホップタスクの77%から4ホップタスクでは12%に低下した。MeituanのLongCatチームが公表した結果によれば、ベンチマーク全体で完了できたのはわずか41%だった。
この急落こそが、Anthropic MineExplorerにおける本質的な論点である。Claudeは、目標の達成に直接的な1ステップだけが必要な場合には良好な成績を示した。一方、変化する世界の中で、明示されていない複数の前提条件を発見し、調整する必要がある場合には苦戦した。
MineExplorerは、最長3分間に及ぶ813件の人手検証済みMinecraftシナリオを通じて、この差を測定する。Claude、GPT、Geminiシステムを含む、8つのモデルファミリーにまたがる18種類のマルチモーダルモデルをテストしている。ベンチマークの著者らは、コード、データセット、タスク生成ワークフロー、評価環境を公開した。
この結果は、マルチモーダルエージェントに関するよくある前提に疑問を投げかける。脅威、物体、資源を認識できることは、環境が変化するなかで有用な計画を維持できることを意味しない。MineExplorerは、その違いを測定可能な失敗曲線として示している。
従来のMinecraftベンチマークは、計画、指示追従、建築、ゲーム知識を検証してきた。これに対してMineExplorerは、Minecraft固有のルールに強く依存するタスクを数多く除外している。掲げる対象はより広い。持続的な軌跡にわたって知覚、推論、行動を組み合わせる探索である。
このベンチマークはまだプレプリントであり、Minecraftですべての物理環境を表現できるわけではない。それでも、この知見は、より強力な視覚能力や長いコンテキストが自律エージェントの信頼性を自動的に高めるという主張に、直ちに圧力をかけるものだ。
MineExplorerは3分間を本格的なエージェントテストへ変える
MineExplorerは評価対象を、場面を認識できるかどうかから、相互依存する一連の判断を乗り切れるかどうかへと移している。
LongCatチームは、2026年5月のプレプリントでMineExplorerを発表した。第2版は6月12日に公開され、Meituanの技術チームは7月に詳細な結果の要約を公表した。
各エピソードは最大1,800環境ステップ実行できる。1ステップは0.1秒に相当し、3分間の継続的なインタラクションとなる。世界は各アクションの後に更新されるため、モデルは見えているものと次に何をすべきかを繰り返し再検討しなければならない。
この時間は人間の感覚では短く聞こえる。しかし、画像を観察し、状態を維持し、行動を選択し、数百回のインタラクションにわたってミスから回復しなければならないエージェントにとっては長い。
タスクはホップ数で分類される。1ホップタスクでは、エージェントが暗黙のサブタスクを推論する必要がない目標が提示される。2ホップから4ホップのシナリオでは、環境を通じて発見しなければならない隠れた前提条件が追加される。
たとえば、保護された場所に到達するよう指示されたエージェントを考えてみよう。直接の経路は塞がれているかもしれず、必要なツールは別の場所にあるかもしれず、敵対的なエンティティが移動を制約する可能性もある。指示は目的地を示すが、そこへ到達するために必要なすべての行動を示してはいない。
MineExplorerは各複合タスクを、初期状態、自然言語の指示、依存関係グラフ、ルールベースのマイルストーンで表現する。依存関係グラフは隠れたタスク構造を記録するが、モデルが完全なグラフを受け取ることはない。
マイルストーンにより、評価者は別の言語モデルに軌跡全体の判定を委ねずに、部分的な進捗を測定できる。たとえば、エージェントが物体を見つけたか、エリアに入ったか、必要な中間行動を完了したかを検出できる。
著者らは、こうした自動化された結果をClaude Opus 4.6の軌跡に対する人間の評価と比較した。完了したマイルストーンの集合は、5点満点で平均4点に近い人間評価を得た。完全に失敗した集合は3点未満にとどまった。
この一致によって評価器が完璧になるわけではない。ただし、マイルストーンの達成が恣意的なゲームイベントではなく、意味のある進捗を捉えていることを示す証拠にはなる。
チームはまた、探索と記憶済みのMinecraft専門知識を切り分けようとした。候補となる原子的タスクは、ゲーム固有の慣習への依存度について選別された。専門知識が支配的なタスクは除外された。
この設計上の選択は重要である。エージェントがMinecraftの目標に失敗する理由は、大きく異なる2通りがあり得るからだ。ゲームのwikiにあるレシピを知らない場合もあれば、見えている証拠を実行可能な計画へ結び付けられない場合もある。
MineExplorerは後者の問題を重視しようとしている。14の能力カテゴリは、知覚、推論、行動をカバーする。これには空間・時間知覚、エンティティ追跡、資源認識、因果推論、移動、収集、配置、クラフティング、戦闘が含まれる。
公開された813例は、1ホップから4ホップまでの依存関係にまたがる。公開データセットには、タスク文、シーン設定コマンド、選択された原子的タスク、マイルストーン、依存関係グラフ、設計ノートが含まれる。
これは静的な問題セット以上のものだ。研究者はシーンの構築方法を調べ、評価を再実行し、より困難なバリエーションを作成し、環境をトレーニングに利用できる。
この公開性により、ベンチマークはエージェント開発に影響を与える可能性を持つ。同時に、探索について広範な主張を行うベンチマークにとって重要な特徴である、前提を検証しやすくする効果もある。
Anthropic MineExplorerでの首位がなお警告である理由
Claude Opus 4.6は比較で勝利したが、その首位は、テストされたすべてのモデルが信頼できる長期的な振る舞いからどれほど遠いかを示している。
ベンチマークは、8つのファミリーにまたがる18種類の先進的なマルチモーダルモデルを評価した。Claude Opus 4.6は、41%で総合タスク成功率の最高値を達成した。
リーダーボード上の順位だけを見れば、41%という結果はまずまずに見えるかもしれない。しかし、タスクの深さごとに分けると、はるかに弱く映る。
Claude Opus 4.6は1ホップタスクの77%を完了した。4ホップタスクでは成功率が12%まで低下した。この65ポイントの下落は、依存関係の追加が単に少し難易度を上げるだけではないことを示す。
隠れた前提条件が一つ増えるたびに、計画を失う機会がもう一つ生まれる。モデルは関連する証拠に気づき、中間目標を推論し、それを正しく実行し、最終目標との関係を維持しなければならない。
初期のミスはエピソード全体に波及しうる。必要な資源を通り過ぎれば次の行動が妨げられる。誤った経路を選べばステップを消費し、エージェントの視界も変わる。その後の観察は、すでに誤った内部状態に基づいて解釈される可能性がある。
このため、Anthropic MineExplorerの結果が圧力をかけるのはAnthropicだけではない。Claudeはこのテストで最も強力なモデルだった。したがって、その失敗曲線は孤立したClaudeの弱点を示すものではなく、この特定の設定における上限として機能する。
この知見は、標準的なモデルスケーリングの物語も複雑にする。論文は、より大規模なモデルや専用の思考モードが一貫して性能を改善したわけではないと報告している。
パラメータの増加は、範囲が限定されたプロンプトにおける知覚や推論を強化できる。しかし、動的な環境では別の能力が必要となる。すなわち、記憶、現在の観察、変化する目標の間で有用な整合性を維持する能力だ。
コンテキストを長くしても、その整合性が保証されるわけではない。現在のシーンをもはや説明しない古い画像が保存される可能性がある。そうした観察は、モデルを助けるのではなく、より新しい証拠と競合しかねない。
著者らは、過去の視覚フレームの数を増やしてこの問題を検証した。古い観察が現在の状態に対するモデルの理解を妨げるにつれ、性能は最終的に低下した。
また、モデルに単により多くの時間が必要なのかも調べた。エピソードで最大1,800ステップを許可しても、失敗したエージェントはなお失敗した。解決可能なタスクは早期に完了する傾向があり、追加のインタラクションによって多くの破綻した軌跡が救われることはなかった。
これらの結果は、二つの安易な解決策を崩す。エージェントにより多くのコンテキストを与えることは、より良い記憶を与えることと同義ではない。より多くの行動を与えることは、より良い計画を与えることと同義ではない。
この圧力は、コンピュータ操作エージェント、ロボティクスシステム、自動化された研究ツールを構築する開発者にも及ぶ。こうした製品は固定されたスクリーンショットの外で動作する。環境はエージェント自身と外部イベントの双方に反応して変化する。
ブラウザエージェントは、記録を見つけ、フィルターを変更し、更新されたページを解釈し、最終的な送信を検証する必要があるかもしれない。倉庫ロボットは、通路が塞がれていることを見つけた後に迂回する必要があるかもしれない。研究エージェントは、矛盾する証拠を発見した後に検索を修正する必要があるかもしれない。
いずれの場合も、目に見える目標の裏には前提となる判断が隠れている。モデルは個々の行動をすべて正しく実行できても、仕事全体には失敗しうる。
MineExplorerは、失敗率がブラウザやロボットへ直接移転することを証明するものではない。隠れた依存関係が積み重なると、短いマルチモーダルテストでの成功が限定的な保証しか提供しないことを示している。
この区別は、調達と導入の判断に影響すべきである。購入者は、モデルが画面を認識できるか、もっともらしい次の行動を生成できるかだけでなく、完了したワークフロー全体でエージェントがどのように機能するかを問うべきだ。
本当の問題は視覚認識ではなくナビゲーション
Claude Opus 4.6の失敗のほぼ60%はナビゲーションに起因するとされており、状態を伴う移動がこのベンチマークで最も明確なボトルネックとなっている。
LongCatチームの失敗分析は、ナビゲーションのミスを、物体操作やタスク推論などの問題から分けている。ナビゲーションは、分析された失敗のほぼ60%を占めた。
この数値は、モデルが単に方向を把握できなかったことを意味するわけではない。オープンワールドにおけるナビゲーションは、空間記憶、視覚認識、行動制御、目標管理を組み合わせる。
エージェントは、自分の位置を把握し、通過した場所を記憶し、移動が意図した結果を生んだかを判断しなければならない。また、いつ経路を断念し、別の選択肢を探索するかも決める必要がある。
静的な視覚テストは、このループの一部しか切り出さない。モデルは画像を見て質問に答える。その回答によってシーンが変化することはなく、一つの誤答が次の観察を歪めることもない。
Minecraftではフィードバックが生じる。エージェントが誤った方向へ曲がれば、次の画像には異なる証拠が含まれる。障害物に引っかかれば、移動コマンドを繰り返してもタスクを進めないまま時間を消費する。
その後、モデルは経路が失敗したのか、行動が失敗したのか、あるいは当初の計画が誤っていたのかを診断する必要がある。観察が安定した内部地図ではなく個別のフレームとして到着する場合、この区別は難しい。
MineExplorerの能力スコアは、この解釈を裏付けている。Claude Opus 4.6の知覚スコアは61.91、推論スコアは54.71だった。評価されたモデルの大半で、知覚は行動を上回り、行動は推論を上回った。
モデルは関連する詳細を識別できることが多かった。しかし、それらの詳細を環境変化に耐える協調的な戦略へ変換することには、より大きな困難を抱えていた。
これは、マルチモーダルの進歩が通常どのように示されるかに重要な転換をもたらす。画像理解の改善はエージェントが気づけるものを増やすが、同時に、それらの観察を処理する計画システムの弱さも露呈させる。
関連する物体を10個検出するモデルでも、今どれが重要かを決めなければならない。その選択を最終目標につなげ、視点が変わった後もそのつながりを保持する必要がある。
このベンチマークは、推論と行動、新たな観察を交互に織り込むReActアプローチを採用している。元のReActフレームワークは、環境からのフィードバックを通じてモデルが推論を修正できるよう設計された。
MineExplorerは、そのループが長期的な軌跡の中でどこで破綻し得るかを示している。推論が現在の状態から乖離し、行動が当初の目標に資さなくなり、新たな観測結果が必要な見直しを引き起こさなくなる。
ナビゲーションは、この3つの問題をすべて増幅する。位置を見失ったエージェントは誤った証拠を目にし、誤った状態推定を構築し、劣化した位置情報に基づいてさらに行動を選択する。
これは、より長い思考の連鎖を生成するよりも難しい問題だ。エージェントには、永続的なエンティティ、場所、完了済みのマイルストーン、失敗した経路、未解決の依存関係を構造化して表現する必要がある。
生の視覚履歴は、その代替としては不十分だ。そこに保存されるのはカメラが見たものにすぎず、エージェントが記憶すべきものではない。
同じ区別はエンタープライズエージェントにも当てはまる。過去のすべての画面の記録があっても、信頼できるワークフローの状態が自動的に生まれるわけではない。エージェントは、どのフォームが送信されたか、どのフィルターが有効なままか、どの要件がまだ未解決かを把握しなければならない。
身体性を備えたシステムでは、ナビゲーションは物理的な試験であると同時に認知的な試験にもなる。モデルは、タスクの論理構造を維持しながら空間内を移動しなければならない。
したがってMineExplorerにおける失敗の60%をナビゲーションが占めることは、システムレベルでの取り組みの必要性を示している。より優れた局所コントローラー、明示的な地図、因果的メモリー、進捗監視、復旧ポリシーは、より強力な基盤モデルと同じくらい重要かもしれない。
ベンチマークが測定するもの、測定しないもの
MineExplorerは有用なストレステストを提供するが、その結果は1つのシミュレーション世界と研究者が定義したタスク分布の範囲にとどまる。
最も有力な懐疑論は、外的妥当性に関するものだ。Minecraftは一貫したルールを持つ動的な3D世界を提供するが、家庭、工場、オフィス、公共空間に見られるあらゆる難しさを再現するものではない。
現実のロボットは、不確実な物理現象、センサーノイズ、物理的な損傷、安全上の制約に直面する。コンピューター操作エージェントは、隠れたアプリケーション状態、認証の障壁、ポップアップ、変化するインターフェースに遭遇する。
Minecraftは、こうした複雑さの多くを取り除いている。オブジェクトは離散的で、物理法則は再現可能であり、環境は完全に同一の状態へリセットできる。
この制御性は利点でもある。研究者は同一条件下でモデルを比較し、機器や利用者を危険にさらすことなく失敗を追跡できる。
重要なのは、MineExplorerを身体性知能の万能スコアではなく、診断装置として扱うことだ。41%という結果は、Claudeが無関係な現実世界のワークフローを41%完了できることを意味しない。
ベンチマークの知識フィルタリングも精査を要する。著者らは、原子的タスクが主に一般知識に依存するか、Minecraft固有の慣習に依存するかを分類するため、言語モデルによる判断を用いている。
このプロセスは、明白なゲーム知識による交絡を減らす。ただし、残されたすべてのタスクが既知性の影響を受けないことを保証するものではない。
Minecraftの動画、ガイド、ゲームプレイに関する議論で訓練されたモデルは、一般的なレイアウトや挙動をなお認識できる可能性がある。モデルファミリーごとに、そうした素材に接した量も異なるかもしれない。
arXivの記録によれば、ベンチマーク自体はいまなお開発途上にある。今後の改訂で、タスク、プロンプト、コントローラー、評価手順が変更される可能性がある。
コントローラー設計は特に重要だ。マルチモーダルモデルが、抽象的な推論だけでゲームを操作することはめったにない。周辺のエージェントシステムが、モデルの出力を移動・インタラクションのコマンドへ変換する。
したがって性能は、基盤となるモデルとその足場となる仕組みの両方を反映する。より優れたマッピングシステムや低レベルコントローラーは、モデル自体を変更せずに結果を改善できる可能性がある。
ベンチマークの著者らは、別の制約も認めている。MineExplorerは現在、実証的評価に焦点を当てているが、そのインフラは訓練にも利用できる。
ベンチマーク環境での訓練には、固有のリスクがある。開発者が公開タスクに対して直接最適化を始めれば、リーダーボードの向上は一般的な探索能力ではなく、ベンチマークへの特化を反映するかもしれない。
完全に公開されたMineExplorer codeにより、再現と拡張は容易になる。同時に、後続のモデルリリースにとって、汚染と過学習に関する問いはより重要になる。
独立した評価では、非公開のテストシナリオを維持すべきだ。また、シーンのレイアウト、依存関係の構造、コントローラー実装、プロンプト形式も変えるべきである。
歴史的な文脈も、この慎重さを裏付ける。MinePlannerは以前、長期計画のために45件のMinecraftタスクを公開し、多数のオブジェクトを含む大規模環境では既存のプランナーが苦戦することを示した。
MinePlanner benchmarkは、対話的なマルチモーダル探索ではなく、命題的・数値的な計画に焦点を当てていた。それでも結果は、Minecraftがより小規模な計画領域では隠れるスケーリング上の問題を明らかにし得ることを示した。
ほかのシステムは、指示追従、建築、メモリー、オープンエンドなスキルを検討してきた。これらのプロジェクトは同じゲームを異なる問いに用いているため、見出しとなるスコアを直接比較すべきではない。
MineExplorerの具体的な貢献は、連続的な視覚インタラクション、隠れた前提条件、複数ホップのタスク構築、ルールベースのマイルストーン評価を組み合わせた点にある。
その「初」の主張は、この定義の範囲で読むべきだ。MinecraftはMineExplorer以前から長期的な研究の場となってきた。チームの新規性に関する主張は、独自の評価構造の下で行う、分単位のオープンワールド・マルチモーダル探索に関するものである。
公開直後であるため、幅広い独立した反応が欠けていることも別の制約だ。現在の詳細な解釈の大半は、著者らとその関連技術チャネルによるものだ。
測定結果は検証できる形で公開されているが、因果的な説明には解釈的な部分が残る。たとえばナビゲーションが失敗の大きな割合を占めることは、根本原因がマッピング、メモリー、計画、行動実行のどれにあるかを完全には切り分けていない。
こうした不確実性は中心的な発見を覆すものではない。隠れた前提条件が積み重なるにつれ、成功率は急落する。それらは、今後の実験で何を切り分けるべきかを定めている。
オープンソース化により、MineExplorerはリーダーボード以上の存在になる
このリリースが重要なのは、より優れたメモリー、コントローラー、訓練手法が長期タスクにおける失敗曲線を平坦化できるかを、研究者が検証できるからだ。
チームは、ベンチマークのインスタンスを構築するためにマルチエージェントのワークフローを用いた。シーケンスを制御するオーケストレーターのもとで、5つの専門エージェントが協働する。
ワークフローは初期タスクの草案から始まる。続いて専門エージェントと検証エージェントが設計を議論し、不整合を特定し、シーン、依存関係グラフ、マイルストーン評価器を改訂する。
著者らの人手評価によれば、このプロセスは単一エージェントのベースラインと比べ、インスタンスの妥当性をおよそ30ポイント高めた。また、品質スコアも約0.5ポイント上昇し、特に4ホップタスクで効果が大きかった。
最終リリースには、人手で検証された813件のインスタンスが含まれる。別途、より高い難度を基準に選ばれた100シナリオのハードサブセットも用意されている。
この生成パイプラインは、ベンチマークに根強く存在する問題に対処する。数百の対話的環境を手作業で構築するのは遅く、一方で制約のないモデル生成タスクには、不可能な目標や壊れた評価が含まれがちだ。
自動合成と人手検証を組み合わせることで、中間的な道筋が得られる。この手法なら、品質ゲートを維持しながらより多くのタスクを生み出せる。
同じ手法は、テストケースだけでなく訓練シナリオも生成できる。研究者は依存関係グラフを作成し、サンドボックスのシーンを生成し、決定論的なマイルストーンチェックを追加できる。
これは重要だ。長期タスクを担うエージェントには、時間の経過とともに展開する失敗を経験する機会が必要だからである。静的な視覚データセットでは、誤った分岐や見落とした前提条件からの回復を教えられない。
オープンなインフラは、エンドツーエンドのモデルスケーリング以外の選択肢も招く。チームは基盤モデルを固定したまま、明示的な空間地図、エピソード記憶、因果グラフ、階層型プランナーを試験できる。
別の実験では、高レベルの計画と低レベルの移動を分離できる。モデルが目標を選び、専門コントローラーが障害物回避と経路実行を担う形だ。
そうすれば研究者は、ナビゲーションの失敗が知能の弱さ、運動制御の弱さ、あるいは両者の間の不安定なインターフェースのどれを反映しているのかを問える。
このベンチマークは、カリキュラム設計も支援し得る。エージェントは1ホップのタスクから始め、完了率が安定するにつれて、より深い依存関係グラフへ進むことができる。
ただし、訓練セットと評価セットは明確に分けなければならない。公開シナリオを再利用すれば、MineExplorerは暗記テストになってしまう。
将来において最も有益な結果は、リーダーボードでの小さな向上ではない。1ホップから4ホップのタスクまで、より緩やかな低下を示すことだ。
全体的な成功率を上げながら同じ崩壊曲線を維持するシステムは、局所的な能力を改善したにすぎない。依存関係が深くなっても性能を維持するシステムは、長期的な協調を改善している。
この区別は、今後の報告のあり方を形作るべきだ。全体のタスク成功率は、複数の挙動を1つの数値に圧縮する。ホップごとの性能は、エージェントがどこで信頼性を保てなくなるかを明らかにする。
オープンリリースは、外部チームにこれらの主張を検証する手段を与える。また、Minecraftのスタック全体を再構築することなく、より困難な評価を提案することも可能にする。
Anthropic MineExplorerの結果後に注目すべき点
次の段階では、独立した再現、改善されたナビゲーションシステム、未知の複数ホップタスクにおける安定した性能に焦点を当てるべきだ。
最初のシグナルは、41%の全体スコアと77%から12%への低下が独立して再現されるかどうかだ。研究者は、文書化されたコントローラー、プロンプト、環境の設定のもとで、Claude Opus 4.6やほかのモデルを再実行すべきである。
近い結果が再現されれば、隠れた前提条件が一般的な失敗パターンを引き起こすという主張は強まる。大きな差異があれば、初期リーダーボードが示す以上にエージェントの足場となる仕組みが寄与していることを示唆する。
2つ目のシグナルは、明示的な状態・ナビゲーションシステムが支配的な失敗カテゴリを減らせるかどうかだ。有用な実験では、生のフレーム履歴を地図、構造化メモリー、因果的タスクグラフ、経路復旧ポリシーと比較すべきである。
意味のある改善は、推論や行動の性能を犠牲にすることなく、ナビゲーションの失敗を減らすものだ。単にコンテキストウィンドウを広げるだけでは、ベンチマークの中心的な批判に答えたことにはならない。
3つ目のシグナルは、未公開の4ホップシナリオにおける新しいモデルの性能だ。開発者は、全体平均だけでなく、ホップ数ごとのタスク成功率を報告すべきである。
1ホップタスクで高得点を出しても、4ホップタスクで12%前後にとどまるモデルは、長期タスクのギャップを埋めていない。未知の依存関係構造で強い結果を示すことが、一般的な探索能力のより良い証拠となる。
読者は、モデル開発者がMineExplorerや関連評価を公式のシステムカードに採用するかどうかにも注目すべきだ。掲載されれば、長時間にわたるマルチモーダルなインタラクションが標準的な能力目標になりつつあることを示す。
開発者にとって、実践的な教訓はすでに明確だ。孤立した行動や洗練されたデモンストレーションだけでエージェントを評価してはならない。
隠れた前提条件、変化する状態、回復の機会を含む完全なワークフローをテストする。エージェントがどこで目標を見失うのかを測定し、知覚の誤りをナビゲーション、推論、制御の失敗と区別する。
エンタープライズの購入者も、同じ証拠を求めるべきだ。モデルのベンチマーク順位は、統合されたエージェントが複数段階のプロセスを一貫して完了できるかについて、ほとんど語らない。
MineExplorerは、身体性AIをめぐる議論に決着をつけるものではない。しかし、1つの弱点を無視しにくくする再現可能な方法を提供している。
Anthropic MineExplorerの結果が特に示唆的なのは、Claude Opus 4.6が首位だったからだ。テストされた中で最も強力なモデルでさえ、タスクの深さが1ホップから4ホップへ上がるにつれ、65ポイントを失った。
これがベンチマークの中心的な逆転だ。現在のマルチモーダルモデルは、世界を説明できても、確実にその中を移動できないことが多い。
したがって、次に重要となるエージェントの到達点は、完璧なスクリーンショット上の回答をもう一つ出すことではない。見慣れない環境で持続的に前進し、誤った方向へ進んだことに気づき、タスクが終わる前に立て直せる能力である。



