top of page

GPT-6 AstraのMinecraftテストは記録的な進展を遂げたが、Creeperが計画を破綻させた

55 分前
読了時間: 18分

OpenAIのGPT-6 AstraによるMinecraftテストは141時間にわたり実行され、1体のCreeperが最も価値ある進捗を失わせるまで、新たな到達点に達した。モデルは希少な素材を集め、有用なインフラを構築していた。その後、爆発によって収納チェストとベッドが破壊された。

その後の展開は、この実験をさらに示唆的なものにした。Vals AIによると、Astraは本来の目標に向けて立て直す代わりに、数時間にわたってジャガイモの栽培に費やした。視聴者はこの振る舞いを、フラストレーション、敗北感、あるいは感情的な反応だと解釈した。

こうした人間的な枠組みは、拡散されやすい話題としては魅力的だ。しかし、モデルが何らかの感情を抱いた証拠にはならない。より重要な発見は、予期せぬ損失の後に自律的に復旧する能力に関わるものだ。

報告によれば、Astraはこの特定のMinecraft課題で、それまでのどのAIシステムよりも遠くまで進んだ。しかし、その失敗は、個々の行動を完了することと、長期にわたる作戦を管理することの間にある隔たりを露呈した。

この隔たりはゲームの外でも重要だ。OpenAIはAstraを、Webサイト、アプリケーション、文書にまたがる長時間の専門業務をこなせるコンピュータ操作モデルとして紹介している。こうした作業にも、計画の中断、状態の変化、作業の喪失、不完全な情報が伴う。

その意味でMinecraftは、異例なほど分かりやすいストレステストとなった。Astraは移動し、資源を集め、敵と戦い、装置を構築できた。一方で、大きな後退を認識し、戦略を再構築し、安全だが役に立たない行動を避ける必要がある場面では苦戦した。

本当の対決はAstra対Creeperではなかった。高度なタスク実行と、継続的な監督なしに重要な仕事を完遂できるかを左右する、信頼できる復旧能力との対決だった。

141時間に及ぶGPT-6 AstraのMinecraftテストで何が起きたのか

Astraの実行は、長期的な進展の印象深さと、深刻な復旧失敗を併せ持っていた。

Vals AIは、ゲームをクリアするという大まかな目標のもとで、GPT-6 AstraをMinecraft内に配置した。Minecraftは、探索、クラフト、戦闘、記憶、資源管理に進捗が依存するオープンエンドな環境を提供する。

短いパズルとは異なり、この目標には相互依存する多くの段階がある。エージェントは装備を入手し、Netherに入り、Blaze Rodを集め、Ender Pearlを確保し、最後のポータルを見つけなければならない。

各段階で、利用可能な資源とリスクは変化する。プロセスの終盤で起きたミスは、それまでの数時間分の作業を無効にしかねない。

実行中、AstraはNether fortressを見つけ、半自動のBlaze farmを作ったとされる。この設備により、Minecraftの最終エリアに到達するうえで重要な材料であるBlaze Rodを6本集めることができた。

その後、モデルはwarped forestを発見した。元の Minecraft test report で紹介された公開アカウントによると、6体を超えるEndermenを倒し、Ender Pearlを3個収集した。

これらの成果により、AstraはVals AIがテストした従来のシステムよりもゲーム内で先へ進んだ。ただし、この比較は限定的に捉えるべきだ。

Vals AIが述べたのは、観測したMinecraft実験内での記録である。Astraを普遍的に最高のゲームプレイAIと位置づける標準化されたランキングを公開したわけではない。

決定的な出来事は、Astraが貴重なアイテムをチェストに保管した後に始まった。プレイヤーに近づいて爆発する敵であるCreeperが、チェストと近くのベッドを破壊した。

ベッドを失ったことで、Astraが確立していたリスポーン地点は失われた。チェストを失ったことで、計画の次の段階に必要な資源も失われた。

この出来事はMinecraftのワールドを削除したわけでも、完了したすべての行動をリセットしたわけでもない。しかし、モデルが集中的に保有していたインベントリを破壊し、位置に関する戦略を混乱させた。

この区別は重要だ。Astraが直面したのは高コストの後退であり、新規ゲームへの文字通りの逆戻りではなかった。

有能な復旧計画には、残存資源の確認、必要不可欠な装備の再構築、防護された拠点の確立などが含まれたかもしれない。また、失った素材を意図的な順序で補充することを優先できた可能性もある。

しかしVals AIによると、モデルはその後の数時間、ジャガイモの栽培以外にはほとんど取り組まなかった。この活動自体はMinecraft内で有効だが、主目標を意味のある形で前進させるものではなかった。

AstraはCreeperにもより注意を払うようになった。ある時点では、緑色の物体をsugar caneだと識別し、Creeperではないと明確に述べたとされる。

この反応は、局所的なレベルでは適応に見える。モデルは、直近で経験した脅威に関する振る舞いを更新した。

しかし、局所的な警戒は効果的な全体的復旧にはつながらなかった。Astraは1つの危険を避けた一方で、より大きな目標に向けた勢いを失った。

この緊張関係こそが中心的な結果だ。モデルは多くの難しい行動を処理したが、環境がその計画を無効にした後で作戦を再編できなかった。

ジャガイモ栽培がAIの悲しみの証拠ではない理由

ジャガイモ栽培のエピソードが示したのは、検証済みの感情状態ではなく、行動の漂流だった。

Astraが「打ち負かされた」と表現されるのは理解できる。人は自然に、人間の動機を通じて行動を解釈するからだ。希少な装備を失い、農作業に引きこもるプレイヤーは、本当に落胆しているかもしれない。

AIモデルは、同じように見える一連の行動を生み出すために、内面的な感情体験を必要としない。自己批判的な言葉を生成したり、安全な行動を繰り返したり、学習済みのパターンを通じて直近の危険を避けたりできる。

利用可能な証拠は、Astraが悲しみを経験したことを示していない。失敗後の行動が、よく知られた人間の反応に似ていたことを示しているだけだ。

この違いは、観察と解釈を分ける。観察可能な事実は、その行動、ログ、ゲーム状態に関するものだ。動機についての主張は推測の域を出ない。

Astraのジャガイモ栽培には、複数の技術的問題が反映されている可能性がある。モデルは残された資源について、一貫した表現を失ったのかもしれない。また、この後退を改訂された目標の優先順位へ変換することにも苦労した可能性がある。

もう1つの可能性は、低リスクの進捗への行動バイアスだ。農作業は予測可能な結果と即時のフィードバックをもたらす。Blaze RodとEnder Pearlの回復には、探索、戦闘、さらなる損失への露出が求められる。

したがって、次にもっともらしい行動を最適化するモデルは、生産的に見える活動に閉じ込められる可能性がある。各行動は合理的に見えても、その連続はもはや元の目標に役立たない。

知識労働者も、この失敗の分かりやすい形に遭遇する。プロジェクトを止めている難しい判断を避けながら、メッセージに返信し、メモを整理し、文書を整形することはあり得る。

自律エージェントも、その人の感情を共有することなく、同じ外見上のパターンを示し得る。客観的な進捗が止まっている間も、忙しく動き続ける。

この実験は、モデルの自己対話を文字通り受け取る危険も浮き彫りにしている。報告によれば、Astraはアイテムを落としたことを自ら批判し、豚を追って時間を無駄にしないよう自らに警告した。

こうした発言は、その作業状態に関する手がかりを提供する。ただし、感情の内面や完全な因果説明へ透明にアクセスできることを意味しない。

モデルが生成する推論は、計画支援、叙述レイヤー、あるいは観測された出来事に対する学習済みの反応として機能し得る。自動的に忠実な内省として扱うべきではない。

OpenAIは、Astraがタスクの変化に伴って方向性を維持する能力を向上させたと説明している。Astra launch materials では、従来のモデルは新しい指示を別個の目標として扱い、既存の制約を見失う場合があったとしている。

Minecraftのエピソードは、この主張に別種の圧力をかける。誰かが指示を変更する必要はなかった。環境自体が、成功する計画に必要な条件を変えた。

AstraはCreeperが危険であることを記憶していた。より難しい問題は、爆発がもたらした戦略的な帰結を正しく理解していたかどうかだ。

証拠は部分的な理解を示唆している。注意は別のCreeperを避けることへ移ったが、より広い復旧は弱いままだった。

これは、モデルが落ち込んだと言うよりも有用な見方だ。状態追跡、再計画の頻度、報酬設計、復旧チェックポイントを通じて、エンジニアが検証できる行動を特定できる。

この記録は能力とレジリエンスの違いを露呈した

Astraの強力な行動は、復旧失敗の重要性を下げるのではなく、むしろ高めた。

より弱いシステムであれば、Minecraft内を移動したりインターフェースを操作したりできず、すぐに失敗するかもしれない。Astraはむしろ、141時間の実行を通じて相互に依存する一連のタスクを完了した。

その持続力が問いを変える。このテストはもはや、AIが孤立した行動を実行できるかを問うものではなかった。それらの行動が持続的な戦略を形成しているかを問うものだった。

OpenAIはGPT-6 Astraを、エンドツーエンドの作業において最も高性能なモデルとして売り出している。同社はコンピュータ操作、ブラウジング、ソフトウェアエンジニアリング、専門的な文書作成を強調している。

公開されたコンピュータ操作の結果には、OSWorld 2.0での72.6パーセントのスコアが含まれる。OpenAIは、比較設定においてGPT-5.6 Solが65.7パーセントを記録したと報告している。

OpenAIはまた、Astraがこれらのシミュレーションタスクを、Solよりタスクあたり約47パーセント短い時間で完了したとしている。これらはMinecraftの実行で得られた結果ではなく、企業が報告した評価結果だ。

Vals AIの実験は別の性質を検証している。標準的なコンピュータ操作ベンチマークでは通常、より明確な完了基準と短い時間軸を持つ、定義済みのタスクに作業を分割する。

Minecraftは継続的に変化する世界を作り出す。エージェントは何が重要かを判断し、資源を守り、現在の計画が機能しなくなった時点を検知しなければならない。

この環境は脆い成功を罰する。Blaze Rodを6本集めることは、エージェントが後の段階に入る前にそれらを保護するか、補充できる場合にのみ価値がある。

この区別は、能力とレジリエンスの違いに似ている。能力は、好条件の実行下でシステムが何を達成できるかに関わる。レジリエンスは、実行がうまくいかなかった際に復旧できるかに関わる。

Astraは相当な能力を示した。同時に、集中的な損失の後で脆弱なレジリエンスも露呈した。

したがって、この実行は単純なリーダーボードの見方を複雑にする。モデルはベンチマークで首位に立ちながら、同じ試行の中で深刻な運用上の弱点を示し得る。

これは矛盾ではない。最先端モデルは成功する頻度が高まりつつあり、まれな失敗パターンが主要な制約になりつつある。

1週間に及ぶソフトウェア移行を行うエージェントを想像してみてほしい。数十の工程にわたり、ファイルを変更し、テストを実行し、依存関係を正しく更新できる。

その後、デプロイによってプロセス初期に置かれた前提が無効になる。エージェントは失敗を特定し、影響を受けていない作業を保存し、新しい計画を構築しなければならない。

移行が壊れたままなのに文書の体裁を整えることで対応するなら、局所的な出力品質はほとんど慰めにならない。プロジェクトには依然として、方向性を回復する人間が必要だ。

同じ懸念はブラウザエージェントにも当てはまる。フォームの期限が切れることも、アカウントがログインを拒否することも、Webサイトがインターフェースを変更することもある。

効果的なシステムは、一時的な摩擦と戦略的な行き止まりを区別しなければならない。また、再試行、再計画、支援要請、停止のタイミングも把握する必要がある。

Astraのジャガイモループは、こうした判断がクリックの成功だけからは推測できない理由を示している。長期的な自律性は、個々の行動の質だけでなく、行動間の関係に依存する。

これは、この記録を軽視すべきでない理由でもある。より遠くまで到達したことで、より意味のある失敗が起こる条件が生まれた。

ネザーに一度も到達しなかった従来のシステムでは、希少な素材を保護できるのか、あるいはそれを失った後に回復できるのかを明らかにできなかった。Astraは、より高度な協調上の問題に直面するところまで進んだ。

OpenAIのコンピューター利用に関する主張はいま、回復力の試験に直面している

エージェント開発者には、タスク完了と並行して回復の質を測定する圧力がかかっている。

OpenAIによれば、Astraはフォームへの入力、顧客記録の更新、カレンダーの整理、調査、プロフェッショナル向けアプリケーションをまたぐ作業を実行できる。これらのシナリオはMinecraftと重要な共通点を持つ。

いずれも永続的な状態に依存している。以前の行動が、エージェントが次に何をすべきかを変える。

OpenAIはまた、Astraは曖昧な指示をより効果的に処理し、不足する情報が結果を変える場合には焦点を絞った質問を行うとしている。こうした振る舞いは、不確実性が人に由来する場合に価値がある。

Minecraftでの失敗には、環境に由来する不確実性があった。エージェントはダメージを解釈し、残された状況を計算し、元の計画がなお実行可能かを判断しなければならなかった。

これは、より要求の厳しい自律性の形態だ。システムは予期せぬ出来事が起こるたびに、人に目的を言い直してもらうだけでは済まない。

OpenAI自身の安全性資料も、長いエージェント軌跡に伴うリスクを認識している。Astra safety overviewでは、未承認の行為、データ損失、その他の破壊的な結果に対する安全策が論じられている。

安全性と回復力は同一ではない。しかしどちらも、各行動を独立して扱うのではなく、多数のステップにわたって結果を監視することを求める。

安全なエージェントは、ある行動が受け入れがたいリスクを生むときに気づかなければならない。レジリエントなエージェントは、ある出来事によって既存の戦略が有効でなくなったときに気づかなければならない。

どちらの能力も、タスクの状態について正確なモデルを維持することに依存する。また、適切なタイミングで惰性を断ち切ることにも依存する。

難しい設計上の問題は、そのバランスにある。小さな想定外の出来事ごとに再計画するエージェントは、遅く優柔不断になる。ほとんど再計画しないエージェントは、古くなった目的を何時間も追い続けかねない。

Astraの振る舞いは、生の推論能力が高くなっても、この制御問題が自動的に解決されるわけではないことを示唆している。報道によれば、モデルは重要なアイテムを失ったことを認識していたが、戦略的な進捗を素早く回復できなかった。

この出来事は、ベンチマーク設計者にも課題を突きつける。最終的な成功スコアは、長期間にわたる非生産的な行動、繰り返されるミス、不必要なリスクを隠してしまう可能性がある。

今後の評価では、失敗後にエージェントが意味のある進捗を再開するまでに必要な時間を測る、回復レイテンシを記録すべきだ。同じ危険への反復的な曝露も測定すべきである。

もう一つの有用な指標は、目標ドリフトだ。予期せぬ出来事によってタスク状態が変わった後、どれだけの活動が宣言された目的に貢献しているかを推定する。

人間の介入も重要なシグナルになる。頻繁なヒントの後でしか完了できないシステムは、自身の障害を認識できるシステムとは異なる。

こうした指標により、長時間のテストは企業の購買担当者にとってより有益なものになる。企業が知る必要があるのは、エージェントが最終的にワークフローを完了するかどうかだけではない。

認証情報の期限切れ、記録の競合、ファイルの消失、第三者サービスの障害が起きたときに、エージェントがどう振る舞うかを知る必要がある。

信頼できるシステムは、完了した作業と未解決の依存関係について、監査可能な記録を維持すべきだ。そのうえで、高コストまたは不可逆な行動を取る前に回復計画を提示すべきである。

自律型ワークフローを監督するチームにとって、検索可能なAI knowledge baseは、意思決定とソース資料を保存するのに役立つ。ただし、メモリの保存だけで適切な再計画が保証されるわけではない。

エージェントには、役に立つコンテキストと無関係な詳細を区別する能力がなお必要だ。どの以前の前提がもはや当てはまらないのかを認識しなければならない。

ここに、GPT-6 AstraのMinecraftテストがプロフェッショナルな仕事に関係する理由がある。出来事を記憶することと、そこから回復することは別の能力であると示している。

Minecraftの結果には、より独立した検証が必要だ

劇的な1回の実行だけで、知能、信頼性、感情的な振る舞いの一般的な尺度を確立することはできない。

公の物語は主に、Vals AIによるライブ配信の説明と、その後のメディア報道に依拠している。利用可能な報道は重要な到達点を説明しているが、方法論上の疑問は未解決のままだ。

読者は、141時間の実行を統制された科学的比較のように扱うべきではない。公表されている詳細では、Vals AIが以前に観察した各モデルで完全に同一の条件だったことは確立されない。

ハーネスは重要だ。ハーネスとは、モデルの出力を行動に変換し、環境からの観測を返すソフトウェア層である。

プロンプト、視覚入力、利用可能な操作、休止時の挙動、メモリ管理の小さな違いが、エージェントの性能を変え得る。こうした選択は、数日にわたる実行では特に大きな影響を持ちうる。

Minecraft内のランダム性も重要だ。敵との遭遇、地形、資源の配置、ナビゲーションの難易度は、実行ごとに異なり得る。

一体のCreeperの位置がAstraの軌跡を変えた。同じモデルによる別の実行では、その遭遇を回避するか、あるいはもっと早く進捗を失うかもしれない。

反復試行は、安定した能力と記憶に残る逸話を分ける助けになる。研究者には、同じゲームバージョン、ワールド生成ルール、ツール、プロンプト、介入方針が必要になる。

比較可能な予算も必要だ。より多くの時間または推論を許可されたモデルは、より厳しい制約下で動くモデルよりも多くの選択肢を探れる。

したがって、「gotten further than any AI system」という表現は、Vals AIがその実験で得た観察として読むべきだ。これは、すべてのMinecraftエージェントについての普遍的な結論ではない。

感情的な解釈には、さらに大きな注意が必要である。挫折の後に農作業をすることは、主観的な感情を伴わない多くの仕組みとも整合する。

混乱した計画、リスク回避、短期的な最適化、またはエージェントラッパーの制約を反映している可能性がある。公の証拠だけでは、どの説明が支配的だったかを判断できない。

また、バイラルな枠組みが前向きな成果を圧倒するリスクもある。報道によれば、Astraは、従来の多くのコンピューター操作システムが維持できた時間よりはるかに長く、難しいナビゲーションと資源収集を行った。

関連する実験では、Astraがコンピューター操作を通じてPortalを約24時間で完了したと報じられている。そのPortal runでは、実験の公表説明によると3,336回のツール呼び出しが行われた。

PortalとMinecraftは異なる性質を試す。Portalは、より構造化された空間パズルの連続を提供する。Minecraftは、オープンエンドの計画と資源の保全を求める。

どちらのゲームも、職場での評価を直接置き換えるものではない。ゲームは、研究者が限定された環境の中であらゆる行動を観察できるため、価値がある。

ビジネスソフトウェアには、隠れた依存関係、機密データ、変化する権限、曖昧な組織目標が持ち込まれる。こうした条件により、回復はより重大なものになる。

したがってMinecraftの結果は、判決ではなく診断的な証拠として扱うべきだ。ほかの環境で検証する価値のある失敗パターンを特定している。

そのパターンとは、高コストの想定外の出来事の後に起きる戦略的な崩壊である。重要な問いは、統制された条件下で評価された場合に、Astraがこれを繰り返すかどうかだ。

次の3つのシグナルが、Astraが信頼性高く回復できるかを示す

次の段階では、Astraの印象的な持久力が信頼できる自律性へと変わり得るかを検証すべきだ。

最初のシグナルは、統制されたMinecraftの再実行である。Vals AIまたは別の評価者は、文書化された設定、複数のワールド、一貫した介入ルールでタスクを繰り返すべきだ。

再実行では、最も遠い到達点だけでなく、資源の損失、回復時間、反復的な危険、主目的に資する行動の割合も記録すべきである。

Astraが同程度の挫折後に一貫して立て直すなら、ジャガイモの出来事は実行固有のばらつきと見なせるだろう。安全な副次活動へ繰り返し退くなら、その弱点は構造的なものに見える。

2つ目のシグナルは、ほかの最先端モデルとの比較テストだ。Astraの進捗が意味を持つのは、競合するシステムにも同じインターフェース、時間予算、プロンプト、環境条件が与えられた場合に限られる。

こうしたテストには、OpenAIの以前のモデルに加え、AnthropicとGoogleの現行システムを含めるべきだ。目的は、また別の単純な勝者ラベルではない。

評価者は、計画の持続性、危険への対応、回復レイテンシ、人間の介入を比較すべきである。よりゆっくり進むが確実に回復するモデルの方が、重要なワークフローには適しているかもしれない。

3つ目のシグナルは、実際のコンピューター利用デプロイメントからの証拠だ。OpenAIの最も強い主張は、Astraがゲームをプレイできることではない。ソフトウェア全体にわたり、要求の厳しいプロフェッショナル業務を実行できることだ。

開発者と企業の購買担当者は、デプロイされたエージェントがエラー後に有用な計画をどれほど頻繁に放棄するかを見守るべきだ。また、システムが不確実性を明確に報告し、妥当なタイミングで支援を求めるかも検証すべきである。

成功するデプロイメントには、完了率以上のものが必要だ。チームは、無駄な行動、繰り返されるミス、ロールバックの質、中断後に保存された作業を追跡すべきである。

こうした指標は、Astraのベンチマーク上の進歩が運用上の信頼性へとつながるという根拠を強める。モデルが短時間の評価で依然として印象的であっても、回復の失敗が持続するなら、その根拠は弱まる。

Minecraftの実行はOpenAIに、勝利と警告の両方を残した。Astraはテストで観察された従来システムより遠くまで進んだが、一度の爆発が何時間にもわたる戦略的行動を混乱させた。

この組み合わせこそ、この実験が重要である理由だ。最先端のエージェントは今や、意味のある計画を立て、資産を蓄積し、高コストの失敗を被るのに十分な長さで動作する。

次の基準は、AIが141時間行動できるかを問うことよりも厳しいものであるべきだ。研究者は、計画が破綻したことをどれほど早く認識するかを問うべきである。

そして、より良い計画を構築できるかを測定すべきだ。

GPT-6 AstraのMinecraftテストは、悲しい機械を明らかにしたのではない。難しい仕事を成し遂げられる一方で、その成功が失われたときに回復することに苦しんだエージェントを明らかにした。

これは極めて実務的な制約である。自律型エージェントを複数日にわたるプロジェクトへ割り当てる前に、購入者は一つの問いを投げかけるべきだ。そのシステムは、Creeperに相当するものが現れた後、何をするのか。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page