top of page

Ataraxos Stratego AI、最強の人間プレイヤーを破る 学習コストは8,000ドル未満

2 日前
読了時間: 19分

Ataraxos Stratego AIは、計算コスト8,000ドル未満で学習した後、このゲームで最も輝かしい実績を持つ人間プレイヤーを15勝1敗4分で破った。この結果は、複雑な戦略ゲームでトップレベルの人間に勝つには、産業規模の研究予算が必要だという前提に疑問を投げかける。

MIT、Carnegie Mellon University、New York University、Stanford Universityの研究者らがAtaraxosを開発した。査読済み論文は2026年9月30日にNatureに掲載された。このシステムは、効率的な自己対戦学習と、対局中の対象を絞ったプランニングを組み合わせている。

重要なのは、単なる人間プレイヤーに対する新たな勝利ではない。Google DeepMindのDeepNashはすでに2022年、エキスパート水準のStrategoプレイに到達していた。Ataraxosは、はるかに少ない学習サンプルと自己対戦ゲーム数で、トップチャンピオンを直接破ることで、その到達点をさらに超えた。

AtaraxosがStrategoで変えたこと

Ataraxosは、エキスパート水準のAIベンチマークを、このゲーム史上最強級の人間プレイヤーに対する記録された勝利へと変えた。

研究チームは、Pim Niemeijerとの20局シリーズでAtaraxosをテストした。Niemeijerは世界選手権で4度、オランダ国内選手権で15度、オンライン世界選手権で2度優勝している。

Niemeijerは世界ランキング首位として600週以上を過ごした。1997年以来すべてのStratego World Championshipに出場してきたGeorge Frankaは、彼を史上最高のStrategoプレイヤーと評している。

Ataraxosは15局に勝ち、1局に敗れ、4局を引き分けた。各引き分けを勝利の半分として数えると、システムの実効勝率は85%となる。

Strategoではランダム性のある振る舞いが有利になるため、この対戦形式には意味がある。より弱いプレイヤーでも、時には強い相手を破れるため、1局だけでは総合的な優位性を示す証拠として不十分だ。

20局あれば、Niemeijerにも弱点を探る時間が与えられる。研究者らは、Ataraxosが固定戦略を使い、対局間で適応しないことを彼に伝えた。

その情報は、人間の対戦相手が繰り返される癖を突くうえで有利に働くはずだった。それでもAIはシリーズ全体を通じて大きな優位を維持した。

研究者らは、独立した対局という仮定の下では、厳密な片側二項検定により2.6 × 10^-4未満の確率が得られると報告した。ただし、人間の戦略は対戦中に変化するため、この仮定は完全には成立しないとも注意を促している。

Ataraxosは、8月1日から8月3日に開催された2025 Stratego World Championshipでも別のテストを受けた。来場者はシステムとのデモ対局を40局行った。

Nature paperによると、Ataraxosはこれらの対局で38勝2敗を記録した。これは、経験やスタイルが異なるプレイヤーに対する実効勝率95%に相当する。

Strategoは、人工知能に独特の難題をもたらす。各プレイヤーは40個の駒を配置する一方、相手の駒の種類は、特定の相互作用によって明らかになるまで隠されたままだ。

目標は相手の旗を取ることだ。プレイヤーはブラフを使い、情報を集め、価値の高い駒を守り、行動と不作為の両方から相手が何を知っているかを推測しなければならない。

論文によれば、このゲームには10^33を超える駒配置の可能性がある。MITの説明では、ラベル付きの配置を数えた場合に10^66を超えるとしており、数え方の規約によってこの数値が変わることを示している。

どちらの数値も、単純な列挙には大きすぎる探索空間を表している。エージェントは、動く前にあらゆる隠れた配置と可能な将来の手順を計算することはできない。

この規模が、Strategoをチェスや囲碁と分けている。これらのゲームでは、将来の手の数が膨大であっても、両者は盤面全体を見ることができる。

ポーカーにも隠れた情報はあるが、その非公開状態ははるかに小さい。Strategoは、隠された駒の種類と、数百回の意思決定に及びうる長い手順を組み合わせている。

その結果、情報そのものが戦略的資源となるゲームが生まれる。プレイヤーは時に、相手の駒を明らかにしたり、自分の配置に関する不確実性を守ったりするために、戦力上の損失を受け入れる。

したがって、Ataraxosの勝利は新たなオンラインランキング以上の意味を持つ。繰り返される敵対的な対戦において、著名な人間プレイヤーに対する直接的な証拠を示したからだ。

同時に、この研究をめぐる中心的な疑問も生じる。比較的低コストの学術システムが、最も厳しい評価で、はるかに大規模な先行システムを上回れたのはなぜなのか。

Ataraxos Stratego AIが必要とした計算資源が少なかった理由

Ataraxos Stratego AIの成果は、1つのモデルを無限にスケールさせた結果ではなく、学習と実戦時のプランニングで問題をどう分担するかを変えたことから生まれた。

システムは自己対戦による強化学習から始まる。このプロセスでは、エージェントが自分自身の異なるバージョンと繰り返し対戦し、その結果を利用して改善する。

自己対戦により、Ataraxosは記録された人間の対局なしに学習データを作成できる。研究者らがブループリント戦略と呼ぶ、幅広い方策を段階的に学習する。

このブループリントは、初期配置と通常の意思決定に安定した基盤を提供する。対局中に生じ得るあらゆる不確実性を解決しようとするものではない。

チームは、自己対戦を安定化させるために動的減衰学習手法を設計した。複数エージェントのゲームでは、各参加者の振る舞いが、他者が直面する環境を変えるため、学習が不安定になり得る。

ある相手に対する改善が、別の場面で新たな弱点を露呈させることがある。学習は、一貫して強いプレイへ収束する代わりに、戦略間を循環する可能性がある。

動的減衰はこうした振動を抑える。学習プロセスが方策をどれほど積極的に更新するかを制御し、Ataraxosが有用な戦略を繰り返し捨てることなく進歩できるようにする。

研究者らは、システムによる行動の品質推定も改善した。Strategoの対局では、多くの重要な意思決定からかなり後になって最終結果が訪れるため、これは重要だ。

ゲーム序盤に動かした駒が、数十手後の相手の信念を形作る可能性がある。その手に貢献度を割り当てることは、直後の捕獲を評価するより難しい。

論文の主任著者であるGabriele Farinaによると、結果として得られた学習プロセスは、DeepNashが使用したサンプルの100分の1未満で済んだ。必要とした自己対戦ゲーム数も30分の1未満だった。

ハードウェアの比較も同様に際立っている。チームは、16基のNvidia H100アクセラレータを1週間使用してAtaraxosの強化学習モデルを学習させた。

隠された駒の種類を推定する信念モデルは、4基のH100で4日間学習させた。著者らは、2025年の価格でこのハードウェアをレンタルした場合、コストは8,000ドル未満になると見積もっている。

この数字が対象とするのは、報告された学習用計算資源であり、研究者の給与、ソフトウェア開発、実験、組織インフラは含まれない。研究全体の制作コストとして解釈すべきではない。

論文は、DeepNashが1,024個のTPU v3ノードで2〜3カ月間学習したと見積もる。2025年の商用価格を用いて、Ataraxosの著者らは同等の費用を300万〜450万ドルとしている。

これはDeepMindが開示した請求額ではなく、推定値である。ハードウェア契約、稼働率、過去の社内コストは、公開レンタル料金と異なる場合がある。

こうした留保を踏まえても、リソースの差は大きい。Ataraxosは、最大規模のAI研究所だけが利用できるインフラ展開ではなく、控えめな学術用コンピューティングクラスターを使用した。

効率性はシミュレーション環境からも得られた。強化学習では、信頼できる戦略と幸運な結果を区別するために、エージェントが十分な数の対局を経験する必要がある。

高速かつ正確なシミュレータなら、実際のゲーム進行や人間によるラベル付けを待たずに、こうした相互作用を処理できる。より優れたアルゴリズムは、各シミュレーション経験からさらに多くを学習として引き出す。

チームは公開されたStratego codebaseをリリースしており、他の研究者が研究の一部を検証・再現できるようにしている。再現性は、どの改善がアルゴリズム、シミュレータ、モデル設計、評価の選択によるものなのかを明らかにする助けとなる。

このコストの結果は、小規模な研究チームがあらゆる高度AIシステムを低コストで学習できることを示すものではない。Strategoには固定ルール、安価な合成データ、結果を確実に返せるシミュレータがある。

ただし、計算資源だけがより強い意思決定への道ではないことは示している。一般的な準備と対象を絞った推論をより良く分担すれば、単に学習回数を増やす以上の成果を得られる可能性がある。

ブループリント戦略と信念誘導型探索の融合

Ataraxosが成功したのは、あらかじめ幅広い戦略を学び、その後、現在の対局で重要となる隠れた状態に推論を絞り込むからだ。

対局中、システムはブループリント方策から始める。その後、行動直前に選択肢を評価するため追加の計算を行う、意思決定時プランニングを用いる。

意思決定時プランニングは、盤面が見えているゲームでいくつかの著名な成果を生み出してきた。チェスエンジンは、すべての駒の正確な位置を知っているため、候補手を調べられる。

Strategoでは、その確実性が失われる。エージェントは相手の駒がどこにあるかは見えるが、当初はその種類を知らない。

単純なプランナーは、膨大な数の盤面候補を考慮する必要がある。その大半は、すでに観察された手や公開情報と整合しない。

Ataraxosは代わりに、生成的信念モデルを使う。このモデルは、ゲームの履歴に基づき、もっともらしい隠れた駒配置に確率を割り当てる。

可能性の高い状態をサンプリングし、それらの状態で行動を評価し、ブループリントの推奨を洗練する。このプロセスは、システムの目の前にある局面と相手に計算資源を集中させる。

「ただ盲目的に推測するのではなく、意思決定時プランニングを用いて、最もあり得る盤面状態を見つけます」とFarinaはMIT researchersに語った。生成モデルにより、システムは直面している特定の盤面に集中できる。

重要なのは、Ataraxosが相手の正確な配置を突き止めることではない。どの説明に注目すべきかを推定しつつ、不確実性を維持する。

この違いは不完全情報ゲームで決定的に重要だ。不確かな解釈を確実なものとして行動すると、壊滅的な誤りを招く可能性がある。

合理的な戦略は、行動の期待値と、信念が誤っていた場合に生じるリスクの両方を考慮しなければならない。また、自分の手が相手の信念をどう変えるかも考慮する必要がある。

研究チームは、Ataraxosをリスクに対して異例なほど冷静だと説明している。人間プレイヤーは、価値の高い駒が危険にさらされているように見えると過剰反応し、防御的な反応を通じて追加情報を明かしてしまう場合がある。

Ataraxosは恐怖や羞恥を経験しない。確率で重み付けした結果が有利である限り、危険に見える局面を受け入れられる。

Niemeijerは、このシステムについて、人間なら傲慢だと考える賭けに出ると述べた。また、有用な位置に適切な駒が繰り返しあるように見えたため、「不自然なほど幸運」に映ったとも語っている。

見かけ上の幸運は、較正された不確実性から生まれ得る。有利なリスクをより頻繁に取るエージェントは、ときに無謀に見えるかもしれないが、その結果は多くの対局を通じて積み上がる。

この振る舞いは、記事の中心的な逆転を示している。低コストのシステムは、より大きな探索予算であらゆる可能性を調べることで勝ったのではない。

大半の可能性を回避することで勝利した。ブループリントが全般的なプレイを担い、信念モデルが実際の計画立案を始める前に隠れた状態を絞り込んだ。

このアーキテクチャは標準的なStratego以外にも転用された。研究者らは関連手法をBarrage Stratego、Hanabi、dou dizhuにも適用した。

Barrage Strategoは、元のゲームをより小規模かつ高速にしたバリエーションだ。このシステムは複数回の世界チャンピオン経験者3人を破り、著者らはこれを同バリエーションで初めての超人的な成果だと説明している。

Hanabiは、プレイヤーが他者の手札は見える一方で自分の手札は見えない協力型カードゲームである。成功には、エージェントが限られた手掛かりを解釈し、私的情報を直接明かさずに連携することが求められる。

Ataraxosのアプローチは、論文で報告されたHanabi評価において新たな最高性能を達成した。この結果は、直接的な競争ではなく協力的な推論を検証するものだ。

Dou dizhuは、2人が協力して3人目と戦う3人用カードゲームである。研究者らのエージェントは、ベンチマークとして用いられたPerfectDouとDouZeroのプログラムを上回った。

これらの結果は、単一の汎用モデルが無関係な4つのゲームを習得したことを示すものではない。研究者らは基盤技術を適応させ、ゲームごとに特化したシステムを訓練した。

それでも、この広がりは重要だ。効率的な自己対戦と、標的を絞った隠れ状態の推論を組み合わせる手法が、Stratego専用の小技ではなく再利用可能な設計パターンであることを示唆している。

DeepNashとの比較がベンチマークを変える

DeepNashはAIがStrategoで専門家レベルに到達できることを示した。一方、Ataraxosは、このゲームで最も輝かしい実績を持つ人間プレイヤーに繰り返し勝利するという水準まで基準を引き上げた。

Google DeepMindは2022年、モデルフリーのマルチエージェント強化学習で訓練したエージェントとしてDeepNashを発表した。モデルフリーとは、プレイ中に相手の隠された駒を明示的に再構成しなかったことを意味する。

DeepNashは、相手に容易に搾取されない戦略へ学習を導くために設計されたアルゴリズム、Regularised Nash Dynamicsを用いた。人間の対局データベースを消費することなく、自己対戦から学習した。

主要なオンラインStrategoプラットフォームであるGravonで、DeepNashは評価対象の50局中42局に勝利し、歴代トップ3のランキングに到達した。DeepMindはまた、有力Strategoボットに対して97%超の勝率を報告している。

DeepNash researchは大きな成果だった。Strategoは、チェスや囲碁で機械が人間を超える助けとなった木探索手法に抵抗してきた。

DeepNashは、隠れた情報のためにそのアプローチを拡張することが難しかったことから、明示的なゲーム木探索を意図的に避けた。その成功は、戦略的に均衡した方策を直接学習するアプローチを支持するものだった。

Ataraxosは異なる道をたどる。強力な自己対戦の基盤は維持しつつ、評価すべき隠れ状態を制限する信念モデルを通じて計画立案を再導入している。

この違いが、主たる技術的対決を生む。すなわち、大部分が固定された搾取されにくい方策と、状況に応じた探索で洗練されるブループリントの対比だ。

Ataraxosの著者らは、DeepNashの人間相手の性能がどう解釈されたかについても異議を唱えている。Gravonのプレイヤー人口は2022年までに減少し、その年の最終ランキングに登場したのは25人だけだったと指摘する。

オンラインの対戦相手は、自分たちが公式AI評価に参加していることを知らなかった。また、DeepNashが反復対局を通じて分析可能な固定戦略を使っていたことも知らなかった。

2023年のStratego世界選手権では、DeepNashはデモンストレーション中に19局勝利し、9局敗れた。Ataraxosの論文によれば、Niemeijerを含む対戦した上位ランクのプレイヤーの大半に敗れたという。

研究者らは両システムの直接対戦を試みた。DeepMindからDeepNashのコードはもはや動作しないと伝えられたため、この比較は実現しなかったと報告している。

直接対戦がない以上、相対的な棋力についての主張は、異なる人間の対戦相手、大会条件、時期に依存する。Ataraxosのほうがエリート人間相手の結果は強いが、両システムは同一条件下で検証されていない。

DeepMindの当初の説明では、DeepNashは長期対戦で最高のチャンピオンを打ち破ったのではなく、人間の専門家レベルに到達したとされていた。Stratego overviewでは、Gravonの歴代トップ3ランキングと、専門家プラットフォーム利用者に対する84%の勝率が強調されていた。

したがってAtaraxosは、DeepNashの貢献を無効にするものではない。先行研究が設定した目標を変えるものだ。

専門家レベルへの到達は、もはや終着点ではない。研究者は今や、システムが最上位プレイヤーを打ち負かせるか、意図的な搾取に耐えられるか、そしてその成果を効率的に実現できるかを問える。

コスト比較はこの変化を強める。DeepNashは、規模と理論的に搾取されにくい方策を追求した。

Ataraxosは、サンプル効率と選択的な計画立案が、より実用的な向上をもたらし得ると主張する。他チームが同様に厳しい評価の下で再現できるなら、この主張はゲーム以外でも重要になる。

その圧力は、交渉、サイバーセキュリティ、資源配分、複数当事者間の協調のためのエージェントを構築する研究者に及ぶ。これらの分野も、不完全情報と長い意思決定系列を組み合わせている。

しかし、Strategoで利用できる明確なルールや完全なシミュレーターは存在しない。次のベンチマークでは、観測がノイズを含み、他の参加者が訓練分布の外で振る舞う場合にも、この仕組みが維持されるかを検証しなければならない。

この結果がなお証明していないこと

Strategoで勝利したからといって、Ataraxosが軍事、ビジネス、セキュリティに関する意思決定で人々に安全に助言できることが証明されるわけではない。

MITの報道は、軍事作戦、ビジネス交渉、金融市場、サイバーセキュリティを長期的な応用候補として挙げている。いずれも、私的情報を持つ当事者が行動する領域だ。

構造的な類似性は実在する。防御側が攻撃者の完全な計画を知ることはめったになく、交渉者が相手側の最低受諾条件を知ることもめったにない。

しかし、これらの環境はボードゲームとは大きく異なる。Strategoには固定された行動、安定したルール、合意された目標、そしてシミュレーターが採点できる結果がある。

現実の交渉には、曖昧な言葉、変化する目標、不完全な記録、そして途中で離脱できる参加者が存在する。サイバーセキュリティ事故には、ソフトウェア障害や、訓練には存在しなかった行動を新たに生み出す敵対者が関わる。

可能性のリストが不完全である場合、信念モデルは危険になり得る。複数の説明にわたって精密な確率を割り当てても、正しい説明そのものを完全に見落とすかもしれない。

この問題はしばしばモデル仕様誤りと呼ばれる。システムはシミュレートされた世界の中で一貫して推論しながら、現実では誤った行動を推奨する可能性がある。

Strategoは自己対戦を通じて迅速なフィードバックも提供する。エージェントは誰かを害したり私的情報を公開したりせずに、数百万の合法的な状況を生成できる。

現実世界のデータは、希少で、偏っており、あるいは倫理的に収集が難しいことがある。モデルは代替方策を探るためだけに軍事危機を安全に再現することはできない。

解釈可能性ももう一つの制約だ。Ataraxosは手を選択できるが、人間の意思決定者が信頼して監査できる完全な説明はまだ提供していない。

Farinaはそのギャップを明確に指摘した。人間は推奨に対する最終的な権限を保持しなければならず、導入にはモデルの意思決定を検査する方法が必要だと述べた。

説明は、事後的に手を記述するだけでは不十分だ。前提、隠れ状態の確率、代替行動、推奨を覆す条件を明らかにすべきである。

これは、システムの最も強い振る舞いが専門家には無謀に見える可能性があるため重要だ。Ataraxosが貴重な資産をさらすことを推奨するなら、人間はその選択が安定した推論に基づくのか、脆弱な確率推定に基づくのかを知る必要がある。

人間による評価も比較的小規模にとどまる。Niemeijerとのシリーズは20局で、世界選手権のデモンストレーションでは、より幅広いグループを相手に40局が追加された。

これらの結果は、高いStratego性能を強く裏付ける。しかし、あらゆるオープニング、敵対的な搾取、ソフトウェア条件、分布シフトにわたる挙動を測定したものではない。

Niemeijerとの対戦中、システムは固定戦略を用いた。その選択は搾取を可能にしたが、適応が安全性と性能をどう変えるかという疑問も残す。

適応型エージェントは弱点を修正できる。一方で予測可能性が低下し、評価や人間による監督をより困難にする可能性もある。

一般性に関する主張にも同様の慎重さが必要だ。チームは4つの不完全情報ゲームで強い結果を達成したが、各システムは明確に定義されたゲーム環境の中で動作していた。

転移はアルゴリズムのレベルで起きたのであり、1つのエージェントが未知の環境に独力で入っていったわけではない。AtaraxosはStrategoを学んだ後、新たな実装や訓練なしにHanabiを始めたわけではない。

その計算コストにも慎重な位置付けが必要だ。8,000ドル未満という数字は、2025年のハードウェアレンタル価格を用いて算定された訓練1回分の報告値である。

そこには、失敗した実験、研究者の時間、シミュレーターの開発、最終手法を発見するために必要な組織的支援は含まれない。完成済みの1回の実行を再現することは、プロジェクト全体を再現することと同じではない。

これらの制約はいずれもStrategoの結果を弱めるものではない。実際に確立されたことを定義し、提案された将来の応用と切り分けるものだ。

Ataraxosは、隠れた情報に基づく計画立案が強力であると同時に計算効率にも優れ得る証拠を提供する。この成果を重大な意思決定へ翻訳するには、新しい形の検証、説明、人間による制御が必要になる。

Ataraxosの仮説を検証する3つのシグナル

次の検証は、独立した研究者がその効率性を再現し、手法をゲームの外へ拡張し、意思決定を監査可能にできるかどうかだ。

第1のシグナルは、Strategoの訓練結果を独立に再現できるかである。研究者は公開されたコード、同等のハードウェア、文書化された設定を用いて、報告された棋力に近づけるはずだ。

提示された計算予算内で再現に成功すれば、効率性の主張は強まる。大きな隔たりがあれば、文書化されていないインフラ、チューニング、実験上の知見が、最終コストの見積もり以上に寄与したことを示唆する。

再現には人間と機械の双方による評価を含めるべきだ。同じベンチマークボットとのみ対戦しても、エリートプレイヤーが反復的な敵対対局を通じて見つける弱点を見逃す可能性がある。

第2のシグナルは、より制御の緩い環境における信頼できる評価だ。サイバー防御シミュレーション、交渉ベンチマーク、交通システムは、人々を直ちに危険にさらすことなく中間的な検証を提供できる。

重要な問いは、エージェントが別のゲームに勝てるかどうかではない。ルールが不完全で、観測に誤りが含まれ、参加者が予想された行動から逸脱する場合にも、信念に導かれた計画立案が信頼できるかどうかだ。

研究者は成功率と同じくらい慎重に失敗事例を公開すべきである。平均では良好に機能しても、未知の条件下で過信するシステムには、実用化前により強い安全策が必要となる。

第3のシグナルは、Ataraxosの信念モデルに直接結び付いた解釈可能性の層だ。チームはすでにこれを将来の課題として特定している。

有用なインターフェースは、システムがどの隠れた構成を有力と見なしているか、各行動の後にその信念がどう変化するか、どの前提が最終的な推奨を左右するかを示すだろう。

また、感度も明らかにすべきだ。1つの確率がわずかに変わるだけで異なる行動になるなら、人間のレビュー担当者はその不安定さを確認する必要がある。

この3つのシグナルが、Ataraxosが卓越したゲームプレイシステムにとどまるのか、それとも不確実性下の意思決定に向けたより広範なテンプレートになるのかを決める。

当面の結果はすでに重要だ。4大学からなる研究チームは、DeepNashの従来の見積もりを大幅に下回る訓練予算で、エリート人間プレイヤーのStratego性能を上回った。

より深い教訓は、リソース配分にある。このシステムは、再利用可能な設計図に幅広い学習リソースを投入し、その後は一つの意思決定に関係する不確実性へ実行時の計算を集中させる。

開発者は、このパターンがほかのエージェントシステムにも現れるかを注視すべきだ。企業の購買担当者は、目を引くベンチマーク結果に敵対的テスト、コスト算定、検証可能な前提条件が含まれているかを確認する必要がある。

同様の研究を評価するナレッジワーカーは、論文、実験、変化する主張を検索可能なナレッジベースに保存できる。重要なのは、新たな実証結果をその都度、元の証拠と比較することだ。

Ataraxos Stratego AIは、一つの問いに答えを出した。数百万ドル規模の学習実行を行わなくても、機械はこの不完全情報ゲームで最強の人間を決定的に打ち負かせる。次の問いはさらに難しい。ルールがもはや盤上に書かれていないときにも、同じ効率性は維持できるのだろうか。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)とM-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page