Ataraxos Stratego AI 击败顶尖人类棋手,训练成本不足 8,000 美元
研究人员以不足 8,000 美元的计算成本训练出 Ataraxos Stratego AI,它以 15 胜 1 负 4 和击败了这款游戏战绩最辉煌的人类棋手。这一结果挑战了一个长期假设:在复杂策略游戏中战胜顶尖人类,需要工业级研究预算。
来自 MIT、Carnegie Mellon University、New York University 和 Stanford University 的研究人员开发了 Ataraxos。其同行评审论文于 2026 年 9 月 30 日发表于 Nature。该系统将高效的自我对弈训练与每局比赛中的针对性规划相结合。
关键比较并非又一次战胜人类。Google DeepMind 的 DeepNash 已在 2022 年达到专家级 Stratego 水平。Ataraxos 则更进一步:它直接击败了一位顶尖冠军,同时所用训练样本和自我对弈局数远少于前者。
Ataraxos 如何改变 Stratego
Ataraxos 将一项专家级 AI 基准,转化为一场有记录可查的胜利——对手是这项游戏历史上最强的人类棋手之一。
研究团队在一场 20 局系列赛中测试了 Ataraxos,对手是 Pim Niemeijer。他曾四次夺得世界冠军、15 次获得荷兰全国冠军,并两次赢得线上世界冠军。
Niemeijer 还曾累计超过 600 周位居世界排名第一。自 1997 年起参加过每届 Stratego World Championship 的 George Franka 称他为史上最强的 Stratego 棋手。
Ataraxos 赢下 15 局、输掉 1 局、和棋 4 局。若将每场和棋按半胜计算,该系统的有效胜率为 85%。
赛制本身很重要,因为 Stratego 会奖励随机化行为。即使较弱的棋手偶尔也能击败更强的对手,因此单局比赛不足以证明整体实力更强。
20 局比赛也给了 Niemeijer 寻找弱点的时间。研究人员告诉他,Ataraxos 将使用固定策略,且不会在局与局之间调整。
这些信息本应帮助人类对手利用其重复习惯。然而,这个 AI 在整场系列赛中始终保持明显优势。
研究人员报告称,在独立对局假设下,精确的单侧二项检验会得出低于 2.6 × 10^-4 的概率。他们也提醒,这一假设并不完全成立,因为人类策略会在比赛过程中发生变化。
Ataraxos 还在 2025 Stratego World Championship 接受了另一项测试,该赛事于 8 月 1 日至 8 月 3 日举行。与会者与该系统进行了 40 场表演赛。
根据这篇 Nature 论文,Ataraxos 在这些比赛中取得 38 胜 2 负。面对经验和风格各异的棋手,这相当于 95% 的有效胜率。
Stratego 对人工智能构成了独特挑战。每位玩家布置 40 枚棋子,而对手棋子的身份会一直隐藏,直到特定互动将其揭示。
目标是夺取对方军旗。玩家必须虚张声势、收集信息、保护有价值的棋子,并从行动与不行动中推断对手掌握的信息。
论文称,该游戏拥有超过 10^33 种可能的棋子配置。MIT 的说明按带标签的排列方式计数,得出的数字超过 10^66,表明总数会随计数规则而变化。
无论采用哪个数字,其搜索空间都大到无法直接穷举。智能体不可能在走子前计算每一种隐藏布局和每一种可能的未来序列。
这一规模将 Stratego 与国际象棋和围棋区分开来。在后两者中,双方都能看到完整棋盘,尽管可能的后续着法数量依然极其庞大。
扑克也包含隐藏信息,但其私有状态要小得多。Stratego 将隐藏身份与可跨越数百次决策的长序列结合在一起。
结果是,信息本身成为一种战略资源。玩家有时会接受物质损失,以揭示对方棋子,或保护自己位置的不确定性。
因此,Ataraxos 的胜利比一项新的线上排名更有分量。它在一场重复、对抗性的比赛中,提供了战胜知名人类棋手的直接证据。
它也引出了围绕这项工作的核心问题:为什么一个相对低成本的学术系统,能在最严苛的评估中胜过规模大得多的前代系统?
为什么 Ataraxos Stratego AI 所需算力更少
Ataraxos Stratego AI 的成果来自于改变训练与实时规划如何分工,而不是无限扩展单一模型。
该系统首先进行自我对弈强化学习。在这个过程中,智能体不断与自己的不同版本对弈,并根据结果持续改进。
自我对弈使 Ataraxos 无需依赖已记录的人类对局即可生成训练数据。它逐渐学会了一项广泛策略,研究人员称之为蓝图策略。
这一蓝图为开局布阵和常规决策提供了稳定基础。它并不试图解决比赛中可能出现的每一种不确定性。
团队设计了一种动态阻尼学习方法,以稳定自我对弈。在多智能体游戏中,学习可能变得不稳定,因为每个参与者的行为都会改变其他参与者所面对的环境。
针对一个对手的改进,可能会在其他情况下暴露新的弱点。训练可能在不同策略之间循环,而非收敛到始终强劲的棋力。
动态阻尼限制了这些振荡。它控制学习过程更新策略的激进程度,使 Ataraxos 能够持续进步,而不至于反复放弃有用策略。
研究人员还改进了系统对行动质量的估计方式。这很重要,因为一局 Stratego 的最终结果,往往在许多关键决策之后很久才会揭晓。
一枚棋子在开局阶段的移动,可能会在数十回合后影响对手的判断。将结果归因于那一步,远比评估一次即时吃子更困难。
论文的资深作者 Gabriele Farina 表示,最终的训练流程所用样本不足 DeepNash 的百分之一,自我对弈局数也不足其三十分之一。
硬件对比同样引人注目。团队使用 16 张 Nvidia H100 加速器训练 Ataraxos 的强化学习模型,持续一周。
他们使用四张 H100 训练信念模型——即估计隐藏棋子身份的模型——历时四天。作者估计,按 2025 年的租赁价格,租用这些硬件的成本不足 8,000 美元。
这一数字涵盖的是论文报告中的训练算力,并不包括研究人员薪资、软件开发、实验或机构基础设施。它不应被解读为完成这项研究的总成本。
论文估计,DeepNash 在 1,024 个 TPU v3 节点上训练了两到三个月。以 2025 年商业价格计算,Ataraxos 的作者估计其对应开支在 300 万至 450 万美元之间。
这是一项估算,而非 DeepMind 披露的实际账单。硬件合同、利用率以及历史内部成本都可能不同于公开租赁价格。
即便考虑到这一限定,资源差距仍然十分显著。Ataraxos 使用的是适度规模的学术计算集群,而非只有最大型 AI 实验室才能部署的基础设施。
效率还来自模拟环境。强化学习要求智能体经历足够多的对局,才能区分可靠策略与侥幸结果。
快速而准确的模拟器可以处理这些交互,而无需等待实体对弈或人工标注。更好的算法则能从每一次模拟经验中提取更多学习成果。
团队已发布公开的 Stratego 代码库,使其他研究人员能够检查并复现这项工作的部分内容。可复现性将有助于厘清哪些提升来自算法、模拟器、模型设计或评估选择。
这一成本结果并不意味着小型研究团队能以低成本训练所有先进 AI 系统。Stratego 具有固定规则、低成本的合成数据,以及能够可靠返回结果的模拟器。
但它表明,算力并非通往更强决策能力的唯一路径。在通用准备与针对性推理之间进行更好的分工,可能比单纯倍增训练次数带来更大的提升。
蓝图策略与信念引导搜索相结合
Ataraxos 的成功在于,它预先学习广泛策略,再将推理范围收窄到当前对局中重要的隐藏状态。
在比赛过程中,系统先从其蓝图策略出发。随后它采用决策时规划,即在行动前立即投入额外计算来评估选择。
决策时规划曾推动多个棋盘信息完全可见游戏中的著名成果。国际象棋引擎可以检查候选着法,因为它知道每枚棋子的确切位置。
Stratego 则消除了这种确定性。智能体可以看到对方棋子所在的位置,但起初并不知道它们的身份。
一个朴素的规划器需要考虑数量庞大的可能棋盘状态。其中大多数都会与已经观察到的走法和已揭示信息不一致。
Ataraxos 则使用生成式信念模型。该模型会根据对局历史,为可信的隐藏棋子配置分配概率。
它对可能状态进行采样,在这些状态下评估行动,并修正蓝图策略的建议。这一过程将计算资源集中于系统当前面对的局面和对手。
Farina 向 MIT 研究人员表示:“我们并非只是盲目猜测,而是利用决策时规划找出最可能的棋盘状态。”生成式模型使系统能够聚焦于它正面对的具体棋局。
重要之处不在于 Ataraxos 能发现对手的确切布阵。它在保留不确定性的同时,估计哪些解释值得关注。
这种区别在不完全信息游戏中至关重要。将一种不确定的解释当作确定事实来行动,可能导致灾难性错误。
理性策略既必须考虑行动的期望价值,也必须衡量信念出错时产生的风险。它还必须考虑自己的走法将如何改变对手的判断。
研究团队将 Ataraxos 描述为在风险面前异常沉着。人类棋手在有价值的棋子看似暴露时可能反应过度,并通过防御性回应泄露更多信息。
Ataraxos 不会感到恐惧或尴尬。当概率加权后的结果仍然有利时,它可以接受一个看似危险的局面。
Niemeijer 形容该系统会采取人类认为过于自负的冒险。他还表示,它看起来“幸运得不可思议”,因为它似乎总能在有利位置拥有合适的棋子。
表面上的好运可能源于经过校准的不确定性。更频繁地接受有利风险的智能体,有时会显得鲁莽,但其优势会在多场对局中累积。
这种行为构成了本文的核心反转。这个低成本系统并非通过以更大的搜索预算检查每一种可能性而获胜。
它通过避免大多数可能性而获胜。蓝图负责处理一般对局,而信念模型则在实时规划开始前筛选隐藏状态。
这种架构也被迁移到了标准 Stratego 之外。研究人员将相关技术应用于 Barrage Stratego、Hanabi 和斗地主。
Barrage Stratego 是原版游戏更小、更快的变体。该系统击败了三位多次获得世界冠军的选手,作者称这是该变体首次达到超人类水平的结果。
Hanabi 是一款合作型卡牌游戏,玩家能看到其他人的手牌,却看不到自己的手牌。要取得成功,智能体必须解读有限线索,并在不直接透露私人信息的情况下进行协作。
Ataraxos 方法在论文报告的 Hanabi 评测中创下了新的最佳成绩。这一结果检验的是协作推理,而非直接竞争。
斗地主是一款三人卡牌游戏,其中两名玩家合作对抗第三名玩家。研究人员的智能体表现优于作为基准的 PerfectDou 和 DouZero 程序。
这些结果并不能证明某个通用模型掌握了四种彼此无关的游戏。研究人员调整了底层技术,并训练了针对各游戏的专用系统。
不过,这一覆盖范围依然重要。它表明,将高效自我对弈与针对性的隐藏状态推理相结合,是一种可复用的设计模式,而非只适用于 Stratego 的技巧。
与 DeepNash 的比较改变了衡量标准
DeepNash 证明了 AI 能达到 Stratego 专家水平,而 Ataraxos 则将标准提升为:持续战胜这款游戏战绩最辉煌的人类选手。
Google DeepMind 于 2022 年推出 DeepNash,这是一种通过无模型多智能体强化学习训练的智能体。无模型意味着它在对局过程中不会显式重建对手的隐藏棋子。
DeepNash 使用了 Regularised Nash Dynamics,这是一种旨在引导学习向对手难以利用的策略收敛的算法。它通过自我对弈学习,无需消耗人类棋谱数据库。
在主要在线 Stratego 平台 Gravon 上,DeepNash 在 50 场评测对局中赢得了 42 场,并达到历史前三的排名。DeepMind 还报告称,它对领先 Stratego 机器人的胜率超过 97%。
这项 DeepNash 研究是一项重大成就。Stratego 一直抵抗着那些帮助机器在国际象棋和围棋中超越人类的树搜索方法。
DeepNash 有意避免显式博弈树搜索,因为隐藏信息使这种方法难以扩展。它的成功支持了这样一种观点:可以直接学习策略上均衡的策略。
Ataraxos 走的是不同路径。它保留了强大的自我对弈基础,但通过信念模型重新引入规划,从而限制需要评估的隐藏状态。
这一差异构成了核心技术竞争:一种大致固定、难以被利用的策略,与一套通过情境搜索不断细化的蓝图之间的对比。
Ataraxos 的作者还质疑了对 DeepNash 人类对局表现的解读方式。他们指出,到 2022 年,Gravon 的玩家群体已经缩减,当年最终排名中仅有 25 名玩家。
在线对手并不知道自己正在参与官方 AI 评测。他们也不知道 DeepNash 使用的是一种固定策略,可以在多次重复对局中被研究。
在 2023 年 Stratego 世界锦标赛的一场展示中,DeepNash 赢了 19 局、输了 9 局。Ataraxos 论文称,它输给了所面对的大多数最高排名选手,其中包括 Niemeijer。
研究人员曾寻求让两个系统直接对战。他们表示,DeepMind 称 DeepNash 代码已无法运行,因此这场比较未能进行。
在缺乏正面对决的情况下,关于相对棋力的主张取决于不同的人类对手、赛事环境和时间段。Ataraxos 在顶尖人类对局中取得了更强的结果,但两个系统并未在相同条件下测试。
DeepMind 最初的表述是,DeepNash 达到了人类专家水平,而不是在长盘对局中击败最顶尖的冠军。其 Stratego 概览强调了其在 Gravon 历史排名前三,以及面对平台专家用户 84% 的胜率。
因此,Ataraxos 并没有抹去 DeepNash 的贡献。它改变了这项早期工作所设定的目标。
达到专家水平不再是终点。研究人员现在可以追问:系统是否能击败最优秀的选手、能否经受蓄意利用,以及是否能高效实现这些结果。
成本比较强化了这种转变。DeepNash 追求规模化以及理论上难以被利用的策略。
Ataraxos 则认为,样本效率和选择性规划可以带来更实际的收益。如果其他团队能在同样严格的评测下复现这一结果,这一论点的重要性将超越游戏领域。
压力将落在为谈判、网络安全、资源分配和多方协作开发智能体的研究人员身上。这些领域同样将不完全信息与长决策序列结合在一起。
然而,它们没有 Stratego 所具备的清晰规则和完美模拟器。下一个基准必须检验:当观测存在噪声、其他参与者的行为偏离训练分布时,这一机制是否仍然有效。
这一结果仍未证明什么
赢得 Stratego 并不能证明 Ataraxos 能够安全地为军事、商业或安全决策提供建议。
MIT 的报道将军事机动、商业谈判、金融市场和网络安全列为可能的长期应用。每个领域都涉及掌握私有信息的参与方。
这种结构上的相似性确实存在。防御方很少知道攻击者的完整计划,谈判者也很少知道对方可接受条件的最低限度。
但这些环境与棋盘游戏截然不同。Stratego 的行动固定、规则稳定、目标明确,且模拟器能够对结果评分。
真实谈判包含含糊语言、不断变化的目标、不完整记录,以及可能退出互动的参与者。网络安全事件涉及软件故障和会创造训练中未出现行动的对手。
当信念模型列出的可能性不完整时,它就会变得危险。它可能在若干种解释之间给出精确概率,却完全漏掉正确解释。
这个问题通常被称为模型设定错误。系统可以在其模拟世界中进行一致推理,却仍在现实中给出错误建议。
Stratego 还通过自我对弈提供快速反馈。智能体可以生成数百万种合法局面,而不会伤害任何人或暴露私人信息。
现实世界数据可能稀缺、带有偏差,或在伦理上难以收集。模型不能为了探索替代策略而安全地重演军事危机。
可解释性是另一项限制。Ataraxos 可以选择一步棋,但尚不能提供人类决策者可可靠审计的完整解释。
Farina 明确指出了这一缺口。他表示,人类必须保留对建议的最终决策权,而实际采用需要一种检查模型决策的方法。
解释不能只是在事后描述这一步行动。它应揭示假设、隐藏状态概率、替代行动,以及会导致建议反转的条件。
这很重要,因为系统最强的行为在专家看来可能显得鲁莽。如果 Ataraxos 建议暴露一项有价值的资产,人类需要知道该选择是基于稳定推断,还是脆弱的概率估计。
人类评测的规模也仍然相对较小。与 Niemeijer 的系列赛包括 20 局,而世界锦标赛展示赛则增加了面对更广泛选手群体的 40 局。
这些结果有力支持了其高水平 Stratego 表现。但它们并未衡量系统在所有开局、对抗性利用、软件条件或分布变化下的行为。
该系统在与 Niemeijer 的比赛中使用了固定策略。这一选择使策略被利用成为可能,但也留下了一个问题:适应能力将如何改变安全性和表现。
自适应智能体可以修复弱点,也可能变得更不可预测,从而使评估和人类监督更加困难。
关于通用性的主张同样需要谨慎。团队在四种隐藏信息游戏中取得了强劲结果,但每个系统都在定义明确的游戏环境中运行。
这种迁移发生在算法层面,而不是由同一个智能体独立进入陌生环境实现的。Ataraxos 并非先学会 Stratego,然后无需新的实现和训练就开始玩 Hanabi。
其计算成本也需要谨慎解读。低于 8,000 美元代表的是按 2025 年硬件租赁价格计算的一次训练运行成本。
它不包括失败实验、研究人员时间、模拟器开发,以及发现最终方法所需的机构支持。复现一次完成的运行,并不等同于重建整个项目。
这些限制都没有削弱 Stratego 的成果。它们界定了实际已被证明的内容,并将其与拟议的未来应用区分开来。
Ataraxos 提供的证据表明,隐藏信息规划既可以强大,也可以具备计算效率。要将这一成果转化为影响重大的决策,还需要新的测试、解释和人类控制形式。
检验 Ataraxos 论点的三个信号
下一项考验在于,独立研究人员能否复现其效率、将方法扩展至游戏之外,并让其决策可审计。
第一个信号是独立复现 Stratego 训练结果。研究人员应能使用已发布代码、可比硬件和文档化设置,接近所报告的棋力。
在所述计算预算内成功复现,将强化效率主张。若差距很大,则表明未公开的基础设施、调参或实验知识所作出的贡献,可能超过最终成本估算所显示的程度。
复现应包括人类和机器评测。只与相同的基准机器人对局,可能会遗漏顶尖选手在反复对抗性比赛中识别出的弱点。
第二个信号是在控制程度较低的环境中进行可信评测。网络防御模拟、谈判基准或交通系统可以提供中间测试,而不必立即让人们面临风险。
关键问题不是智能体能否赢下另一款游戏,而是当规则不完整、观测包含错误、参与者偏离预期行为时,信念引导的规划是否仍然可靠。
研究人员应像发布成功率一样认真公布失败案例。一个平均表现良好、却会在陌生条件下变得过度自信的系统,在投入实际使用前需要更强的保障措施。
第三个信号是与 Ataraxos 信念模型直接关联的可解释性层。团队已经将其确定为未来工作。
一个有用的界面应展示系统认为哪些隐藏配置最有可能、这些信念如何在每次行动后变化,以及哪些假设推动最终建议。
它还应揭示敏感性。如果某一概率的微小变化会产生不同的行动,人类审查者需要看到这种不稳定性。
这三个信号将决定 Ataraxos 是停留在一套非凡的游戏智能体,还是成为不确定性下决策的更广泛模板。
眼下的结果已经很重要。一个由四所大学组成的研究团队,以远低于此前对 DeepNash 估算的训练预算,超越了顶尖人类 Stratego 选手的表现。
更深层的启示在于资源分配。该系统将大范围的训练资源投入到可复用的蓝图中,再将实时计算集中用于与单次决策相关的不确定性。
开发者应关注这一模式是否会出现在其他智能体系统中。企业买家则应追问,那些亮眼的基准测试结果是否包含对抗性测试、成本核算以及可审查的假设条件。
评估类似研究的知识工作者,可以将论文、实验和不断变化的主张保存在一个可检索的知识库中。重要的是,要将每一次新的演示与原始证据进行对照。
Ataraxos Stratego AI 已经解决了一个问题:在这类隐藏信息博弈中,机器无需进行数百万美元规模的训练,就能决定性地击败最强的人类。下一个问题更难:当规则不再写在棋盘上时,同样的效率能否延续?



