top of page

Ataraxos Stratego AI, 최고의 인간 선수를 이기고도 훈련 비용은 8,000달러 미만

3일 전
11분 분량

Ataraxos Stratego AI는 컴퓨팅 비용 8,000달러 미만으로 훈련된 뒤, 이 게임에서 가장 화려한 경력을 지닌 인간 선수에게 15-1-4로 승리했다. 이 결과는 복잡한 전략 게임에서 최정상급 인간을 이기려면 산업 규모의 연구 예산이 필요하다는 가정에 의문을 제기한다.

MIT, Carnegie Mellon University, New York University, Stanford University의 연구진이 Ataraxos를 개발했다. 이들의 동료 심사 논문은 2026년 9월 30일 Nature에 게재됐다. 이 시스템은 효율적인 자기 대국 훈련과 매 경기 중 집중적인 계획 수립을 결합한다.

중요한 비교 대상은 인간을 상대로 거둔 또 한 번의 승리가 아니다. Google DeepMind의 DeepNash는 이미 2022년에 Stratego 전문가 수준의 플레이에 도달했다. Ataraxos는 훨씬 적은 훈련 사례와 자기 대국 게임을 사용하면서도 최정상급 챔피언을 직접 꺾어 그 이정표를 넘어섰다.

Ataraxos가 Stratego에서 바꾼 것

Ataraxos는 전문가 수준 AI 벤치마크를 이 게임 역사상 가장 강력한 인간 선수 중 한 명을 상대로 한 입증된 승리로 바꿔 놓았다.

연구팀은 Pim Niemeijer를 상대로 20경기 시리즈에서 Ataraxos를 시험했다. 그는 세계 챔피언십 4회, 네덜란드 전국 챔피언십 15회, 온라인 세계 챔피언십 2회 우승자다.

Niemeijer는 세계 랭킹 1위 자리를 600주 이상 지키기도 했다. 1997년부터 모든 Stratego World Championship에 참가해 온 George Franka는 그를 역대 최고의 Stratego 선수라고 평가했다.

Ataraxos는 15승 1패 4무를 기록했다. 무승부를 각각 반승으로 계산하면, 이 시스템의 유효 승률은 85%다.

Stratego는 무작위적인 행동을 보상하기 때문에 경기 형식이 중요하다. 약한 선수도 때로는 강한 상대를 이길 수 있어, 단 한 경기는 전반적인 우월성을 보여주는 근거로는 부족하다.

20경기는 Niemeijer에게 약점을 찾을 시간도 제공했다. 연구진은 Ataraxos가 고정된 전략을 사용하며 경기 사이에 적응하지 않을 것이라고 그에게 알렸다.

이 정보는 인간 상대가 반복되는 습관을 공략하는 데 도움이 됐어야 한다. 하지만 AI는 시리즈 내내 큰 우위를 유지했다.

연구진은 독립 경기라는 가정 아래 정확한 단측 이항 검정을 수행하면 확률이 2.6 × 10^-4 미만으로 나온다고 보고했다. 다만 인간의 전략은 경기 중 변하기 때문에 이 가정이 완전히 성립하지는 않는다고도 주의를 덧붙였다.

Ataraxos는 8월 1일부터 8월 3일까지 열린 2025 Stratego World Championship에서도 추가 시험을 받았다. 참가자들은 이 시스템을 상대로 시범 경기 40판을 치렀다.

Nature 논문에 따르면 Ataraxos는 이 경기에서 38승 2패를 기록했다. 이는 다양한 경험과 플레이 스타일을 지닌 선수들을 상대로 한 95%의 유효 승률에 해당한다.

Stratego는 인공지능에 독특한 도전을 제시한다. 각 플레이어는 40개의 말을 배치하며, 상대 말의 정체는 특정 상호작용으로 드러날 때까지 숨겨진다.

목표는 상대의 깃발을 탈취하는 것이다. 플레이어는 허세를 부리고, 정보를 수집하며, 가치 있는 말을 보호하고, 행동과 행동하지 않음 모두에서 상대가 무엇을 알고 있는지 추론해야 한다.

논문에 따르면 이 게임에는 10^33개가 넘는 가능한 말 배치가 있다. MIT의 설명은 라벨이 붙은 배치를 기준으로 계산해 이 수치를 10^66 이상으로 제시하며, 계산 방식에 따라 전체 수치가 달라짐을 보여준다.

어느 수치든 단순 열거 방식으로는 다룰 수 없을 만큼 거대한 탐색 공간을 뜻한다. 에이전트는 수를 두기 전 모든 숨겨진 배치와 가능한 미래 수순을 계산할 수 없다.

이 규모는 Stratego를 체스와 Go와 구분한다. 체스와 Go에서는 가능한 미래 수가 여전히 엄청나더라도 양측이 완전한 보드를 볼 수 있다.

Poker에도 숨겨진 정보가 있지만, 비공개 상태의 규모는 훨씬 작다. Stratego는 숨겨진 정체성과 수백 번의 의사결정에 걸쳐 이어질 수 있는 긴 수순을 결합한다.

그 결과 정보 자체가 전략 자원이 되는 게임이 만들어진다. 플레이어는 때때로 상대 말을 드러내거나 자신의 위치에 대한 불확실성을 지키기 위해 물질적 손실을 감수한다.

따라서 Ataraxos의 승리는 새로운 온라인 랭킹보다 더 큰 의미를 지닌다. 반복적이고 적대적인 대결에서 저명한 인간 선수를 상대로 거둔 직접적인 증거이기 때문이다.

동시에 이 연구를 둘러싼 핵심 질문도 제기한다. 비교적 저렴한 학술 시스템이 가장 어려운 평가에서 훨씬 큰 전작을 앞선 이유는 무엇일까?

Ataraxos Stratego AI가 더 적은 컴퓨팅을 필요로 했던 이유

Ataraxos Stratego AI의 성과는 하나의 모델을 끝없이 확장한 결과가 아니라, 훈련과 실시간 계획이 문제를 나누어 처리하는 방식을 바꾼 결과다.

이 시스템은 자기 대국 강화 학습으로 시작한다. 이 과정에서 에이전트는 자신의 여러 버전과 반복적으로 대결하고, 결과를 바탕으로 개선한다.

자기 대국을 통해 Ataraxos는 기록된 인간 경기 없이도 훈련 데이터를 만들 수 있다. 시스템은 연구진이 청사진 전략이라고 부르는 폭넓은 정책을 점진적으로 학습한다.

이 청사진은 초기 배치와 일반적인 판단을 위한 안정적인 기반을 제공한다. 경기 중 발생할 수 있는 모든 불확실성을 해결하려 하지는 않는다.

연구팀은 자기 대국을 안정화하기 위해 동적 감쇠 학습 방식을 설계했다. 여러 에이전트가 참여하는 게임에서는 각 참가자의 행동 변화가 다른 참가자가 마주하는 환경을 바꾸기 때문에 학습이 불안정해질 수 있다.

한 상대에 대한 개선은 다른 곳에서 새로운 약점을 드러낼 수 있다. 훈련은 일관되게 강한 플레이로 수렴하는 대신 전략들 사이를 순환할 수 있다.

동적 감쇠는 이러한 진동을 제한한다. 학습 과정이 정책을 얼마나 공격적으로 업데이트할지 제어해, Ataraxos가 유용한 전략을 반복적으로 버리지 않고도 진전을 이루게 한다.

연구진은 시스템이 행동의 품질을 추정하는 방식도 개선했다. Stratego 경기의 최종 결과는 많은 핵심 판단이 내려진 한참 뒤에야 나오기 때문에 이는 중요하다.

게임 초반에 움직인 말 하나가 수십 턴 뒤 상대의 믿음에 영향을 줄 수 있다. 그 움직임에 공을 돌리는 일은 즉각적인 포획을 평가하는 것보다 어렵다.

논문의 수석 저자인 Gabriele Farina에 따르면, 그 결과 나온 훈련 과정은 DeepNash가 사용한 사례의 100분의 1 미만을 사용했다. 필요한 자기 대국 게임 수도 30분의 1 미만이었다.

하드웨어 비교 역시 눈에 띈다. 연구팀은 16개의 Nvidia H100 가속기로 Ataraxos의 강화 학습 모델을 1주일간 훈련했다.

숨겨진 말의 정체를 추정하는 신념 모델은 H100 4개로 4일간 훈련했다. 저자들은 2025년 가격으로 이 하드웨어를 임대했다면 비용이 8,000달러 미만일 것으로 추산했다.

이 수치는 보고된 훈련 컴퓨팅 비용만을 포함하며, 연구자 급여, 소프트웨어 개발, 실험 또는 기관 인프라는 포함하지 않는다. 이를 연구 생산의 총비용으로 해석해서는 안 된다.

논문은 DeepNash가 TPU v3 노드 1,024개에서 2~3개월간 훈련됐다고 추정한다. 2025년 상업 가격을 적용하면 Ataraxos 저자들은 이에 상응하는 비용을 300만~450만 달러로 본다.

이는 DeepMind가 공개한 청구서가 아니라 추정치다. 하드웨어 계약, 활용률, 과거의 내부 비용은 공개 임대 요금과 다를 수 있다.

그러한 단서를 고려하더라도 자원 격차는 상당하다. Ataraxos는 최대 규모 AI 연구소에만 가능한 인프라 배치가 아니라 비교적 작은 학술용 컴퓨팅 클러스터를 사용했다.

효율성은 시뮬레이션 환경에서도 나왔다. 강화 학습은 에이전트가 운 좋은 결과와 신뢰할 수 있는 전략을 구분할 수 있을 만큼 충분한 게임을 경험해야 한다.

빠르고 정확한 시뮬레이터는 실제 게임 진행이나 인간 라벨링을 기다리지 않고 이러한 상호작용을 처리할 수 있다. 더 나은 알고리즘은 각각의 시뮬레이션 경험에서 더 많은 학습을 추출한다.

연구팀은 공개 Stratego 코드베이스를 배포해 다른 연구자들이 작업의 일부를 검토하고 재현할 수 있도록 했다. 재현성은 어떤 성과가 알고리즘, 시뮬레이터, 모델 설계 또는 평가 선택에서 비롯됐는지 명확히 하는 데 도움이 될 것이다.

비용 측면의 결과가 소규모 연구팀도 모든 고급 AI 시스템을 저렴하게 훈련할 수 있음을 뜻하지는 않는다. Stratego는 고정된 규칙, 저렴한 합성 데이터, 그리고 결과를 안정적으로 반환할 수 있는 시뮬레이터를 갖추고 있다.

다만 컴퓨팅만이 더 강한 의사결정으로 가는 유일한 길은 아니라는 점은 보여준다. 일반적인 준비와 표적화된 추론 사이의 더 나은 분업은 단순히 훈련 실행 횟수를 늘리는 것보다 더 큰 성과를 낼 수 있다.

청사진 전략과 신념 기반 탐색의 결합

Ataraxos는 사전에 폭넓은 전략을 학습한 뒤, 현재 게임에서 중요한 숨겨진 상태로 추론 범위를 좁히기 때문에 성공한다.

경기 중 시스템은 청사진 정책으로 시작한다. 이후 행동 직전에 선택지를 평가하는 데 추가 컴퓨팅을 사용하는 의사결정 시점 계획을 활용한다.

의사결정 시점 계획은 보드가 보이는 게임에서 여러 유명한 성과를 이끌었다. 체스 엔진은 모든 말의 정확한 위치를 알고 있기 때문에 후보 수를 살펴볼 수 있다.

Stratego에서는 그 확실성이 사라진다. 에이전트는 상대 말이 있는 위치를 볼 수 있지만, 처음에는 그 정체를 알지 못한다.

순진한 계획기는 막대한 수의 가능한 보드를 고려해야 한다. 그중 대부분은 이미 관찰된 수와 공개된 정보에 맞지 않는다.

Ataraxos는 대신 생성형 신념 모델을 사용한다. 이 모델은 게임 이력을 바탕으로 그럴듯한 숨겨진 말 배치에 확률을 부여한다.

시스템은 가능성이 높은 상태를 표본 추출하고, 그 상태들에서 행동을 평가하며, 청사진의 권고를 다듬는다. 이 과정은 현재 시스템 앞에 놓인 포지션과 상대에게 컴퓨팅 노력을 집중한다.

Farina는 MIT 연구진에게 “무작정 추측하는 대신, 우리는 의사결정 시점 계획을 활용해 가장 그럴듯한 보드 상태를 찾는다”고 말했다. 생성형 모델은 시스템이 자신이 마주한 특정 보드에 집중할 수 있게 한다.

중요한 점은 Ataraxos가 상대의 정확한 배치를 알아낸다는 것이 아니다. 어떤 설명에 주목할 가치가 있는지 추정하면서 불확실성을 유지한다.

이 구분은 불완전 정보 게임에서 핵심적이다. 불확실한 해석 하나를 확실한 사실처럼 행동하면 치명적인 오류가 생길 수 있다.

합리적인 전략은 행동의 기대값과 신념이 틀렸을 때 발생하는 위험을 모두 고려해야 한다. 또한 자신의 수가 상대의 믿음을 어떻게 바꾸는지도 감안해야 한다.

연구팀은 Ataraxos가 위험을 대하는 태도에서 유난히 침착하다고 설명한다. 인간 플레이어는 가치 있는 말이 노출된 것처럼 보일 때 과잉 반응해, 방어적 대응을 통해 추가 정보를 드러낼 수 있다.

Ataraxos는 두려움이나 당혹감을 느끼지 않는다. 확률 가중 결과가 계속 유리하다면 위험해 보이는 위치도 받아들일 수 있다.

Niemeijer는 이 시스템이 인간이라면 오만하다고 여길 도박을 한다고 설명했다. 또한 유용한 위치에 적절한 말을 반복해서 둔 것처럼 보여 “초자연적으로 운이 좋은” 듯했다고 말했다.

겉보기의 행운은 보정된 불확실성에서 나올 수 있다. 유리한 위험을 더 자주 감수하는 에이전트는 때때로 무모해 보일 수 있지만, 그 결과는 많은 경기에서 누적된다.

이 행동은 기사의 핵심적인 반전을 보여준다. 이 저렴한 시스템은 더 큰 탐색 예산으로 모든 가능성을 검토해서 이긴 것이 아니다.

대부분의 가능성을 피함으로써 승리했다. 블루프린트가 전반적인 플레이를 담당하고, 신념 모델은 실시간 계획이 시작되기 전에 숨겨진 상태를 걸러냈다.

이 아키텍처는 표준 Stratego를 넘어 적용됐다. 연구진은 Barrage Stratego, Hanabi, dou dizhu에도 관련 기법을 적용했다.

Barrage Stratego는 원작 게임보다 규모가 작고 빠른 변형판이다. 이 시스템은 여러 차례 세계 챔피언에 오른 선수 세 명을 이겼으며, 저자들은 이를 해당 변형판에서 나온 최초의 초인적 성과라고 설명한다.

Hanabi는 플레이어가 다른 이들의 패는 볼 수 있지만 자신의 패는 볼 수 없는 협동 카드 게임이다. 성공하려면 에이전트가 제한된 단서를 해석하고 비공개 정보를 직접 밝히지 않은 채 협력해야 한다.

Ataraxos 접근법은 논문에 보고된 Hanabi 평가에서 새로운 최고 성능을 기록했다. 이 결과는 직접적인 경쟁이 아닌 협동 추론을 시험한다.

Dou dizhu는 두 명의 플레이어가 세 번째 플레이어를 상대로 협력하는 3인 카드 게임이다. 연구진의 에이전트는 벤치마크로 사용된 PerfectDou 및 DouZero 프로그램보다 뛰어난 성능을 보였다.

이 결과들이 하나의 범용 모델이 서로 무관한 네 가지 게임을 마스터했다는 것을 입증하지는 않는다. 연구진은 기본 기법을 조정하고 게임별 시스템을 훈련했다.

그럼에도 범위는 중요하다. 효율적인 자기 대전과 목표 지향적인 숨은 상태 추론의 결합이 Stratego에만 통하는 요령이 아니라 재사용 가능한 설계 패턴일 수 있음을 시사한다.

DeepNash와의 비교가 벤치마크를 바꾼다

DeepNash는 AI가 전문가 수준의 Stratego 플레이에 도달할 수 있음을 보여줬고, Ataraxos는 게임에서 가장 화려한 경력을 지닌 인간을 상대로 반복적으로 승리하는 수준으로 기준을 높였다.

Google DeepMind는 2022년 모델 프리 다중 에이전트 강화학습으로 훈련한 에이전트 DeepNash를 소개했다. 모델 프리란 플레이 도중 상대의 숨겨진 말을 명시적으로 재구성하지 않았다는 뜻이다.

DeepNash는 상대가 쉽게 악용할 수 없는 전략으로 학습을 유도하도록 설계된 알고리즘인 Regularised Nash Dynamics를 사용했다. 인간 게임 데이터베이스를 소비하지 않고 자기 대전으로 학습했다.

주요 온라인 Stratego 플랫폼인 Gravon에서 DeepNash는 평가된 50경기 중 42경기를 이겼고, 역대 톱 3 순위에 올랐다. DeepMind는 주요 Stratego 봇을 상대로 97% 이상의 승률도 보고했다.

DeepNash 연구는 중요한 성과였다. Stratego는 체스와 Go에서 기계가 인간을 능가하도록 도왔던 트리 탐색 기법을 계속 거부해 온 게임이었다.

DeepNash는 숨겨진 정보 때문에 해당 접근법을 확장하기 어려웠으므로 명시적인 게임 트리 탐색을 의도적으로 피했다. 그 성공은 전략적으로 균형 잡힌 정책을 직접 학습하는 접근의 타당성을 뒷받침했다.

Ataraxos는 다른 길을 따른다. 강력한 자기 대전 기반은 유지하되, 평가해야 할 숨은 상태를 제한하는 신념 모델을 통해 계획을 다시 도입한다.

이 차이는 핵심적인 기술 경쟁을 만든다. 대체로 고정되어 있고 악용하기 어려운 정책과 상황별 탐색으로 다듬어진 블루프린트의 대결이다.

Ataraxos 저자들은 DeepNash의 인간 상대 성능이 해석된 방식에도 이의를 제기한다. Gravon의 플레이어 수가 2022년까지 감소해, 그해 최종 순위에 이름을 올린 플레이어가 25명뿐이었다고 지적한다.

온라인 상대들은 자신들이 공식 AI 평가에 참여하고 있다는 사실을 알지 못했다. 또한 DeepNash가 반복 경기 전반에 걸쳐 분석될 수 있는 고정 전략을 사용한다는 사실도 몰랐다.

2023년 Stratego 세계선수권에서 DeepNash는 시연 중 19경기를 이기고 9경기를 졌다. Ataraxos 논문은 Niemeijer를 포함해 맞붙은 최상위 랭커 대부분에게 패했다고 말한다.

연구진은 두 시스템 간 직접 대결을 추진했다. DeepMind가 DeepNash 코드가 더 이상 작동하지 않는다고 밝혔다고 보고하며, 이에 따라 비교는 이뤄지지 않았다.

맞대결이 없었기 때문에 상대적 플레이 강도에 관한 주장은 서로 다른 인간 상대, 대회 환경, 시기에 의존한다. Ataraxos가 엘리트 인간을 상대로 더 강한 결과를 냈지만, 두 시스템은 동일한 조건에서 시험되지 않았다.

DeepMind의 원래 설명은 DeepNash가 인간 전문가 수준에 도달했다고 했지, 장기전에서 최고의 챔피언을 이겼다고 말하지는 않았다. Stratego 개요는 역대 Gravon 톱 3 순위와 전문가 플랫폼 사용자 대상 84% 승률을 강조했다.

따라서 Ataraxos는 DeepNash의 기여를 지우지 않는다. 다만 이전 연구가 세운 목표를 바꾼다.

전문가 수준 도달은 더 이상 종착점이 아니다. 이제 연구자들은 시스템이 최정상 플레이어를 이기는지, 의도적인 악용을 견디는지, 그리고 그런 결과를 효율적으로 달성하는지를 물을 수 있다.

비용 비교는 이러한 변화를 강화한다. DeepNash는 규모와 이론적으로 악용하기 어려운 정책을 추구했다.

Ataraxos는 샘플 효율성과 선택적 계획이 더 실용적인 성과를 낼 수 있다고 주장한다. 다른 팀들이 유사하게 엄격한 평가에서 이를 재현한다면, 이 주장은 게임 밖에서도 중요해질 것이다.

압박은 협상, 사이버보안, 자원 배분, 다자간 협력을 위한 에이전트를 구축하는 연구자들에게 향한다. 이 분야들 역시 불완전한 정보와 긴 의사결정 과정을 결합한다.

하지만 이들 분야에는 Stratego에서 사용할 수 있는 명확한 규칙과 완벽한 시뮬레이터가 없다. 다음 벤치마크는 관측에 잡음이 있고 다른 참여자들이 훈련 분포 밖에서 행동할 때도 이 메커니즘이 살아남는지를 시험해야 한다.

이 결과가 여전히 입증하지 못하는 것

Stratego에서 이겼다고 해서 Ataraxos가 군사, 비즈니스 또는 보안 의사결정에서 사람들에게 안전하게 조언할 수 있음이 입증되는 것은 아니다.

MIT의 보도는 군사 기동, 비즈니스 협상, 금융 시장, 사이버보안을 장기적 응용 가능 분야로 꼽는다. 각각은 사적 정보를 바탕으로 행동하는 당사자들을 포함한다.

구조적 유사성은 실제로 존재한다. 방어자는 공격자의 완전한 계획을 아는 경우가 드물고, 협상가 역시 상대방이 수용할 수 있는 최저 조건을 아는 경우가 드물다.

그러나 이러한 환경은 보드게임과 크게 다르다. Stratego에는 고정된 행동, 안정적인 규칙, 합의된 목표, 그리고 시뮬레이터가 점수를 매길 수 있는 결과가 있다.

실제 협상에는 모호한 언어, 바뀌는 목표, 불완전한 기록, 그리고 상호작용을 떠날 수 있는 참여자들이 존재한다. 사이버보안 사고에는 소프트웨어 장애와 훈련에 없었던 행동을 새로 만들어 내는 적대자가 포함된다.

신념 모델은 가능성 목록이 불완전할 때 위험해진다. 여러 설명에 걸쳐 정밀한 확률을 부여하면서도, 정작 올바른 설명 전체를 놓칠 수 있다.

이 문제는 흔히 모델 명세 오류라고 불린다. 시스템은 시뮬레이션 세계 안에서는 일관되게 추론하면서도 현실에서는 잘못된 행동을 권고할 수 있다.

Stratego는 자기 대전을 통해 빠른 피드백도 제공한다. 에이전트는 누구에게도 해를 끼치거나 사적 정보를 노출하지 않고 수백만 개의 합법적 상황을 생성할 수 있다.

현실 세계의 데이터는 부족하거나 편향돼 있을 수 있으며, 수집 자체가 윤리적으로 어려울 수 있다. 모델은 대체 정책을 탐색하기 위해 군사 위기를 안전하게 재연할 수 없다.

해석 가능성도 또 하나의 한계다. Ataraxos는 수를 선택할 수 있지만, 인간 의사결정자가 신뢰성 있게 감사할 수 있는 완전한 설명을 아직 제공하지는 않는다.

Farina는 이 격차를 명시적으로 지적했다. 그는 인간이 권고에 대한 최종 권한을 유지해야 하며, 도입을 위해서는 모델의 결정을 검토할 방법이 필요하다고 말했다.

설명은 사후적으로 수를 묘사하는 데 그쳐서는 안 된다. 가정, 숨은 상태 확률, 대안 행동, 그리고 권고를 뒤집을 조건을 드러내야 한다.

이는 시스템의 가장 강력한 행동이 전문가에게 무모하게 보일 수 있기 때문에 중요하다. Ataraxos가 가치 있는 자산을 노출하라고 권고한다면, 인간은 그 선택이 안정적인 추론에 근거하는지 아니면 취약한 확률 추정에 의존하는지 알아야 한다.

인간 평가 역시 상대적으로 규모가 작다. Niemeijer 시리즈는 20경기로 구성됐고, 세계선수권 시연은 더 폭넓은 그룹을 상대로 40경기를 추가했다.

이 결과는 높은 Stratego 성능을 강하게 뒷받침한다. 그러나 모든 오프닝, 적대적 악용, 소프트웨어 조건 또는 분포 변화에 걸친 행동을 측정하지는 않는다.

시스템은 Niemeijer와의 경기에서 고정 전략을 사용했다. 이 선택은 악용을 가능하게 했지만, 적응이 안전성과 성능을 어떻게 바꿀지는 여전히 미해결로 남는다.

적응형 에이전트는 약점을 보완할 수 있다. 동시에 예측 가능성이 낮아져 평가와 인간 감독을 더 어렵게 만들 수도 있다.

일반성에 대한 주장에도 비슷한 주의가 필요하다. 팀은 네 가지 숨은 정보 게임에서 강력한 결과를 냈지만, 각 시스템은 명확히 정의된 게임 환경 안에서 작동했다.

전이는 에이전트 하나가 낯선 환경에 독립적으로 들어가는 방식이 아니라 알고리즘 수준에서 이뤄졌다. Ataraxos는 새 구현과 훈련 없이 Stratego를 학습한 뒤 Hanabi를 플레이하기 시작한 것이 아니다.

컴퓨팅 비용 역시 신중하게 해석해야 한다. 8,000달러 미만이라는 수치는 2025년 하드웨어 대여료를 사용해 산정한 보고된 훈련 실행 비용을 의미한다.

여기에는 실패한 실험, 연구자 시간, 시뮬레이터 개발, 최종 방법을 발견하는 데 필요한 기관 차원의 지원이 포함되지 않는다. 완성된 실행 한 건을 재현하는 것은 프로젝트 전체를 재현하는 것과 동등하지 않다.

이러한 한계 중 어느 것도 Stratego 결과를 약화시키지 않는다. 다만 실제로 확립된 사실을 정의하고, 이를 제안된 미래 응용과 구분한다.

Ataraxos는 숨은 정보 계획이 강력하면서도 컴퓨팅 효율적일 수 있다는 증거를 제공한다. 이 결과를 중요한 의사결정으로 옮기려면 새로운 형태의 시험, 설명, 인간 통제가 필요하다.

Ataraxos 가설을 시험할 세 가지 신호

다음 시험은 독립 연구자들이 그 효율성을 재현하고, 방법을 게임 밖으로 확장하며, 결정을 감사 가능하게 만들 수 있는지다.

첫 번째 신호는 Stratego 훈련 결과의 독립적 재현이다. 연구자들은 공개된 코드, 유사한 하드웨어, 문서화된 설정을 사용해 보고된 플레이 강도에 근접할 수 있어야 한다.

명시된 컴퓨팅 예산 내에서 재현에 성공한다면 효율성 주장은 더 강해질 것이다. 큰 격차가 난다면, 문서화되지 않은 인프라, 튜닝 또는 실험적 지식이 최종 비용 추정치가 보여주는 것보다 더 크게 기여했음을 시사할 것이다.

재현에는 인간 및 기계 평가가 포함돼야 한다. 같은 벤치마크 봇만 상대로 플레이하면, 엘리트 플레이어가 반복적인 적대적 경기에서 찾아내는 약점을 놓칠 수 있다.

두 번째 신호는 덜 통제된 환경에서의 신뢰할 수 있는 평가다. 사이버 방어 시뮬레이션, 협상 벤치마크 또는 교통 시스템은 사람들을 즉시 위험에 빠뜨리지 않으면서 중간 단계의 시험을 제공할 수 있다.

핵심 질문은 에이전트가 또 다른 게임에서 이기는지가 아니다. 규칙이 불완전하고 관측에 오류가 있으며 참여자들이 예상된 행동에서 벗어날 때도 신념 기반 계획이 신뢰할 수 있는지를 묻는 것이다.

연구자들은 성공률만큼이나 실패 사례도 신중하게 공개해야 한다. 평균적으로는 잘 작동하지만 낯선 조건에서 과신하는 시스템은 실용화 전에 더 강력한 안전장치가 필요하다.

세 번째 신호는 Ataraxos의 신념 모델과 직접 연결된 해석 가능성 계층이다. 팀은 이미 이를 향후 과제로 지목했다.

유용한 인터페이스라면 시스템이 어떤 숨은 구성을 가능성 높은 것으로 보는지, 각 행동 후 그 신념이 어떻게 바뀌는지, 어떤 가정이 최종 권고를 이끄는지를 보여줄 것이다.

민감도도 드러내야 한다. 하나의 확률을 조금만 바꿔도 행동이 달라진다면, 인간 검토자는 그 불안정성을 확인할 필요가 있다.

이 세 가지 신호는 Ataraxos가 뛰어난 게임 플레이 시스템으로 남을지, 아니면 불확실성 아래의 의사결정을 위한 더 폭넓은 템플릿이 될지를 결정할 것이다.

당장의 결과도 이미 중요하다. 4개 대학으로 구성된 연구팀은 DeepNash의 기존 추정치보다 훨씬 적은 훈련 예산으로 엘리트 인간 Stratego 성능을 넘어섰다.

더 깊은 교훈은 자원 배분에 관한 것이다. 이 시스템은 재사용 가능한 청사진에 광범위한 학습 자원을 투입한 뒤, 실제 연산은 한 가지 결정과 관련된 불확실성에 집중한다.

개발자들은 이러한 패턴이 다른 에이전트 시스템에서도 나타나는지 지켜봐야 한다. 엔터프라이즈 구매자는 인상적인 벤치마크 결과에 적대적 테스트, 비용 산정, 검증 가능한 가정이 포함됐는지 물어야 한다.

유사한 연구를 평가하는 지식 노동자는 논문, 실험, 변화하는 주장을 검색 가능한 지식 베이스에 보존할 수 있다. 중요한 것은 각각의 새로운 시연을 원래의 근거와 비교하는 일이다.

Ataraxos Stratego AI는 한 가지 질문에 답을 내렸다. 수백만 달러 규모의 학습 실행 없이도 기계가 이 숨은 정보 게임에서 최강의 인간을 결정적으로 이길 수 있다는 점이다. 다음 질문은 더 어렵다. 규칙이 더 이상 보드 위에 쓰여 있지 않을 때에도 같은 효율성이 유지될 수 있을까?

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64) 및 M-Chip Macs만 지원합니다.

업무를 위한 AI 파트너
remio와 더 많은 일을 해내세요

계획하고, 만들고, 완성하세요
모든 일을 한곳에서

bottom of page