AI 아타락소스(Ataraxos)가 정보가 대부분 숨겨진 보드게임 스트라테고(Stratego)에서 역대 최고 선수로 꼽히는 핌 니마이어(Pim Niemeijer)를 상대로 15승 1패 4무를 기록하며 압도적인 승리를 거뒀습니다. 이는 체스(Deep Blue)나 바둑(AlphaGo), 포커(AI 포커봇)와 달리 딥마인드(DeepMind)조차 정복하지 못했던 불완전 정보 게임의 난제를 AI가 해결했음을 의미합니다.
아타락소스는 카네기 멜론, MIT, 뉴욕 대학교, 스탠퍼드 대학교 연구팀이 개발했으며, 핵심은 상대 기물의 정체를 추정하는 별도의 신경망인 '믿음 모델(belief model)' 도입에 있습니다. 이 모델은 상대의 이동 이력을 바탕으로 가능한 기물 배치를 표본으로 뽑고, 이를 통해 다음 수를 미리 탐색할 수 있게 합니다. 또한, 1억 6,300만 판의 자기 대국(self-play)을 통해 학습했는데, 숨겨진 정보 때문에 학습이 맴도는 문제를 줄이도록 초반에는 전략을 크게 바꾸고 후반에는 조심스럽게 조정하는 방식을 사용했습니다. 특히, 딥마인드의 DeepNash가 대규모 전용 칩으로 수백만 달러의 학습 비용을 들인 것과 달리, 아타락소스는 GPU 16개로 일주일, 믿음 모델에 GPU 4개로 나흘을 추가해 수천 달러 수준의 비용으로 훨씬 높은 성능을 달성하여 효율성 측면에서도 큰 진전을 보였습니다.
이번 아타락소스의 성공은 불완전 정보 게임에 대한 AI의 이해와 전략 수립 능력이 크게 향상되었음을 보여줍니다. 스트라테고는 40개의 기물 배치 조합이 10³³개를 넘고 한 판이 2,000수까지 이어질 수 있어 포커보다 훨씬 복잡한 불확실성을 가지고 있습니다. 아타락소스는 불리한 상황에서도 인간처럼 무리한 승부수를 던지기보다 차분하고 체계적으로 만회하며, 상대가 모르는 약점은 불필요하게 건드리지 않는 등 인간의 블러핑(bluffing) 심리까지 이용하는 정교한 플레이를 선보였습니다. 이러한 접근법은 협상, 금융 시장, 군사 충돌 등 고정된 규칙과 명확한 승자가 없는 현실 문제에도 단순화된 모델을 통해 적용될 수 있는 가능성을 제시하며, AI의 활용 범위를 넓히는 중요한 이정표가 될 것입니다.