研究データと神経構造が融合した青い抽象ビジュアル
NAW / RESEARCH 04

IMAGE: AI生成ビジュアル

RESEARCH / Game AI

Strategoで初の超人級AI「Ataraxos」— Nature論文で報告、最強王者相手に20戦15勝、16基のGPUで学習

CMU・MIT・NYU・スタンフォードのチームが不完全情報ゲームの汎用設計パターンを提案。自己対戦1.63億局と信念モデルによる探索で、DeepNash比34分の1の対局数・桁違いに少ない計算量と主張。

チェスは1997年、囲碁は2016年、ポーカーもプロ敗北の歴史がある中で、駒の正体という大量の隠れ情報が長期にわたって開示されるStrategoはAIの牙城として残っていた。2026年9月30日付のNature論文が、その壁を破るAI「Ataraxos」を報告した。カーネギーメロン大学・MIT・ニューヨーク大学・スタンフォード大学の研究チームによる成果で、以下は論文要旨(一次情報)と発見契機の報道が伝える論文内容の範囲に基づく。

何が達成されたか — 最強王者相手の20番勝負

  • 対戦相手: 世界選手権4回制覇、世界ランキング1位を通算600週以上維持したPim Niemeijer氏。報道によれば同氏史上最高のStrategoプレイヤーと目されている。
  • 成績: 3週間のオンライン20局でAtaraxosの15勝1敗4分。AI側は対戦中に適応しないことが事前に明示され、1勝ごとに100ドルの賞金が設定されていた。
  • 敗戦の扱い: 研究チームは唯一の敗戦を欠陥ではなく、初期配置のランダム化に伴う運の要素と説明している(完全な戦略でも負けることがある、としている)。
  • 世界選手権での補強: 2025年のStratego世界選手権の会場では挑戦者相手に40局中38勝。角に旗を2個の爆弾だけで守る珍しい配置を多用し、対戦者の定石にも影響を与えたと伝えられている。

技術の鍵 — 学習スケジュールと信念モデル

  • 自己対戦の規模: DeepNash(2022年のDeepMindのStratego AI)と同様に自己対戦で学習し、総対局数は1億6,300万局。DeepNashの約34分の1としている。
  • 学習の調整: 隠れ情報が自己対戦の学習を堂々巡りにさせる問題に対し、訓練序盤は大胆に、後半は慎重に戦略を更新するスケジュールで対処した。
  • テスト時探索の実現: DeepNashには無かった要素として、指し手ごとに未来を読む探索を導入。相手の動きから隠れ駒の正体を推測する**信念モデル(belief model)**を別途訓練し、あり得る配置をサンプリングして候補手を試す方式とした。
  • 計算量の主張: DeepNashが専用チップ1,024基で2〜3か月(チーム試算で2025年価格換算300万〜450万ドル相当)だったのに対し、AtaraxosはGPU16基×1週間+信念モデル用4基×4日としている。GPU上で毎秒数百万手を回す自作シミュレーターが効率化に寄与したという。いずれも研究チーム側の主張であり、独立の費用検証ではない点に留意が必要だ。

汎用性の実証と限界

  • 他ゲームへの適用: 同一手法で、8枚変種のBarrage Strategoでは3人の世界王者を破る超人級、協力型カードゲームHanabiと中国のカードゲーム闘地主では最先端級を、低コスト・高サンプル効率で達成したと論文要旨は述べている。
  • 設計パターンの主張: 敵対・協力・チーム戦のいずれでも有効だったことから、大量の隠れ情報下での強化学習と探索の設計パターンになると位置づけている。
  • 残る課題: Ataraxosは指し手の理由を説明できず、解釈可能性は今後の課題と研究者は述べている。交渉・金融市場・軍事衝突など現実問題への応用は、単純化モデルを構築することから始まるという研究チームの見解の段階であり、実証された効果ではない。

出典