カーネギーメロン大学、MIT、ニューヨーク大学、スタンフォード大学の研究チームは、世界トップレベルのストラテゴプレイヤーを打ち負かすことができるAI「Ataraxos」を開発しました。史上最高と言えるストラテゴプレイヤー、Pim Niemeijer氏との20戦において、このAIは15勝1敗4引き分けという成績を収めました。
製品発表カーネギーメロン大学マサチューセッツ工科大学ニューヨーク大学スタンフォード大学Ataraxos
Ataraxos AI、低コストの計算資源でストラテゴにおいて超人的なパフォーマンスを達成
この記事は翻訳です。 原文を読む
ストラテゴは「不完全情報」ゲームであり、プレイヤーは戦闘が始まるまで相手の駒の正体を知ることができません。これにより膨大な状態空間が生じ、複雑なブラフ(はったり)や長期的な戦略立案が必要となります。すべての情報が可視化されているチェスや囲碁のような「完全情報」ゲームとは異なり、ストラテゴの隠匿性は、歴史的にAIが超人的なパフォーマンスを達成することを困難にしてきました。
Ataraxosは、自己対戦型強化学習とテスト時の探索を組み合わせた新しい設計によって、これらの課題を克服しています。このシステムは、相互に依存する2つのTransformerベースのネットワークを活用しています。初期の駒の配置を決定する「セットアップ・ネットワーク」と、行動を選択する「ムーブ・ネットワーク」です。重要な革新点は「信念モデル(belief model)」の導入にあります。これは、相手の駒の動きのパターンに基づいて、隠された駒の正体を推定するために訓練された2つ目のニューラルネットワークです。これにより、AIは妥当なゲーム状態をサンプリングし、それらの中で最善の手を選択することで探索を行うことが可能になります。
特筆すべきは、Ataraxosが極めて高い効率でこれらの成果を達成した点です。DeepMindのDeepNashなど、これまでのAIの試みでは膨大な計算リソースが必要であり、訓練コストは300万ドルから450万ドルに達すると推定されていました。対してAtaraxosは、16枚のNVIDIA H100 GPUを1週間使用し、さらに信念モデル用に少数のGPUを使用したのみであり、コストは8,000ドル未満に抑えられました。
研究者たちは、同じ手法を他のゲームにも適用し、花札(協力型カードゲーム)や斗地主(中国のカードゲーム)において最先端の成果を達成することで、彼らのアプローチの汎用性を実証しました。チームは、この設計パターンの成功が、交渉や軍事シミュレーションといった、重大な隠匿情報を伴う現実世界の戦略的意思決定にも応用できる可能性があることを示唆しています。
出典
- With most information hidden, the game Stratego had stumped AI–until now (Hacker News Frontpage, 2026-10-02)
- Nature