Jacky氏はOpenRouterにDev Rel Leadとして入社した初週に、11種のLLMを自作の2Dバトルロイヤル環境で対戦させる実験を行いました。400×400メートルのマップ上で30試合を行い、各モデルは他者を文字AからKとして認識し、武器やアイテムを駆使して戦います。

実験の結果、Grok 4.1 Fastが30試合中13勝を記録しました。1勝あたりのコストは0.97ドルでした。これに対し、次点のClaude Sonnet 4.6は5勝で、1勝あたりのコストは26.78ドルです。最も安価なモデルが、最も高価なモデルをコスト効率で27倍上回りました。

GPT 5.4は38キルを記録し最多でしたが、勝利数は2にとどまりました。また、GPT 5.4-miniやDeepSeek 4 Flashなど3つのモデルは合計57ドルを消費しながらも勝利なしでした。既存のベンチマークでは予測できなかった性能差が、ゲーム内の行動として表面化したと氏は述べています。


出典: A robot is sprinting towards you. Do you want it running on Claude or Grok?(HN 272pt・210コメント)(HN Search (backfill)、2026-06-18)