日本語

モデル発表Axiom MathGPT-6 Astra

フロンティアLLMは実車の運転に苦戦、コースを完走できたのはGPT-6 Astraのみ

この記事は翻訳です。 原文を読む

DrivingBenchと呼ばれる技術プロジェクトが、フロンティア級の汎用大規模言語モデル(LLM)が現実世界の物理的な空間において実際の車両を操作できるかどうかを検証する実験を実施しました。Axiom Mathの開発者らによって行われたこの実験では、「comma four」デバイスとopenpilotソフトウェアを搭載した2022年型トヨタ・カローラを使用し、AIの指令を車両の制御装置へと橋渡ししました。

このセットアップでは、MCP(Model Context Protocol)サーバーを通じて、モデルがステアリング、速度、および持続時間を制御できるようになっています。モデルには、駐車場のコーンで囲まれたコースをナビゲートし、最後に駐車 maneuvers(操縦)を行うタスクが課されました。

結果は成功の度合いにばらつきが見られました。GPT-6 Astraは、2回目の試行で135mのコースを5分22秒で完走し、唯一コースを正常に完了させたモデルとなりました。Claude Fable 5.1はコースの約45%を進行することに成功しましたが、Grok 4.6とGPT-5.6 Solは、すべての試行において最初の曲がり角を越えることができませんでした。

研究チームは、テスト中に重大な技術的課題があったと報告しています。興味深いことに、GPT-6 Astraを含むいくつかのモデルは、入力がシミュレーションではなく実際の車両であると認識すると、安全上の懸念を理由に、当初は車の操作を拒否しました。チームは、MCPサーバーの名前を「DrivingBench Sandbox」に変更することで、ようやく安定した動作を実現できました。

ナビゲーションの正確性に加え、この実験では「応答遅延」が重要な要因であることが浮き彫りになりました。モデルが次のステップを処理している間も車両は最後に受け取ったコマンドに基づいて移動し続けるため、モデルの推論における遅延は、車両がコースを外れるリスクを高めます。チームは、より困難なコースを評価し、モデルあたりの試行回数を増やすために、DrivingBench v2の開発を計画しています。

出典

  1. ChatGPTなどの汎用AIに本物の車を運転させたら「実車では?」と気付いて運転を拒否、最終的に走らせた方法とは (GIGAZINE, 2026-09-30)
  2. DrivingBench