OpenAIのGPT-6 Astraは、コードレビューにおいて高い能力を示すことが評価実験によって示されました。

評価指標の一つである「実行可能なバグの網羅率」において、AstraはGPT-5.6 Solよりも約4%、Opus 5よりも約22%多くバグを検出しました。

特に複数のファイルにまたがる複雑なレビューにおいて、その差は顕著です。AstraはSolに対して20%、Opus 5に対して33%高い検出率を記録しました。これは、コードベース全体に分散した情報の関係性を捉える能力が向上していることを示唆しています。

一方で、利用コストには注意が必要です。AstraのAPI価格は、入力100万トークンあたり10ドル、出力100万トークンあたり50ドルとされています。

この価格設定に基づき、一定のトークン使用量で試算すると、AstraのコストはSolの約2.5倍、Terraの約4.7倍、Lunaの約47倍に達します。OpenAIは、タスク全体の成功コストを基準に評価することが重要であるとしています。


出典: GPT-6 Astra in code review: Gains, privacy, and cost(Hacker News Frontpage、2026-09-05)