xAIは2026年7月29日、音声対話AIモデルの最新版であるGrok Voice Think Fast 2.0を発表しました。このモデルは、ユーザーの音声を直接受け取り、テキスト変換を介さずに音声のまま応答を生成するSpeech-to-Speech方式を採用しています。会話の途中で裏側で推論を進める独自のアーキテクチャにより、応答が返り始めるまでの時間(Time to First Audio)は、前モデルの1.25秒から0.70秒へと大幅に短縮されました。

技術的な進化として、応答1回あたりに使用する推論トークン量が前モデルの約0.4倍に削減されており、推論効率が大きく向上しています。これにより、エージェントが最初の一文を話し終える前に、Web検索や外部API連携などのツール呼び出しを完了させることが可能になりました。また、24言語における文字起こし精度も向上しており、前モデルと比較して1.4倍の精度を実現しているとしています。


出典: Grok Voice Think Fast 2.0とは?特徴や使い方を解説 - aismiley.co.jp(Google News: Grok)