Google DeepMindは2026年9月1日、Geminiの動画分析を自律的に進める新機能「Agentic Video Understanding」を発表しました。この機能は、質問内容に応じてGemini自身が動画内の必要な区間を判断し、映像フレームや音声、文字起こしから情報を取得する仕組みです。詳細な確認が必要な場合には、対象区間のフレームレートや解像度を調整して読み直すことも可能となります。従来の静的処理と比較して、トークン消費量を最大88%削減し、精度を最大約7%向上させることができたとしています。本機能はGemini 3.7 Flash、Gemini 3.6 Flash、Gemini 3.5 Flash-Liteで利用可能です。


出典: Geminiが動画を自律的に分析する「Agentic Video Understanding」登場、文字起こしや再確認を繰り返して長時間動画を詳しく分析しつつ安価に回答を生成 - GIGAZINE(Google News: Gemini)