GoogleはGeminiモデルに「エージェンシー型動画理解」機能を追加した。Gemini 3.7 Flash、3.6 Flash、3.5 Flash-Liteは、動画をフレームごとに分割する代わりに、どの部分を視聴し、どの速度で処理するかを自ら判断して分析できる。機能は現在、Gemini APIおよびGoogle AI Studioで提供されている。
新手法はトークン使用量を最大88%削減し、精度を最大7%向上させる。Geminiは長時間動画における秒単位の変化を検出し、物理的な動きをカウント・追跡し、視覚的アーティファクトを解析し、音声、文字起こし、フレームのいずれかを選択して複雑な質問に答えることができる。
この機能はまだGeminiアプリやYouTubeの「Ask YouTube」機能には統合されておらず、Googleは「近日中」に統合されると述べている。現在の利用は開発者および企業向けプラットフォームユーザーに対し、API経由でのみ提供されている。
