Google ha añadido la capacidad de 'comprensión de video agente' a los modelos Gemini. Gemini 3.7 Flash, 3.6 Flash y 3.5 Flash-Lite ahora pueden analizar videos decidiendo qué partes observar y a qué velocidad procesarlas, en lugar de dividirlos fotograma a fotograma. La función está disponible actualmente a través de la API de Gemini y Google AI Studio.

El nuevo método reduce el uso de tokens hasta en un 88% y aumenta la precisión hasta en un 7%. Gemini ahora puede detectar cambios segundo a segundo en videos de muchas horas, contar y rastrear movimientos físicos, examinar artefactos visuales y responder preguntas complejas eligiendo entre audio, transcripción o fotogramas.

La función aún no se ha integrado en la aplicación de Gemini ni en la función 'Ask YouTube' de YouTube; Google indica que esta integración llegará 'pronto'. El acceso actual se proporciona únicamente a desarrolladores y usuarios de plataformas empresariales a través de la API.