Google amplió la familia Gemini Audio con los nuevos modelos Gemini 3.5, mejorando la conversión de comandos de voz a texto. Esta actualización ofrece una función de transcripción que elimina automáticamente las palabras de relleno en el habla y permite editar el texto únicamente mediante la voz.

El nuevo Gemini 3.5 Transcribe reconoce más de 85 idiomas, conserva los términos técnicos mediante un diccionario personalizable y distingue hasta tres hablantes simultáneamente, añadiendo marcas de tiempo a nivel de palabra. Google indica que este modelo ofrece una tasa de error de palabras mucho menor y un rendimiento multilingüe superior al del anterior Chirp 3.

La aplicación está disponible hoy en la app Gemini para macOS en inglés y, en Android, en los países seleccionados mediante la función de dictado Rambler; los desarrolladores pueden acceder a una vista previa a través de Gemini API. Sin embargo, Gemini 3.5 Pro aún se espera que se lance con retraso en junio y la integración con Chrome no ha sido anunciada.