ElevenLabs lanzó el lunes sus nuevos modelos de voz de última generación, v4 y v4 Turbo.

La empresa afirma que la nueva arquitectura permite la clonación de voz con solo 10 segundos de grabación de audio y que el soporte de idiomas se ha ampliado de 70 a 90, observando las mayores mejoras de calidad en japonés, portugués de Brasil, mandarín y cantonés.

Los modelos mantienen mejor la identidad del hablante en textos largos al preservar el contexto textual y, gracias a la capacidad de apilar etiquetas de expresión (stacking), ofrecen entonaciones emocionales secuenciales.