Google, con más de 50 lenguas de señas y más de 100.000 horas de datos, ha desarrollado el modelo SL2T, que puede convertir movimientos corporales complejos en texto. Esta tecnología ofrece nuevas funciones en Gboard y Live Transcribe. Los usuarios ahora pueden buscar en la web, redactar mensajes y documentos o interactuar con Gemini de Google mediante señas en lugar de escribir.

El modelo SL2T aborda la traducción de lengua de señas tanto como un problema de visión por computadora como de traducción lingüística. El modelo MediaPipe Holistik de Google se utiliza para convertir los movimientos del intérprete en una representación estructurada.

El sistema no muestra la transmisión de video, sino que puede presentar las coordenadas geométricas de los movimientos de mano, rostro y cuerpo del intérprete. Solo esas coordenadas se envían al sistema de traducción, mientras que el video original se elimina de inmediato. Este enfoque reduce la cantidad de información visual sensible que sale del dispositivo y, al mismo tiempo, ayuda al modelo a aprender cómo se realizan las señas.