Google, 50’den fazla isaret dilinde 100.000’den fazla saatlik veriyi kullanarak gelistirdigi SL2T modeli, komplex vucut hareketlerini metne cevirebiliyor. Bu teknoloji, Gboard ve Live Transcribe’da yeni ozellikler sunuyor. Kullanıcılar artik web’i aramak, mesaj ve belgeler yazmak ya da Google’in Gemini’yle etkilesime girmek icin yazmak yerine isaret edebiliyorlar.

SL2T modeli, isaret dili cevirisini hem bir bilgisayar gorusel problemi hem de bir dil ceviri problemi olarak ele aliyor. Google’in MediaPipe Holistik modeli, isaretcinin hareketlerini yapilandirilmis bir temsile cevirmek icin kullaniliyor.

Sistem, video akisini degil, ancak isaretcinin el, yuz ve vucut hareketlerinin geometrik koordinatlarini gosterebiliyor. Sadece bu koordinatlar ceviri sistemine gonderiliyor, asil video ise hemen silinebiliyor. Bu yaklasim, cihazdan cikan duyarli gorsel bilgilerin miktarini azaltmaya ve ayni zamanda modelin isaretlerin nasil yapildigini ogrenmesine yardimci oluyor.