Googleは、50以上の手話で10万時間以上のデータを用いて開発したSL2Tモデルで、複雑な身体動作をテキストに変換できる。この技術はGboardとLive Transcribeに新機能を提供する。ユーザーは、ウェブ検索やメッセージ・文書の作成、GoogleのGeminiとのやり取りを、文字入力ではなく手話で行えるようになる。

SL2Tモデルは、手話翻訳をコンピュータビジョン問題と翻訳問題の両方として捉えている。GoogleのMediaPipe Holistikモデルは、手話者の動きを構造化された表現に変換するために使用される。

システムは映像ストリームではなく、手話者の手・顔・身体の動きの幾何学的座標を示すだけである。これらの座標だけが翻訳システムに送られ、元の映像は即座に削除される。このアプローチにより、デバイスから出る感覚的映像情報の量が削減され、同時にモデルが手話の動作を学習しやすくなる。