身体の動きを位置座標として読み取り、英語の文章へ翻訳するAIが、スマートフォンの入力機能に組み込まれた。手話翻訳モデルSL2Tは、Pixel 11のGboardとLive Transcribeで米国手話の入力に対応する。
手と顔の動きを端末で座標に変える
手話翻訳AIのSL2Tを開発したGoogle DeepMindは、手話を独自の文法と語彙を持つ言語として扱っている。意味を伝えるのは手だけではなく、腕、胴体、頭、顔の同時の動きであり、翻訳にはそれらの動きを読み取る処理が必要になる。
その入力を作るのが、端末上で動く身体追跡モデルのMediaPipe Holisticだ。身体上の点の位置を追跡し、カメラ映像を幾何学的な座標列へ変換する。翻訳サーバーへ送るのはこの座標だけで、元の動画は直ちに破棄できる構成になっている。
中間注釈を介さず座標列から文章を生成
サーバー側のSL2Tは、受け取った座標列からテキストを逐次出力する。従来の手話翻訳研究で広く使われてきたglossesと呼ばれる中間注釈を介さず、身体の動きから直接文章へ翻訳する方式を採る。
Google DeepMindは、中間注釈では手以外の動きによる表現や、空間を使った構文を十分に表せないと説明している。座標列から直接翻訳する方式は、その注釈で定めた語彙による制限を取り除くという。
50超の手話言語で学習し、米国手話の翻訳を評価
この直接翻訳を学習するため、SL2Tには50を超える手話言語の10万時間を超えるデータを使った。米国手話(ASL)は全体の約4分の1を占める。Google DeepMindの実験では、多様な言語、方言、習熟度を共同で学習するモデルが、単一言語のモデルを上回った。
米国手話から英語への翻訳品質を測るベンチマークFLEURS-ASLのsd-testでは、ゼロショット評価でBLEURTスコア70を得た。この数値はGoogle DeepMindによる評価結果であり、翻訳例には速い指文字による単語の取り違え、描写の一部の脱落、文脈がない場合の時制の誤りも残っている。
翻訳した英語を文字入力と会話応答に使う
Google DeepMindは、SL2TをスマートフォンPixel 11のキーボードアプリGboardと、会話の文字起こしアプリLive Transcribeに導入した。利用できる翻訳方向は米国手話から英語で、Gboardでは手話を検索やメッセージ、文書の作成に使える。翻訳した英語を、AIアシスタントGeminiへの問い合わせや作業の指示として入力することもできる。
Live Transcribeでは、会話中の応答を文字で打つ代わりに手話で入力できるようになった。手話の動きから得た座標列を英語の文章に変換する処理が、文字入力だけでなく会話への応答にも組み込まれている。