IMAGE: AI生成ビジュアル
MODELS / MODEL WATCH
Google DeepMind、手話→テキスト翻訳モデル「SL2T」を発表 — Pixel 11のGboard/Live Transcribeに初搭載
50以上の手話言語・10万時間超のデータで学習した多言語翻訳モデル。ASL→英語の手話入力として消費者プロダクトに初めて搭載。プライバシー配慮の設計で、骨格ランドマークの座標のみをサーバーへ送信する。
Google DeepMindは2026年8月12日、手話からテキストへ翻訳するモデル「SL2T」(sign-language-to-text)を発表した。世界には200以上の手話言語があり、推定7,000万人のろう・難聴者が使うとされる。SL2Tは手話AIを研究所から消費者プロダクトへ初めて持ち込んだとされ、Pixel 11のGboardとLive TranscribeでASL(アメリカ手話)→英語の手話入力機能として提供が始まった。追加デバイス・追加言語は今後対応予定で、利用は追加費用なし。開発はGoogle DeepMindとAndroidチームの共同作業による。
手話翻訳が難しい理由とSL2Tの設計
音声の書き起こしと異なり、手話は独自の文法と語彙を持つ独立した自然言語だ。このため「手話→単語」の逐次変換ではなく、本格的な機械翻訳が必要になる。さらに、手・腕・胴体・頭・顔の同時的な動きを高フレームレートで追跡する、計算負荷の高いコンピュータビジョンタスクでもある。
- 10万時間超・50以上の手話言語(うち約4分の1がASL)のデータで学習
- 複数の言語・方言・習熟度を同時に学習することで共通の基盤構造を獲得し、単一言語モデルを上回ったとGoogleは報告
- 先行研究で広く使われる中間注釈「gloss」を介さず、ランドマーク座標から直接テキストへ翻訳する設計
- 手話言語の非線形的な要素(非手指標識や空間構築など)をglossが捉えきれない問題を回避する狙い
プライバシーを優先した入力設計
SL2Tは利用者のプライバシー保護を重視した設計を採る。モデルは生のカメラ映像を見るのではなく、手話の動きを骨格ランドマークの位置の系列として処理する。
- 端末上のMediaPipe Holisticが話者の身体上の点を追跡し、座標データのみをサーバーへ送信
- 元の映像は即座に破棄されるため、部屋の様子や周囲の人物など手話以外の情報がサーバーに届かない
- 手話を「見る」ことと「翻訳する」ことを分離したプライバシーバイデザインの構成
評価と実用化への取り組み(Google公称値)
Googleによると、SL2Tは主要ベンチマークでこれまでで最も高性能な手話翻訳モデルとされる。一方で、ベンチマークの最適化だけでは実用にならないとして、実際の利用で重要になる問題への対応も進めている。
- FLEURS-ASL(sd-test、ASL→英語の翻訳品質評価)でゼロショットBLEURT 70を記録し、「過去に報告されたどのスコアよりも大幅に高い」(Google説明)
- ストリーミング遅延の最小化、手話以外の入力に対する幻覚(ハルシネーション)防止
- 手話話者の約10%を占める左利き話者への公平性、スマートフォンを片手に持つ状況で使われる片手話への性能改善
- ろうコミュニティとの共創:ろうのGoogle社員Sam Sepahが構想段階から参加し、ろうのパートナーとのデータ収集・評価を実施
- 国際的なろう団体や専門家を集めた「AI手話諮問委員会(AISLAC)」を設置し、SL2T 1.0のリリースに際して能力と限界を記した共同インパクトレポートを公表
- 今後の計画は、追加の手話言語、手話生成(sign language generation)、フロンティアAI機能への拡張
なお、BLEURT 70という数値はGoogleが公表するベンチマーク結果であり、独立した再現評価は今後を待つ必要がある。手話翻訳の品質は言語や話者によってばらつく可能性があり、実利用での評価が積み重なる段階といえる。
出典: Google DeepMind公式ブログ「Putting sign language AI into users’ hands」(2026-08-14確認)。