NAW / PRODUCTS 03
IMAGE: AI生成ビジュアル
PRODUCTS / Gemini Live Avatar
Google、Gemini 3.8 Liveに話す顔「Live Avatar」 — 企業向けに提供開始、97言語で口の動きも同期
Googleは2026年9月24日、リアルタイム音声対話モデルGemini 3.8 Liveに映像の存在感を加える「Live Avatar」を発表した。低遅延の動画生成と発話を組み合わせ、精密なリップシンクと自然な表情、途切れない受け答えをうたう。Gemini Enterpriseで本日から提供し、カスタムアバターは許可制で対応する。
Googleは2026年9月24日(DeepMindブログ掲載)、リアルタイム音声対話モデル「Gemini 3.8 Live」に視覚的な存在感を加える機能「Gemini 3.8 Live with Live Avatar」を発表した。先週のGemini 3.8 Live発表に続くもので、対話音声と低遅延ストリーミング動画を組み合わせ、聞き・見て・話す視覚ペルソナで応答する企業向け機能と位置づけている。Gemini Enterpriseで本日から利用できる。以下は同社公式ブログの整理である。
会話体験 — 見る・聞く・話すを同時処理する映像付き対話
- 映像の存在感: 準リアルタイムの動画生成と発話を組み合わせ、精密なリップシンク、自然な表情、滑らかなターンテイク(話者交代)で応答するとしている。カスタマーサービスや操作案内など、対話に視覚的要素が有効な接客・説明用途を想定している
- マルチモーダル同時処理: 視覚入力と音声入力を同時に処理し、見たもの・聞いたものを踏まえた応答を準リアルタイムで返すと説明している。プリセットのキャラクター群(見た目・声・表現が異なる複数種)から選べる
- 途切れない実行: 非同期ツール呼び出しに対応し、裏側でツール実行やデータ取得を進めながら会話を継続できる。ホテルのチェックイン受付を例に、複雑な処理中も対話が止まらない流れを紹介している
- 97言語対応: 音声間(speech-to-speech)の多言語同期を備え、会話途中の言語切替にリップシンクと表情が追従する。97言語間で映像品質の劣化や視覚ドリフトなく切り替えられるとしている(同社公称)
導入形態 — プリセット+カスタム、企業ブランド向けの作り分け
- 提供先: Gemini Enterpriseで本日から提供。開発者はAPIドキュメントからの利用開始が案内されている
- プリセット: 多様なプリセットアバターのライブラリを用意し、用途に応じて選択できる
- カスタムアバター: 高品質な参照画像から、見た目やブランド様式・キャラクター性を保ったまま fully animated な応答アバターを生成できるとしている。カスタム作成は現在、企業の許可制(allowlisting)でのみ提供される
- 透明性・安全性: AI生成の音声・映像出力にはすべてSynthIDの透かしを埋め込み、AI生成物の検出可能性と誤情報・誤帰属の低減を図るとしている。包括的な安全対策と責任ある展開の詳細はモデルカードの参照が案内されている