計算ノードの中心に浮かぶ青い推論コアの抽象ビジュアル
NAW / MODELS 01

IMAGE: AI生成ビジュアル

MODELS / Models

Googleが音声会話モデル「Gemini 3.8 Live」と「Live Extended Thinking」を発表 — 非同期ツール実行と97言語対応

Googleがリアルタイム音声対話モデル2種を9月15日に発表。会話を続けながら裏側でAPI・ツール実行を行う非同期function calling、映像のリアルタイム接地、97言語の自動切替が特徴。Extended Thinkingは複雑な多段階推論向けで、Artificial Analysisの音声対話ランキング1位をうたう。

Googleは2026年9月15日、リアルタイム音声対話モデル Gemini 3.8 Live と Gemini 3.8 Live Extended Thinking を発表した。同社の説明では、従来のLiveモデルからの大きな前進(step-change)であり、カスケード型構成に代わる効率的な選択肢として、音声エージェントの本番利用に向けた構成要素と位置づけられている。以下は公式ブログの発表内容の整理であり、性能の独立した検証を示すものではない。

2モデルの位置づけ — 効率型と高難度推論型

  • Gemini 3.8 Live: 規模展開とコスト効率向け。会話知能と流暢な対話、映像による接地を組み合わせると説明されている。
  • Gemini 3.8 Live Extended Thinking: 高難度タスク向け。知能を高め、多段階の推論を行う。発表によれば、第三者の音声対話評価であるArtificial AnalysisのSpeech-to-Speechリーダーボードで1位としている(Googleの公称であり、本記事で独立に検証したものではない)。
  • 設定可能な思考: 複雑な多段階推論を裏側で扱うための設定可能な思考(configurable thinking)に対応し、表の会話では応答や進捗の実況を続けながら処理すると説明されている。

会話を止めない実行と多言語・映像対応

  • 非同期function calling: APIやツール呼び出しをバックグラウンドで実行しながら、音声応答のストリーミングを続ける。要求を受け付けたことを伝え、処理完了後に結果を返す使い方が想定されている。
  • 映像コンテキスト: ライブの映像入力をほぼリアルタイムに処理し、会話に応用する。目に見える状況を踏まえた応答が可能になると説明されている。
  • 97言語対応: 97以上の言語に対応し、会話の途中で言語を自動検出して切り替えるとしている。
  • 逐次コンテンツ更新: リアルタイム音声と構造化データを組み合わせ、文脈に応じた応答を返す仕組みが説明されている。
  • 開発者向けの案内では、関連する書き起こし用途として 3.5 Transcribe(85以上の言語に対応し、整形・言い淀み除去を備えた転写モード)にも触れられている。

提供形態 — APIからアプリ・企業向けまで

  • 開発者向け: Gemini APIとGoogle AI Studioで提供される。
  • 企業向け: Gemini Enterpriseでプライベートプレビューとして提供され、Gemini Enterprise for Customer ExperienceやWorkspaceの法人顧客向けにも順次提供予定とされている。
  • 一般向け: GeminiアプリのGemini LiveやSearch Liveなどで順次展開され、WorkspaceのDocs・Gmail・Keepでは購読プラン(Google AI Pro・Ultraなど)に応じて利用できると案内されている。
  • 料金や利用上限などの詳細条件は変更される可能性があるため、導入時はAPI・Workspaceの最新の公式記載の確認が必要だ。

出典