NAW / MODELS 01
IMAGE: AI生成ビジュアル
MODELS / Gemini 3.8 Live
Google、音声対話モデル「Gemini 3.8 Live」と「3.8 Live Extended Thinking」を発表 — Speech-to-Speech品質で首位
3.8 Liveは規模とコスト効率に最適化した流暢な対話モデル、Extended Thinkingは複雑な多段階タスク向けの高知能モデル。後者はArtificial AnalysisのSpeech-to-Speech Quality Indexで82.6の全体首位、エージェント作業完了でも首位としている。Gemini API・AI Studioで本日から提供開始。
Google DeepMindは2026年9月15日(米国時間)、リアルタイム音声対話モデル「Gemini 3.8 Live」と「Gemini 3.8 Live Extended Thinking」を発表した。いずれも開発者・企業向けの音声エージェント基盤と、Geminiアプリ・Google Workspace・Searchでの会話体験の両方に向けたモデルで、Gemini APIとGoogle AI Studioでは本日から利用できる。
2モデルの位置づけと評価結果
- Gemini 3.8 Live: 規模展開とコスト効率に最適化。会話知能と流暢な対話、視覚グラウンディングを組み合わせたモデルと説明されている。ユーザー選好のSpeech Agent Arenaで2位を獲得しつつ、コスト効率の高さを売りにする。
- Gemini 3.8 Live Extended Thinking: 複雑なタスク向けに知能と多段階推論を強化したモデル。Artificial AnalysisのSpeech-to-Speech Quality Indexで82.6を取り全体首位、エージェント作業完了率でτ-Voice 68.6%、Sierraのτ-Voice-banking 35.1%で首位、Big Bench Audioで97.7%としている(いずれも同社公称値)。
- EVA-Bench(ServiceNowの音声エージェント評価): 両モデルは正確性と会話品質のバランスでパレートフロンティアを押し上げたとしている。なお同測定はGemini Enterprise Agent Platform上のLive APIで実施したとの注記がある。
出典: Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking — Google DeepMind
出典: Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking — Google DeepMind
出典: Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking — Google DeepMind
会話機能 — 97言語、映像入力、止めない実行
- リアルタイム映像入力: 3.8 Liveは視覚入力をほぼリアルタイムで処理し、会話に文脈を付与する。オンボーディング支援やチェスの実演などが例示されている。
- 97言語の自動切替: 会話の途中で言語を自動検出して切り替える。対応言語数は97としている。
- バックグラウンドでのツール実行: ツール呼び出しやAPI実行を裏側で進めながら会話を継続できる。要求を受け止めて話し続け、処理が終わり次第結果を返す形になる。
- Extended Thinkingの同時進行: 推論と発話を同時に行い、「Let me check that…(確認しますね)」のような early verbal cue や進捗の実況で多段階タスクの進行を伝える。
提供形態とエコシステム
- 開発者向け: Gemini APIとGoogle AI Studioで本日から提供。Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel、Vision Agentsといった開発プラットフォーム経由でも利用できる。
- 企業向け: Gemini Enterpriseでプライベートプレビュー。Gemini Enterprise for Customer Experienceには近日対応予定(Extended ThinkingはWorkspaceのビジネス顧客にも対応予定)。
- 一般向け: 3.8 LiveはSearch Liveに展開。Extended ThinkingはGemini Liveのほか、WorkspaceのDocs(Google AI Pro・Ultra契約者)、Gmail・Keep(全AI契約者)に展開される。
- 企業導入例: Salesforce、Genspark、Lumerisがレイテンシや流暢さ、ツール呼び出しを評価していると紹介されている。
- 安全性: AI生成の音声にはすべてSynthIDの透かしを埋め込むとしている。詳細はモデルカードを参照するよう案内している。