青い光を帯びた多層ニューラルネットワークの抽象ビジュアル
NAW / MODELS 01

IMAGE: AI生成ビジュアル

MODELS / MODELS

Googleが「Gemini 3.8 Flash TTS/Flash-Lite TTS」を発表 — 自然文で声を設計、Hume評価で1〜2位

Googleは2026年9月23日、音声生成モデル「Gemini 3.8 Flash TTS」と「Gemini 3.8 Flash-Lite TTS」を発表した。自然言語プロンプトで100超の言語・方言の声を新規設計でき、30秒サンプルからの声の複製、行単位の演技指示、二話者対話の演出に対応する。Hume AIの音声評価で総合1〜2位と説明している。

Googleは2026年9月23日、Geminiファミリーの新しい音声生成モデル「Gemini 3.8 Flash TTS」と「Gemini 3.8 Flash-Lite TTS」を発表した。固定のプリセットから声を選ぶ方式から、自然言語の指示で声そのものを設計する「ボーカルスタジオ」への転換と位置づけている。以下は同社公式ブログの記載内容の整理であり、評価数値はすべてベンダー公表値である。

2モデル構成 — 創作用のFlashと大量処理用のFlash-Lite

  • Gemini 3.8 Flash TTS: 深い創作指示とキャラクター設計向け。自然言語プロンプトで役割・アクセント・声質を指定し、100超の言語・方言で全く新しい声を生成できる。ゲーム、没入型オーディオブック、ポッドキャスト、対話メディアを想定
  • Gemini 3.8 Flash-Lite TTS: 大量の吹き替え、音声コンテンツ制作、表現力のある音声エージェント向けに最適化した高効率版。声調・ペース・表現の微妙な制御は維持しつつ高ボリューム処理に対応する
  • 2,000超の実運用可能な声のライブラリ: メキシコスペイン語、ケベックフランス語、スコットランド英語などの地域バリエーションを含む。ライブラリの声を選んで音色・高さ・速度・アクセントを微調整する「リミックス」は近日提供予定
  • 声の複製: 権利を持つ本人の30秒の音声サンプルから一貫した声のプロファイルを再現できる。参照話者と一致する所有者の口頭同意の録音を必須とする同意確認、SynthID透かし、C2PA認証情報を備える
  • 既存のGemini Audioファミリー(3.5 Live Translate、3.5 Transcribe、3.8 Live、3.8 Live Extended Thinking)に続く追加である

行単位の演出指定 — 二話者対話と発声の質感まで制御

  • 行ごとの演技指示: 自分でト書きを書くか、Geminiに台本の合図から読み取らせる形で、落ち着いた客服エージェントからささやくサスペンス場面まで1行単位で指示できる
  • 長尺生成: 数時間の連続音声でも声質・自然なペース・話者の一貫性を維持し、話者ドリフトを最小化。ポッドキャストやオーディオブック向けとしている
  • 二話者シーンのネイティブ対応: ポッドキャストやドラマの台本を1つのスクリプトから演出でき、2つの声を分離したまま自然な受け答えを保つ
  • 発声バーストと相づち: <laughs>(笑い)、<sigh>(ため息)、<gasp>(息をのむ)などの非言語合図や、|mhm|・|yeah|といった相づち挿入で会話の質感を付与できる

動画出典: Gemini 3.8 text-to-speech says hello(公式ブログ掲載動画)

ベンダー公表評価 — Hume AIで1〜2位、Voice Arenaでも上位と主張

  • 数値はいずれもGoogleの公表値で、独立した検証ではない。以下は公式ブログが引用する第三者評価の結果である
  • Hume AI Overall Quality Index(総合品質): Flash TTSが1位、Flash-Lite TTSが2位

Hume AIの総合品質評価チャート(Gemini 3.8 Flash TTSが1位、Flash-Lite TTSが2位と表示)

出典: Gemini 3.8 text-to-speech says hello - Google

  • Hume AI Voice Design Benchmark(声の設計): Flash TTSが71.4で総合1位、アクセントモデリングでも60.8で首位

Hume AIの音声設計リーダーボード(Gemini 3.8 Flash TTSが71.4で1位)

出典: Gemini 3.8 text-to-speech says hello - Google

  • Voice Arena(ブラインド方式の人手選好評価): Flash/Flash-Lite TTSが日本語、ブラジルポルトガル語、ベトナム語、現代標準アラビア語、メキシコスペイン語、ヒンディー語などの主要言語で競合中の上位を確保

Voice Arenaのリーダーボード(Gemini 3.8 Flash/Flash-Lite TTSが上位と表示)

出典: Gemini 3.8 text-to-speech says hello - Google

  • 前世代比較: 長尺コンテンツや二話者台本制御など幅広い用途でGemini 3.1 Flash TTSから大幅に改善したとしている。100超の言語対応で多言語の高品質音声体験を構築できると説明している

提供形態と安全対策

  • 提供開始(2026年9月23日から順次): 開発者向けにGemini APIとGoogle AI Studio、企業向けはGemini EnterpriseのAPIで近日提供、一般向けはGemini Notebook(Flash)とGoogle Vids(Flash-Lite)で利用できる
  • AI Studioの音声プレイグラウンド: 声の新規設計や自分の声の複製から、二話者台本エディタでの行単位演出まで試せる音声設計ワークスペースを用意。AI Studio経由の声の複製はイリノイ・テキサス・EEA・英国・スイス・インドでは利用できない
  • 開発基盤連携: Agora、LiveKit、Pipecat、Vercelなどの開発プラットフォーム経由で利用でき、Figma、HeyGen、Linguana、Wondercraft、99.co、Ollangなどが吹き替えの高速化や地域アクセントのローカライズ、音声エージェントに組み込むとしている
  • 安全対策: 声の複製には同意確認を必須化し、生成音声の全クリップに知覚困難なSynthID透かしを埋め込んでAI生成音声の検出可能性を確保する。詳細はモデルカード参照としている

出典