NAW / PRODUCTS 03
IMAGE: AI生成ビジュアル
PRODUCTS / Products
DeepL Voiceが話者の声色を保ったままリアルタイム翻訳へ — 新Voiceモデルと桌面アプリ、音声間翻訳をGA化
DeepLは9月15日、新しいVoiceモデル群を発表。複数話者の声の個性・抑揚・ペースを保ったまま12言語で音声保存する声質保持に対応し、音声サンプルの保存や声紋プロファイルの作成は行わないと説明。Zoom・Teams・Meet横断のWindows/Mac桌面アプリと、オンライン会議向け音声間翻訳の一般提供も開始した。
DeepLは2026年9月15日(最終更新日の表記による)、リアルタイム音声翻訳「DeepL Voice」の新しいVoiceモデル群を発表した。訳文の正確さに加え、話者ごとの声の個性や抑揚、話すペースを保ったまま他言語の音声として生成する。以下はDeepL公式ブログの発表内容の整理であり、性能の独立した検証を示すものではない。
新Voiceモデル — 声の個性と抑揚を保ったまま訳出
- 声質の保持: 同一の合成音声ではなく、話者ごとに異なる声として認識できる形で訳出する。疑問文の抑揚や喜び・ためらい・強調・切迫感といった要素も反映されると説明されている。
- 対応範囲: オンライン会議、対面会話、Voice APIのすべてに新モデルを適用する。声質保持は当初12言語で提供し、今後拡大するとしている。
- データの扱い: 音声サンプルを保存したり、後利用のための声紋プロファイルを作成したりせずにリアルタイムで処理するため、データは安全に保たれると説明している。
- 正確さの主張: DeepLによれば、Slatorによる独立テストでDeepL Voiceの翻訳誤り率は4%、Microsoft Teams・Google Meet・Zoomの平均17%だったとしている(DeepLの公称であり、本記事で独立に検証したものではない)。
桌面アプリと音声間翻訳 — 会議ツール横断の一貫した体験
- 桌面アプリ: Windows・Mac向けのDeepL Voice桌面アプリを提供開始。Zoom・Microsoft Teams・Google Meetを自動検出してワンクリックで翻訳する。会議ツールごとに実装を待たずに新機能を直接展開できるとしている。
- 利用形態: カスタマイズ可能なオーバーレイ字幕での読み取り、音声翻訳の聴取、両者の切り替えに対応する。
- 音声間翻訳のGA化: オンライン会議向けの音声間(voice-to-voice)翻訳が一般提供になった。対面会話とVoice APIに続くもので、ブラウザ経由で外部参加者が使う方式はベータのまま。