研究データと神経構造が融合した青い抽象ビジュアル
NAW / RESEARCH 04

IMAGE: AI生成ビジュアル

RESEARCH / Evaluation

Hugging FaceがOpen TTS Leaderboard公開 — 多言語TTSと声クローンを客観指標で拡張評価

Hugging Faceがテキスト音声合成モデル向けの客観評価リーダーボード「Open TTS Leaderboard」を公開。Qwen3 ASRによる了解度、H200上のRTFx/TTFA速度、WavLM話者類似度で評価し、英語・多言語・声クローン・ストリーミングの4軸で比較できる。

Hugging Faceは2026年9月30日、テキスト音声合成(TTS)モデル向けの新しい評価リーダーボード「Open TTS Leaderboard」を公開した。TTSの評価はMOSやMUSHRAといった人手評価、TTS Arena v2やArtificial Analysis、Voice Arenaといった投票型アリーナに依存してきたが、投票収集に数週間かかり、オープンウェイトモデルの掲載が少ないという課題があった。新リーダーボードは客観指標による自動評価で、モデルの評価を「数週間から数時間」に短縮するとしている。

Open TTS Leaderboardの英語評価テーブル

出典: Open TTS Leaderboard: Scalable Evaluation for Multilingual Text-to-Speech and Voice Cloning | Hugging Face

3つの客観指標と評価データセット

  • 了解度(Intelligibility): プロンプトと生成音声の書き起こし間の単語・文字誤り率(WER/CER)。書き起こしにはQwen3 ASR(Open ASR Leaderboardでトップのオープンソースモデル)を使用。
  • 速度(Speed): H200 GPU上のバッチ推論の逆リアルタイム係数(RTFx)と、ストリーミング遅延を示す初回音声到達時間(TTFA、H200 GPUとCPUで計測)。
  • 話者類似度(Speaker similarity): 生成音声と参照クリップのWavLM話者埋め込み間のコサイン類似度(SIM)。
  • 評価データ: 英語の既定ランキングはSeed TTS EvalとCV3 Eval(zero shot)の英語分割におけるマクロ平均WERで決定。英語トップはhexgrad/Kokoro-82M、Supertone/supertonic-3、fishaudio/s2-proと記載されている。
  • 位置づけ: ASRベースのWERは了解度の代理指標であり、自然さや表現力を直接測るものではないとして、人手評価を置き換えるものではないと明記している。

多言語・声クローン・ストリーミングの4軸比較

  • 多言語: 英語の性能は他言語の代理にならないとして、言語切り替えで多言語性能をランク付け。中国語・日本語・韓国語は文字ベース言語のためCERを報告。k2-fsa/OmniVoice、fishaudio/s2-pro、FunAudioLLM/Fun-CosyVoice3-0.5B-2512が多言語で強いとしている。
  • 声クローン: 対応モデルに絞った比較が可能で、SIM列とParetoプロットが追加表示される。bosonai/higgs-tts-3-4bやopenbmb/VoxCPM2は参照音声ありで平均WERが改善するという。
  • ストリーミング: TTFAでランク付けし、同一50プロンプト・バッチサイズ1・同一ハードウェア・既定音声の条件で中央値を報告。kyutai/pocket-ttsがGPU・CPU双方で優れると記載されている。
  • 試聴と投票: Listenタブで指標の裏にある生成音声を実際に比較でき、HFアカウントでログインして投票できる。将来的に投票データの取り込みも検討するとしている。

評価スクリプトはOpen ASR Leaderboardのリポジトリ同様に近日オープンソース化し、GitHubのIssueやPRでコミュニティからの提案を受け付ける方針だ。TTSモデルの選定や多言語対応の検討材料として使える公開リソースである。

出典