ライフスタイル

Hugging Face が Open TTS Leaderboard を公開:客観的指標で多言語音声合成と音声クローンを評価

Hugging Face は 2026 年 9 月 30 日、エラー率、速度、話者類似度などの客観的指標でオープンソースの音声合成(TTS)モデルを評価する Open TTS Leaderboard を発表し、試聴やストリーミング遅延の比較機能も提供した。その手法、限界、一般読者にとっての意味をまとめる。

読了目安 7 分

Hugging Face が Open TTS Leaderboard を公開:客観的指標で多言語音声合成と音声クローンを評価
画像:Mokaair (Original editorial artwork)

何が起きたのか

Hugging Face は 2026 年 9 月 30 日、公式ブログで Open TTS Leaderboard の公開を発表した。同社によると、同日時点で Hugging Face Hub 上には 8K を超える TTS モデルがあるが、評価方法は依然としてばらばらで標準化されていないという。

Hugging Face は、既存の TTS Arena v2、Artificial Analysis、Voice Arena などのアリーナ型リーダーボードについて、ユーザーが 2 つのモデルの出力から一方を選び、蓄積された投票から Elo スコア(対戦結果をもとに強さを数値化する方式)を算出して順位付けする方式だと指摘する。同社はこの方式ではモデルのリリースペースに追いつけないとし、2026 年 9 月 30 日時点で Artificial Analysis 上の 92 モデルのうちオープンウェイト(モデルの重みが公開されているもの)は 16 モデルにとどまると例を挙げている。

Hugging Face が Open TTS Leaderboard を公開:客観的指標で多言語音声合成と音声クローンを評価
Mokaair 編集検証フロー · 画像:Mokaair (Original editorial artwork)
詳しい説明を読む

情報源を収集し、独立検証を行ってから Jev が判断します。

リーダーボードの評価方法

  • 明瞭度:生成音声を Qwen3 ASR(音声認識モデル)で書き起こし、原文との単語誤り率(WER)または文字誤り率(CER)を算出する。
  • 速度:H200 GPU 上でバッチのオフライン推論における RTFx(逆リアルタイム係数、生成の速さを示す指標)を測定し、H200 GPU と CPU 上で最初の音声が出るまでの時間(TTFA)を測定する。
  • 話者類似度:WavLM の話者埋め込みを使い、生成音声と参照音声とのコサイン類似度(SIM)を算出する。

Hugging Face によると、デフォルト表示では Seed TTS Eval と CV3 Eval(zero shot)の英語部分における WER のマクロ平均(各データセットの結果を均等に平均した値)で順位付けされ、hexgrad/Kokoro-82M、Supertone/supertonic-3、fishaudio/s2-pro が上位に並ぶ。多言語では、同社は k2-fsa/OmniVoice、fishaudio/s2-pro、FunAudioLLM/Fun-CosyVoice3-0.5B-2512 の性能が高いとしている。中国語、日本語、韓国語は CER で算出される。

Hugging Face ブログの説明に基づく 2 つの評価方式の比較
観点アリーナ型リーダーボードOpen TTS Leaderboard
評価方式ユーザーが二択で投票し、Elo スコアを算出WER/CER、RTFx、TTFA、SIM などの客観的指標
評価に要する時間投票の収集に数週間程度(Hugging Face による)数時間程度(Hugging Face による)
オープンソースモデルのカバー範囲Artificial Analysis の 92 モデル中オープンウェイトは 16 モデル現在はオープンソースモデルに注力
自然さを反映できるか人間の好みを直接反映直接は測定できず、公式も人間の評価に代わるものではないとしている

試聴、音声クローン、ストリーミング遅延

「Voice cloning」オプションを有効にすると、音声クローンに対応したモデルを比較でき、SIM 列が表示される。Hugging Face によると、bosonai/higgs-tts-3-4b や openbmb/VoxCPM2 などのモデルは、参照音声を与えた場合に平均 WER が改善したという。

「Listen」タブでは、各モデルの実際の出力を試聴・比較し、フィードバックを送ることができる。Hugging Face はボット除外のため投票者に HF アカウントでのログインを求めており、将来的に投票データをリーダーボードに反映する可能性があるとしている。

「Streaming」タブは TTFA で順位付けされる。Hugging Face によると、各モデルはバッチサイズ 1、同一の 50 件の CV3-Eval 英語プロンプトとデフォルト音声で実行され、最初の 3 回のウォームアップを除いた中央値が採用される。非ストリーミングモデルは文全体の生成完了までの時間で計算される。同社は kyutai/pocket-tts が GPU と CPU の両方でストリーミング性能に優れているとしている。

一般読者にとっての意味

音声アシスタント、オーディオブック、読み上げツールを使う一般の人にとって、こうしたリーダーボードは、オープンソース音声モデルが「正確に読めるか、応答が速いか、元の声に似ているか」を比較しやすくするものだ。ただし Hugging Face 自身も、これらの数値は自然さや聞き心地の良さとイコールではないと強調しており、実際の印象は試聴して判断すべきだ。

よくある質問

Open TTS Leaderboard とは何ですか?

Hugging Face が 2026 年 9 月 30 日に発表したリーダーボードで、客観的指標によってオープンソースの多言語音声合成および音声クローンモデルを評価します。

人間の投票によるリーダーボードに取って代わるのですか?

いいえ。Hugging Face によると、WER や話者類似度では自然さ、表現力、聞き手の好みを直接測れないため、人間の好みに基づくランキングに代わるものではありません。ただし、投票型リーダーボードが評価対象のモデルを選ぶ手助けにはなるとしています。

英語で性能が高いモデルは、中国語でも必ず高いのですか?

必ずしもそうではありません。Hugging Face は英語での性能が他言語にそのまま当てはまるとは限らないとしており、リーダーボードでは複数言語のランキングを切り替えられます。中国語、日本語、韓国語は文字誤り率で算出されます。

TTFA とは何で、なぜ重要なのですか?

TTFA はリクエストを送ってから最初の音声が再生可能になるまでの待ち時間を指します。Hugging Face は、音声エージェントなどの対話型アプリケーションにとって重要だとしています。

評価プログラムは公開されますか?

Hugging Face は評価スクリプトを近くオープンソース化し、コミュニティが GitHub の Issues や PR を通じて意見を寄せられるようにするとしていますが、具体的な日程はまだ発表されていません。

このトピックの最新ニュースを見る

最新の旅の情報・ガイド

出典

ライフスタイル