ライフスタイル
Hugging Face が Open TTS Leaderboard を公開:客観的指標で多言語音声合成と音声クローンを評価
Hugging Face は 2026 年 9 月 30 日、エラー率、速度、話者類似度などの客観的指標でオープンソースの音声合成(TTS)モデルを評価する Open TTS Leaderboard を発表し、試聴やストリーミング遅延の比較機能も提供した。その手法、限界、一般読者にとっての意味をまとめる。
読了目安 7 分

何が起きたのか
Hugging Face は 2026 年 9 月 30 日、公式ブログで Open TTS Leaderboard の公開を発表した。同社によると、同日時点で Hugging Face Hub 上には 8K を超える TTS モデルがあるが、評価方法は依然としてばらばらで標準化されていないという。
Hugging Face は、既存の TTS Arena v2、Artificial Analysis、Voice Arena などのアリーナ型リーダーボードについて、ユーザーが 2 つのモデルの出力から一方を選び、蓄積された投票から Elo スコア(対戦結果をもとに強さを数値化する方式)を算出して順位付けする方式だと指摘する。同社はこの方式ではモデルのリリースペースに追いつけないとし、2026 年 9 月 30 日時点で Artificial Analysis 上の 92 モデルのうちオープンウェイト(モデルの重みが公開されているもの)は 16 モデルにとどまると例を挙げている。
詳しい説明を読む
情報源を収集し、独立検証を行ってから Jev が判断します。
リーダーボードの評価方法
- 明瞭度:生成音声を Qwen3 ASR(音声認識モデル)で書き起こし、原文との単語誤り率(WER)または文字誤り率(CER)を算出する。
- 速度:H200 GPU 上でバッチのオフライン推論における RTFx(逆リアルタイム係数、生成の速さを示す指標)を測定し、H200 GPU と CPU 上で最初の音声が出るまでの時間(TTFA)を測定する。
- 話者類似度:WavLM の話者埋め込みを使い、生成音声と参照音声とのコサイン類似度(SIM)を算出する。
Hugging Face によると、デフォルト表示では Seed TTS Eval と CV3 Eval(zero shot)の英語部分における WER のマクロ平均(各データセットの結果を均等に平均した値)で順位付けされ、hexgrad/Kokoro-82M、Supertone/supertonic-3、fishaudio/s2-pro が上位に並ぶ。多言語では、同社は k2-fsa/OmniVoice、fishaudio/s2-pro、FunAudioLLM/Fun-CosyVoice3-0.5B-2512 の性能が高いとしている。中国語、日本語、韓国語は CER で算出される。
| 観点 | アリーナ型リーダーボード | Open TTS Leaderboard |
|---|---|---|
| 評価方式 | ユーザーが二択で投票し、Elo スコアを算出 | WER/CER、RTFx、TTFA、SIM などの客観的指標 |
| 評価に要する時間 | 投票の収集に数週間程度(Hugging Face による) | 数時間程度(Hugging Face による) |
| オープンソースモデルのカバー範囲 | Artificial Analysis の 92 モデル中オープンウェイトは 16 モデル | 現在はオープンソースモデルに注力 |
| 自然さを反映できるか | 人間の好みを直接反映 | 直接は測定できず、公式も人間の評価に代わるものではないとしている |
試聴、音声クローン、ストリーミング遅延
「Voice cloning」オプションを有効にすると、音声クローンに対応したモデルを比較でき、SIM 列が表示される。Hugging Face によると、bosonai/higgs-tts-3-4b や openbmb/VoxCPM2 などのモデルは、参照音声を与えた場合に平均 WER が改善したという。
「Listen」タブでは、各モデルの実際の出力を試聴・比較し、フィードバックを送ることができる。Hugging Face はボット除外のため投票者に HF アカウントでのログインを求めており、将来的に投票データをリーダーボードに反映する可能性があるとしている。
「Streaming」タブは TTFA で順位付けされる。Hugging Face によると、各モデルはバッチサイズ 1、同一の 50 件の CV3-Eval 英語プロンプトとデフォルト音声で実行され、最初の 3 回のウォームアップを除いた中央値が採用される。非ストリーミングモデルは文全体の生成完了までの時間で計算される。同社は kyutai/pocket-tts が GPU と CPU の両方でストリーミング性能に優れているとしている。
一般読者にとっての意味
音声アシスタント、オーディオブック、読み上げツールを使う一般の人にとって、こうしたリーダーボードは、オープンソース音声モデルが「正確に読めるか、応答が速いか、元の声に似ているか」を比較しやすくするものだ。ただし Hugging Face 自身も、これらの数値は自然さや聞き心地の良さとイコールではないと強調しており、実際の印象は試聴して判断すべきだ。
よくある質問
Open TTS Leaderboard とは何ですか?
Hugging Face が 2026 年 9 月 30 日に発表したリーダーボードで、客観的指標によってオープンソースの多言語音声合成および音声クローンモデルを評価します。
人間の投票によるリーダーボードに取って代わるのですか?
いいえ。Hugging Face によると、WER や話者類似度では自然さ、表現力、聞き手の好みを直接測れないため、人間の好みに基づくランキングに代わるものではありません。ただし、投票型リーダーボードが評価対象のモデルを選ぶ手助けにはなるとしています。
英語で性能が高いモデルは、中国語でも必ず高いのですか?
必ずしもそうではありません。Hugging Face は英語での性能が他言語にそのまま当てはまるとは限らないとしており、リーダーボードでは複数言語のランキングを切り替えられます。中国語、日本語、韓国語は文字誤り率で算出されます。
TTFA とは何で、なぜ重要なのですか?
TTFA はリクエストを送ってから最初の音声が再生可能になるまでの待ち時間を指します。Hugging Face は、音声エージェントなどの対話型アプリケーションにとって重要だとしています。
評価プログラムは公開されますか?
Hugging Face は評価スクリプトを近くオープンソース化し、コミュニティが GitHub の Issues や PR を通じて意見を寄せられるようにするとしていますが、具体的な日程はまだ発表されていません。
同じテーマの記事
ライフスタイル
NVIDIA、DGX Spark 64GB版を発表:10月23日発売、価格は4,999ドルから、2台接続で128GBに
NVIDIAは2026年10月2日、パーソナルAIコンピューター「DGX Spark」に、より手頃な64GBメモリ版を追加すると発表した。10月23日からAcer、ASUSなど6社が供給し、主な対象は自分のマシンでAIモデルを実行したい開発者や研究者。NVIDIAが公表した仕様、2台接続に関する説明、一般読者にとっての意味を整理する。
ライフスタイル
Google Cloud、Spanner queues の一般提供を発表:メッセージキューをデータベーストランザクションに組み込み、AIエージェントの信頼性向上を狙う
Google Cloud は Spanner queues の一般提供開始を発表しました。メッセージの作成をデータベーストランザクションの一部とすることで、AIエージェントの「状態」と「アクション」が食い違う問題の解決を目指しています。本記事では公式の説明、主な機能、一般読者にとっての意味を整理します。
ライフスタイル
GPT-6.1 Sol が登場:Sol の新版が API、Codex、ChatGPT Work に、Chat では提供なし
OpenAI は 2026年9月29日に GPT-6.1 Sol を公開しました。API 名は gpt-6.1-sol です。Plus、Pro、Business、Enterprise、Edu の各プランでは Codex と ChatGPT Work が初回の提供範囲に含まれ(Enterprise と Edu は管理者による有効化が必要)、Free と Go は初回の範囲に含まれず、Chat では提供されていません(2026年9月確認)。
ライフスタイル
Claude Sonnet 5.5が登場:価格はSonnet 5と同じで、API、クラウドプラットフォーム、Claude.aiで利用可能
Anthropicは2026年9月28日にClaude Sonnet 5.5を発表しました。APIの定価はSonnet 5と同じ(100万tokensあたり入力2ドル、出力10ドル)で、Claude.ai、API、複数のクラウドプラットフォームで利用でき、リスクの高いサイバーセキュリティ関連のリクエストはSonnet 5にフォールバックされます(2026年9月確認)。
最新の旅の情報・ガイド

ガイド東京
東京ではどのエリアに泊まる?新宿・上野・東京駅・渋谷・浅草・池袋・銀座の七エリア比較。空港アクセス、宿泊税、荷物配送も解説
東京ではどのエリアに泊まる?新宿、上野、東京駅、渋谷、浅草、池袋、銀座の七エリアを同じ基準で比較。成田・羽田空港からのアクセス、利用できる路線、周辺にあるもの、街の雰囲気、向いている人を、比較表と山手線の概略図とともに紹介します。2026年9月に確認した東京都の宿泊税(2027年4月から3%)と、空港宅急便で荷物を送る際のルールも解説します。
- 予算
- ホテル

ガイド東京
東京の交通パスの選び方:Suica/Welcome Suica、Tokyo Subway Ticket、JR Passは買うべき?
初めての東京では、まず一人一枚ICカードで都度払い(Welcome Suicaはデポジット不要、有効期間28日)。一日に地下鉄へ4回以上乗るならTokyo Subway Ticketの72時間券2,000円を追加し、関西へ行かず東京だけならJR Passは必ず割高です。TOURIST PASMO、iPhoneのSuica、東京メトロ一日乗車券で乗れる路線・乗れない路線を決定チャートで比較。価格は2026年9月に確認。
- 交通
- 予算

ガイド東京
東京ディズニーランド・シー攻略:チケット料金、ファンタジースプリングス、ディズニー・プレミアアクセス(DPA)とスタンバイパスの使い方、初めてならどちらを選ぶ?
東京ディズニーの一日パスポートは変動価格制で、2026 年 9 月は平日の多くが 9,900 円、週末が 10,900 円。公式サイトでは毎日 14:00 に二か月後の同日分を発売します。無料のプライオリティパスは公式サイトのサービス一覧に載っておらず、待ち時間を短縮できるのは有料のディズニー・プレミアアクセス(一人一回 1,000~3,500 円)のみ。運営時間、25 周年イベント、スタンバイパス、エントリー受付、ファンタジースプリングスの利用方法、初回にランドとシーのどちらを選ぶかも解説。2026 年 9 月に公式サイトで確認しました。
- モデルコース
- 家族向け