生活分享

Hugging Face 推出 Open TTS Leaderboard:以客觀指標評測多語言語音合成與語音複製

Hugging Face 於 2026 年 9 月 30 日發表 Open TTS Leaderboard,用自動計算的錯誤率、速度與聲音相似度,評比能把文字唸成語音的開源 AI 模型,並提供試聽與延遲比較。想挑選語音模型的開發者與使用者多了一個比較參考,但 Hugging Face 強調它不取代人類試聽評分。

閱讀時間約 5 分鐘

Hugging Face 推出 Open TTS Leaderboard:以客觀指標評測多語言語音合成與語音複製
圖片:Mokaair (Original editorial artwork)

發生了什麼事

Hugging Face 於 2026 年 9 月 30 日在官方部落格宣布推出 Open TTS Leaderboard。TTS(text-to-speech)是把文字轉成語音的技術,常見於語音助理與朗讀工具。據該公司表示,截至當天 Hugging Face Hub 上已有超過 8K 個 TTS 模型,但評測方式仍分散、缺乏標準化。

Hugging Face 指出,現有的 TTS Arena v2、Artificial Analysis、Voice Arena 等「競技場式」排行榜,是讓使用者聽兩個模型的輸出後二選一,累積足夠投票後計算 Elo 分數(一種源自棋賽、依勝負推算實力的評分法)排名。該公司認為這種方式無法跟上模型發布速度,並舉例截至 2026 年 9 月 30 日,Artificial Analysis 上 92 個模型只有 16 個為開放權重(公開模型參數、可自行下載架設的模型)。

Hugging Face 推出 Open TTS Leaderboard:以客觀指標評測多語言語音合成與語音複製
Mokaair 編輯查核流程 · 圖片:Mokaair (Original editorial artwork)
閱讀完整文字說明

消息會先蒐集來源、獨立查核,再交由 Jev 判斷。

排行榜怎麼評分

  • 可懂度:用 Qwen3 ASR(自動語音辨識模型)把生成的語音轉回文字,再和原文比對,計算字詞錯誤率(WER)或字元錯誤率(CER),數值越低代表唸得越準。
  • 速度:在 H200 GPU(資料中心用的高階運算晶片)上量測批次離線生成的 RTFx,數值越高代表生成越快;並在 H200 GPU 與 CPU 上量測首段音訊時間(TTFA),也就是要等多久才能聽到第一段聲音。
  • 說話者相似度:以 WavLM 模型擷取聲音特徵,計算生成語音與參考錄音的餘弦相似度(SIM),用來估計模仿出來的聲音有多像原本的人。

根據 Hugging Face,預設檢視以 Seed TTS Eval 與 CV3 Eval(zero shot,即模型未事先針對該聲音訓練)兩個英文測試資料的平均 WER 排名,hexgrad/Kokoro-82M、Supertone/supertonic-3 與 fishaudio/s2-pro 領先。多語言方面,該公司點名 k2-fsa/OmniVoice、fishaudio/s2-pro 與 FunAudioLLM/Fun-CosyVoice3-0.5B-2512 表現強;中文、日文、韓文因以字元為單位,改以 CER 計算。

依 Hugging Face 部落格說明整理的兩種評測方式比較
面向競技場式排行榜Open TTS Leaderboard
評分方式使用者聽兩段輸出二選一投票,計算 Elo 分數以錯誤率(WER/CER)、速度(RTFx、TTFA)、聲音相似度(SIM)等自動指標
評測一個模型所需時間收集投票約需數週(據 Hugging Face)約數小時(據 Hugging Face)
開源模型覆蓋Artificial Analysis 92 個模型中僅 16 個為開放權重目前聚焦開源模型
能否反映聽感是否自然直接反映人類偏好無法直接衡量,Hugging Face 稱不取代人類評分

試聽、語音複製與串流延遲

開啟「Voice cloning」(語音複製)選項後,可比較支援模仿參考聲音的模型,表格也會多出 SIM 欄位。Hugging Face 表示,bosonai/higgs-tts-3-4b 與 openbmb/VoxCPM2 等模型在提供參考音訊時平均 WER 有所改善。

「Listen」分頁讓使用者試聽並比較各模型的實際輸出、提供回饋;Hugging Face 請投票者以 HF 帳號登入以過濾垃圾訊息與機器人,並表示日後可能把投票資料納入排行榜。

「Streaming」(串流,即邊生成邊播放)分頁以 TTFA 排名。據 Hugging Face,每個模型一次只處理一段音訊,使用相同 50 個 CV3-Eval 英文提示與預設聲音執行,捨棄前 3 次暖機後取中位數;不支援串流的模型則計算整句生成完的時間。該公司稱 kyutai/pocket-tts 在 GPU 與 CPU 上串流表現都很好。

對一般讀者的意義

對使用語音助理、有聲書或朗讀工具的一般人來說,這類排行榜讓外界較容易比較開源語音模型「唸得準不準、回應快不快、像不像原聲」。不過 Hugging Face 自己也強調,這些數字不等於聽起來自然或好聽,實際感受仍應以試聽判斷。

常見問題

Open TTS Leaderboard 是什麼?

這是 Hugging Face 於 2026 年 9 月 30 日發表的排行榜,用自動計算的指標評比開源、多語言的文字轉語音與語音複製模型。

它會取代人類投票的排行榜嗎?

不會。Hugging Face 表示它不取代人類偏好排名,因為錯誤率與說話者相似度無法直接衡量自然度、表現力或聽者偏好,但可協助投票型排行榜挑選要評測的模型。

英文表現好的模型,中文也一定好嗎?

不一定。Hugging Face 表示英文表現不必然能轉移到其他語言,因此排行榜可切換多種語言排名,中文、日文、韓文以字元錯誤率計算。

TTFA 是什麼,為何重要?

TTFA 指送出請求後到可播放第一段音訊的等待時間;不支援串流的模型則要等整句生成完才能播放。Hugging Face 表示這對語音代理等互動應用很重要。

評測程式會公開嗎?

Hugging Face 表示將很快開源評測腳本,讓社群透過 GitHub Issues 與 PR 提供意見,但未公布具體日期。

查看同分類最新消息

最新旅遊情報攻略

資料來源

生活分享