生活分享

Hugging Face 推出 Open TTS Leaderboard:用客观指标给开源语音合成与语音克隆模型排名

Hugging Face 于 2026 年 9 月 30 日发布 Open TTS Leaderboard,用错误率、速度与说话人相似度等客观指标评测开源文本转语音模型,并提供试听与流式延迟比较。对开发语音助手、朗读工具的人以及想挑选开源语音模型的读者而言,它让比较更快更方便,但 Hugging Face 表示它不能取代人耳判断。

阅读时间约 5 分钟

Hugging Face 推出 Open TTS Leaderboard:用客观指标给开源语音合成与语音克隆模型排名
图片:Mokaair (Original editorial artwork)

发生了什么

Hugging Face 于 2026 年 9 月 30 日在官方博客宣布推出 Open TTS Leaderboard。据该公司表示,截至当天 Hugging Face Hub 上已有超过 8000 个 TTS 模型,但评测方式仍分散、缺乏标准化。

Hugging Face 指出,现有的 TTS Arena v2、Artificial Analysis、Voice Arena 等竞技场式排行榜,是让用户在两个模型的输出中二选一,累积足够投票后计算 Elo 分数(一种根据两两对比胜负算出的评分)来排名。该公司认为这种方式无法跟上模型发布速度,并举例截至 2026 年 9 月 30 日,Artificial Analysis 上 92 个模型只有 16 个为开放权重(即模型文件公开、可自行下载运行)。

Hugging Face 推出 Open TTS Leaderboard:用客观指标给开源语音合成与语音克隆模型排名
Mokaair 编辑核查流程 · 图片:Mokaair (Original editorial artwork)
阅读完整文字说明

消息会先收集来源、独立核查,再交由 Jev 判断。

排行榜如何评分

  • 可懂度:用 Qwen3 ASR(自动语音识别模型)把生成的语音转写成文字,再计算与原文的词错误率(WER)或字符错误率(CER),错误率越低代表念得越准。
  • 速度:在 H200 GPU 上测量批量离线生成的 RTFx(逆实时因子,衡量生成速度相对音频时长快多少),并在 H200 GPU 与 CPU 上测量首段音频时间(TTFA)。
  • 说话人相似度:用 WavLM 说话人嵌入计算生成语音与参考片段的余弦相似度(SIM),衡量声音像不像原声。

根据 Hugging Face,默认视图以 Seed TTS Eval 与 CV3 Eval(zero shot)两个测试集英文部分的宏平均 WER(先分别计算再取平均)排名,hexgrad/Kokoro-82M、Supertone/supertonic-3 与 fishaudio/s2-pro 领先。多语言方面,该公司点名 k2-fsa/OmniVoice、fishaudio/s2-pro 与 FunAudioLLM/Fun-CosyVoice3-0.5B-2512 表现强劲;中文、日文、韩文属于以字符为单位的语言,因此以 CER 计算。

依 Hugging Face 博客说明整理的两种评测方式比较
维度竞技场式排行榜Open TTS Leaderboard
评分方式用户二选一投票,计算 Elo 分数以 WER/CER、RTFx、TTFA、SIM 等客观指标
评测所需时间收集投票约需数周(据 Hugging Face)约数小时(据 Hugging Face)
开源模型覆盖Artificial Analysis 92 个模型中 16 个为开放权重目前聚焦开源模型
能否反映自然度直接反映人类偏好无法直接衡量,官方称不取代人类评分

试听、语音克隆与流式延迟

语音克隆是指提供一段参考音频,让模型模仿其中的声音说话。开启「Voice cloning」选项后,可比较支持这项功能的模型,并显示 SIM 列。Hugging Face 表示,bosonai/higgs-tts-3-4b 与 openbmb/VoxCPM2 等模型在提供参考音频时平均 WER 有所改善。

「Listen」标签页让用户试听并比较各模型的实际输出、提供反馈;Hugging Face 请投票者以 HF 账号登录以过滤垃圾信息和机器人,并表示日后可能把投票数据纳入排行榜。

「Streaming」标签页以 TTFA 排名。据 Hugging Face,每个模型一次只生成一段音频(批大小 1),使用相同的 50 个 CV3-Eval 英文提示与默认音色运行,舍弃前 3 次预热后取中位数;非流式模型则计算整句生成完毕的时间,因为它要等全部生成完才能开始播放。该公司称 kyutai/pocket-tts 在 GPU 与 CPU 上的流式表现都很好。

对普通读者的意义

对使用语音助手、有声书或朗读工具的普通人来说,这类排行榜让外界更容易比较开源语音模型「读得准不准、响应快不快、像不像原声」。不过 Hugging Face 自己也强调,这些数字不等于听起来自然或好听,实际感受仍应以试听判断。

常见问题

Open TTS Leaderboard 是什么?

这是 Hugging Face 于 2026 年 9 月 30 日发布的排行榜,以客观指标评测开源多语言文本转语音与语音克隆模型。

它会取代人类投票的排行榜吗?

不会。Hugging Face 表示它不取代人类偏好排名,因为 WER 与说话人相似度无法直接衡量自然度、表现力或听者偏好,但可协助投票型排行榜挑选要评测的模型。

英文表现好的模型,中文也一定好吗?

不一定。Hugging Face 表示英文表现不必然能迁移到其他语言,因此排行榜可切换多种语言排名,中文、日文、韩文以字符错误率计算。

TTFA 是什么,为何重要?

TTFA 指发出请求后到可播放第一段音频的等待时间。Hugging Face 表示这对语音代理等交互应用很重要。

评测程序会公开吗?

Hugging Face 表示将很快开源评测脚本,让社区通过 GitHub Issues 与 PR 提供意见,但目前未公布具体日期。

查看同分类最新消息

最新旅游情报攻略

资料来源

生活分享