라이프스타일

Hugging Face, Open TTS Leaderboard 공개: 객관적 지표로 다국어 음성 합성·음성 복제 평가

Hugging Face가 2026년 9월 30일 Open TTS Leaderboard를 발표했다. 오류율, 속도, 화자 유사도 등 객관적 지표로 오픈소스 텍스트 음성 변환 모델을 평가하며, 청취 비교와 스트리밍 지연 비교도 제공한다. 그 방식과 한계, 일반 독자에게 갖는 의미를 정리했다.

읽는 데 약 7분

Hugging Face, Open TTS Leaderboard 공개: 객관적 지표로 다국어 음성 합성·음성 복제 평가
사진: Mokaair (Original editorial artwork)

무슨 일이 있었나

Hugging Face는 2026년 9월 30일 공식 블로그를 통해 Open TTS Leaderboard 출시를 발표했다. 회사 측에 따르면 이날 기준 AI 모델 공유 플랫폼인 Hugging Face Hub에는 8K개가 넘는 TTS 모델이 있다. 하지만 평가 방식은 여전히 제각각이고 표준화되어 있지 않다.

Hugging Face는 기존의 TTS Arena v2, Artificial Analysis, Voice Arena 같은 아레나 방식 리더보드를 이렇게 설명했다. 사용자에게 두 모델의 출력 중 하나를 고르게 하고, 누적된 투표로 Elo 점수를 계산해 순위를 매긴다. Elo 점수는 일대일 대결 결과로 실력을 매기는 점수다. 회사는 이런 방식이 모델 출시 속도를 따라가지 못한다고 본다. 그 예로 2026년 9월 30일 기준 Artificial Analysis의 92개 모델 중 오픈 웨이트 모델은 16개뿐이라고 들었다. 오픈 웨이트 모델은 학습된 모델 파일이 공개된 모델을 말한다.

Hugging Face, Open TTS Leaderboard 공개: 객관적 지표로 다국어 음성 합성·음성 복제 평가
Mokaair 편집 검증 절차 · 사진: Mokaair (Original editorial artwork)
자세한 설명 보기

출처를 수집하고 독립적으로 검증한 뒤 Jev가 판단합니다.

리더보드는 어떻게 점수를 매기나

  • 명료도(알아듣기 쉬운 정도): 음성 인식(ASR) 모델인 Qwen3 ASR로 생성된 음성을 받아쓴다. 그 결과를 원문과 비교해 단어 오류율(WER) 또는 문자 오류율(CER)을 계산한다.
  • 속도: H200 GPU에서 여러 입력을 한꺼번에 처리하는 배치 오프라인 추론의 RTFx를 측정한다. RTFx는 실시간보다 몇 배 빠르게 음성을 만드는지 나타내는 값이다. 또 H200 GPU와 CPU에서 첫 오디오가 나오기까지의 시간(TTFA)을 측정한다.
  • 화자 유사도: 생성된 음성과 참조 클립이 얼마나 비슷한지를 코사인 유사도(SIM)로 계산한다. 이때 목소리의 특징을 숫자로 나타낸 WavLM 화자 임베딩을 사용한다.

Hugging Face에 따르면 기본 보기에서는 Seed TTS Eval과 CV3 Eval(zero shot) 영어 분할의 매크로 평균 WER로 순위를 매긴다. 매크로 평균은 각 데이터셋 결과를 같은 비중으로 평균한 값이다. 이 기준에서는 hexgrad/Kokoro-82M, Supertone/supertonic-3, fishaudio/s2-pro가 선두다. 다국어 부문에서는 회사가 k2-fsa/OmniVoice, fishaudio/s2-pro, FunAudioLLM/Fun-CosyVoice3-0.5B-2512의 성능이 강하다고 언급했다. 중국어·일본어·한국어는 CER로 계산한다.

Hugging Face 블로그 설명을 바탕으로 정리한 두 평가 방식 비교
항목아레나 방식 리더보드Open TTS Leaderboard
평가 방식사용자가 둘 중 하나를 골라 투표, Elo 점수 계산WER/CER, RTFx, TTFA, SIM 등 객관적 지표
평가 소요 시간투표 수집에 약 수주(Hugging Face 주장)약 수시간(Hugging Face 주장)
오픈소스 모델 포함 범위Artificial Analysis 92개 모델 중 16개가 오픈 웨이트현재 오픈소스 모델에 집중
자연스러움 반영 여부사람의 선호도를 직접 반영직접 측정 불가, 공식적으로 사람의 평가를 대체하지 않는다고 밝힘

청취 비교, 음성 복제, 스트리밍 지연

'Voice cloning' 옵션을 켜면 음성 복제를 지원하는 모델끼리 비교할 수 있고 SIM 열이 표시된다. 음성 복제는 참조 음성을 주고 그 목소리를 흉내 내게 하는 기능이다. Hugging Face는 bosonai/higgs-tts-3-4b와 openbmb/VoxCPM2 등의 모델이 참조 오디오를 제공했을 때 평균 WER이 개선됐다고 밝혔다.

'Listen' 탭에서는 사용자가 각 모델의 실제 출력을 듣고 비교하며 피드백을 남길 수 있다. Hugging Face는 봇을 걸러내기 위해 투표자에게 HF 계정으로 로그인하도록 요청한다. 또 향후 투표 데이터를 리더보드에 반영할 수도 있다고 밝혔다.

'Streaming' 탭은 TTFA로 순위를 매긴다. Hugging Face에 따르면 각 모델은 한 번에 하나씩(배치 크기 1) 실행된다. 모두 동일한 50개의 CV3-Eval 영어 프롬프트와 기본 음성을 사용한다. 처음 3회는 워밍업으로 제외하고 나머지의 중앙값을 취한다. 스트리밍을 지원하지 않는 모델은 문장 전체 생성이 끝나는 시간을 계산한다. 회사는 kyutai/pocket-tts가 GPU와 CPU 모두에서 뛰어난 스트리밍 성능을 보인다고 밝혔다.

일반 독자에게 갖는 의미

음성 비서, 오디오북, 읽어주기 도구를 쓰는 일반인에게 이런 리더보드는 오픈소스 음성 모델을 비교하기 쉽게 해 준다. '정확하게 읽는지, 응답이 빠른지, 원래 목소리와 닮았는지'를 한눈에 볼 수 있다. 다만 Hugging Face 스스로도 이 수치가 자연스럽거나 듣기 좋은 것과 같지 않다고 강조했다. 실제 체감은 직접 들어보고 판단해야 한다.

자주 묻는 질문

Open TTS Leaderboard란 무엇인가요?

Hugging Face가 2026년 9월 30일 발표한 리더보드입니다. 객관적 지표를 사용해 오픈소스 다국어 텍스트 음성 변환 및 음성 복제 모델을 평가합니다.

사람의 투표로 운영되는 리더보드를 대체하나요?

아닙니다. Hugging Face는 WER과 화자 유사도가 자연스러움, 표현력, 청취자 선호도를 직접 측정하지 못한다고 밝혔습니다. 그래서 사람의 선호도 순위를 대체하지 않는다고 했습니다. 다만 투표형 리더보드가 평가할 모델을 고르는 데 도움이 될 수 있다고 했습니다.

영어 성능이 좋은 모델은 중국어도 반드시 좋은가요?

꼭 그렇지는 않습니다. Hugging Face는 영어 성능이 다른 언어로 반드시 이어지지는 않는다고 밝혔습니다. 그래서 리더보드에서 여러 언어별 순위로 전환할 수 있습니다. 중국어·일본어·한국어는 문자 오류율로 계산합니다.

TTFA란 무엇이며 왜 중요한가요?

TTFA는 요청을 보낸 뒤 첫 번째 오디오를 재생할 수 있을 때까지의 대기 시간을 말합니다. Hugging Face는 이것이 음성 에이전트 같은 대화형 애플리케이션에서 중요하다고 밝혔습니다.

평가 코드는 공개되나요?

Hugging Face는 평가 스크립트를 곧 오픈소스로 공개하겠다고 밝혔습니다. 커뮤니티가 GitHub Issues와 PR을 통해 의견을 낼 수 있게 하려는 것입니다. 다만 현재 구체적인 일정은 발표하지 않았습니다.

이 주제의 최신 뉴스 보기

최신 여행 소식·가이드

출처

라이프스타일