라이프스타일
Hugging Face, Open TTS Leaderboard 공개: 객관적 지표로 다국어 음성 합성·음성 복제 평가
Hugging Face가 2026년 9월 30일 Open TTS Leaderboard를 발표했다. 오류율, 속도, 화자 유사도 등 객관적 지표로 오픈소스 텍스트 음성 변환 모델을 평가하며, 청취 비교와 스트리밍 지연 비교도 제공한다. 그 방식과 한계, 일반 독자에게 갖는 의미를 정리했다.
읽는 데 약 7분

무슨 일이 있었나
Hugging Face는 2026년 9월 30일 공식 블로그를 통해 Open TTS Leaderboard 출시를 발표했다. 회사 측에 따르면 이날 기준 AI 모델 공유 플랫폼인 Hugging Face Hub에는 8K개가 넘는 TTS 모델이 있다. 하지만 평가 방식은 여전히 제각각이고 표준화되어 있지 않다.
Hugging Face는 기존의 TTS Arena v2, Artificial Analysis, Voice Arena 같은 아레나 방식 리더보드를 이렇게 설명했다. 사용자에게 두 모델의 출력 중 하나를 고르게 하고, 누적된 투표로 Elo 점수를 계산해 순위를 매긴다. Elo 점수는 일대일 대결 결과로 실력을 매기는 점수다. 회사는 이런 방식이 모델 출시 속도를 따라가지 못한다고 본다. 그 예로 2026년 9월 30일 기준 Artificial Analysis의 92개 모델 중 오픈 웨이트 모델은 16개뿐이라고 들었다. 오픈 웨이트 모델은 학습된 모델 파일이 공개된 모델을 말한다.
자세한 설명 보기
출처를 수집하고 독립적으로 검증한 뒤 Jev가 판단합니다.
리더보드는 어떻게 점수를 매기나
- 명료도(알아듣기 쉬운 정도): 음성 인식(ASR) 모델인 Qwen3 ASR로 생성된 음성을 받아쓴다. 그 결과를 원문과 비교해 단어 오류율(WER) 또는 문자 오류율(CER)을 계산한다.
- 속도: H200 GPU에서 여러 입력을 한꺼번에 처리하는 배치 오프라인 추론의 RTFx를 측정한다. RTFx는 실시간보다 몇 배 빠르게 음성을 만드는지 나타내는 값이다. 또 H200 GPU와 CPU에서 첫 오디오가 나오기까지의 시간(TTFA)을 측정한다.
- 화자 유사도: 생성된 음성과 참조 클립이 얼마나 비슷한지를 코사인 유사도(SIM)로 계산한다. 이때 목소리의 특징을 숫자로 나타낸 WavLM 화자 임베딩을 사용한다.
Hugging Face에 따르면 기본 보기에서는 Seed TTS Eval과 CV3 Eval(zero shot) 영어 분할의 매크로 평균 WER로 순위를 매긴다. 매크로 평균은 각 데이터셋 결과를 같은 비중으로 평균한 값이다. 이 기준에서는 hexgrad/Kokoro-82M, Supertone/supertonic-3, fishaudio/s2-pro가 선두다. 다국어 부문에서는 회사가 k2-fsa/OmniVoice, fishaudio/s2-pro, FunAudioLLM/Fun-CosyVoice3-0.5B-2512의 성능이 강하다고 언급했다. 중국어·일본어·한국어는 CER로 계산한다.
| 항목 | 아레나 방식 리더보드 | Open TTS Leaderboard |
|---|---|---|
| 평가 방식 | 사용자가 둘 중 하나를 골라 투표, Elo 점수 계산 | WER/CER, RTFx, TTFA, SIM 등 객관적 지표 |
| 평가 소요 시간 | 투표 수집에 약 수주(Hugging Face 주장) | 약 수시간(Hugging Face 주장) |
| 오픈소스 모델 포함 범위 | Artificial Analysis 92개 모델 중 16개가 오픈 웨이트 | 현재 오픈소스 모델에 집중 |
| 자연스러움 반영 여부 | 사람의 선호도를 직접 반영 | 직접 측정 불가, 공식적으로 사람의 평가를 대체하지 않는다고 밝힘 |
청취 비교, 음성 복제, 스트리밍 지연
'Voice cloning' 옵션을 켜면 음성 복제를 지원하는 모델끼리 비교할 수 있고 SIM 열이 표시된다. 음성 복제는 참조 음성을 주고 그 목소리를 흉내 내게 하는 기능이다. Hugging Face는 bosonai/higgs-tts-3-4b와 openbmb/VoxCPM2 등의 모델이 참조 오디오를 제공했을 때 평균 WER이 개선됐다고 밝혔다.
'Listen' 탭에서는 사용자가 각 모델의 실제 출력을 듣고 비교하며 피드백을 남길 수 있다. Hugging Face는 봇을 걸러내기 위해 투표자에게 HF 계정으로 로그인하도록 요청한다. 또 향후 투표 데이터를 리더보드에 반영할 수도 있다고 밝혔다.
'Streaming' 탭은 TTFA로 순위를 매긴다. Hugging Face에 따르면 각 모델은 한 번에 하나씩(배치 크기 1) 실행된다. 모두 동일한 50개의 CV3-Eval 영어 프롬프트와 기본 음성을 사용한다. 처음 3회는 워밍업으로 제외하고 나머지의 중앙값을 취한다. 스트리밍을 지원하지 않는 모델은 문장 전체 생성이 끝나는 시간을 계산한다. 회사는 kyutai/pocket-tts가 GPU와 CPU 모두에서 뛰어난 스트리밍 성능을 보인다고 밝혔다.
일반 독자에게 갖는 의미
음성 비서, 오디오북, 읽어주기 도구를 쓰는 일반인에게 이런 리더보드는 오픈소스 음성 모델을 비교하기 쉽게 해 준다. '정확하게 읽는지, 응답이 빠른지, 원래 목소리와 닮았는지'를 한눈에 볼 수 있다. 다만 Hugging Face 스스로도 이 수치가 자연스럽거나 듣기 좋은 것과 같지 않다고 강조했다. 실제 체감은 직접 들어보고 판단해야 한다.
자주 묻는 질문
Open TTS Leaderboard란 무엇인가요?
Hugging Face가 2026년 9월 30일 발표한 리더보드입니다. 객관적 지표를 사용해 오픈소스 다국어 텍스트 음성 변환 및 음성 복제 모델을 평가합니다.
사람의 투표로 운영되는 리더보드를 대체하나요?
아닙니다. Hugging Face는 WER과 화자 유사도가 자연스러움, 표현력, 청취자 선호도를 직접 측정하지 못한다고 밝혔습니다. 그래서 사람의 선호도 순위를 대체하지 않는다고 했습니다. 다만 투표형 리더보드가 평가할 모델을 고르는 데 도움이 될 수 있다고 했습니다.
영어 성능이 좋은 모델은 중국어도 반드시 좋은가요?
꼭 그렇지는 않습니다. Hugging Face는 영어 성능이 다른 언어로 반드시 이어지지는 않는다고 밝혔습니다. 그래서 리더보드에서 여러 언어별 순위로 전환할 수 있습니다. 중국어·일본어·한국어는 문자 오류율로 계산합니다.
TTFA란 무엇이며 왜 중요한가요?
TTFA는 요청을 보낸 뒤 첫 번째 오디오를 재생할 수 있을 때까지의 대기 시간을 말합니다. Hugging Face는 이것이 음성 에이전트 같은 대화형 애플리케이션에서 중요하다고 밝혔습니다.
평가 코드는 공개되나요?
Hugging Face는 평가 스크립트를 곧 오픈소스로 공개하겠다고 밝혔습니다. 커뮤니티가 GitHub Issues와 PR을 통해 의견을 낼 수 있게 하려는 것입니다. 다만 현재 구체적인 일정은 발표하지 않았습니다.
같은 주제의 글
라이프스타일
NVIDIA, DGX Spark 64GB 모델 출시: 10월 23일 판매 시작, 시작가 4,999달러, 두 대 연결 시 128GB
NVIDIA는 2026년 10월 2일 개인용 AI 컴퓨터 DGX Spark에 더 저렴한 64GB 메모리 모델을 추가한다고 발표했다. 10월 23일부터 Acer, ASUS 등 6개 제조사를 통해 공급되며, 주요 대상은 자신의 기기에서 AI 모델을 실행하려는 개발자와 연구자다. NVIDIA가 공개한 사양, 두 대 연결에 관한 설명, 그리고 일반 독자에게 갖는 의미를 정리했다.
라이프스타일
Google Cloud, Spanner queues 정식 출시 발표: 메시지 큐를 데이터베이스 트랜잭션에 통합해 AI 에이전트 신뢰성 겨냥
Google Cloud가 Spanner queues 정식 출시를 발표했다. 메시지 생성을 데이터베이스 트랜잭션의 일부로 만들어 AI 에이전트의 '상태'와 '동작'이 어긋나는 문제를 해결하겠다는 것이다. 공식 설명, 주요 기능, 일반 독자에게 갖는 의미를 정리했다.
라이프스타일
GPT-6.1 Sol 출시: 새 버전 Sol, API·Codex·ChatGPT Work에서 제공, Chat에는 없음
OpenAI는 2026년 9월 29일 GPT-6.1 Sol을 출시했습니다. API 이름은 gpt-6.1-sol이며, Plus, Pro, Business, Enterprise, Edu 요금제의 Codex와 ChatGPT Work가 출시 시 제공 범위에 포함되고(Enterprise와 Edu는 관리자가 켜야 함), Free와 Go는 출시 시 포함되지 않으며, Chat에는 없습니다(2026년 9월 확인).
라이프스타일
Claude Sonnet 5.5 출시: 정가는 Sonnet 5와 같고, API·클라우드 플랫폼·Claude.ai에서 사용 가능
Anthropic은 2026년 9월 28일 Claude Sonnet 5.5를 출시했습니다. API 정가는 Sonnet 5와 같고(100만 tokens당 입력 2달러, 출력 10달러), Claude.ai, API, 여러 클라우드 플랫폼에서 사용할 수 있으며, 위험도가 높은 사이버 보안 요청은 Sonnet 5로 되돌려 처리됩니다(2026년 9월 확인).
최신 여행 소식·가이드

가이드도쿄
도쿄 어디에 묵을까? 신주쿠·우에노·도쿄역·시부야·아사쿠사·이케부쿠로·긴자 일곱 지역 비교: 공항 교통, 숙박세, 짐 배송까지
도쿄 어디에 묵을까? 신주쿠, 우에노, 도쿄역, 시부야, 아사쿠사, 이케부쿠로, 긴자 일곱 지역을 같은 기준으로 비교한다. 나리타·하네다 공항에서 오는 방법, 교통 노선, 주변의 볼거리, 동네 분위기, 적합한 여행자를 비교표와 야마노테선 안내도로 살펴보고, 2026년 9월에 확인한 도쿄도 숙박세(2027년 4월부터 3%)와 공항 택배로 짐을 보내는 규정도 정리했다.
- 예산
- 호텔

가이드도쿄
도쿄 교통패스 선택법: Suica/Welcome Suica, Tokyo Subway Ticket, JR Pass는 살 만할까?
도쿄를 처음 여행한다면 먼저 1인당 IC 카드 한 장으로 탈 때마다 결제한다(Welcome Suica는 보증금이 없고 28일간 유효). 하루에 지하철을 4번 이상 타면 2,000엔짜리 Tokyo Subway Ticket 72시간권을 추가하고, 간사이에 가지 않고 도쿄만 여행한다면 JR Pass는 반드시 손해다. TOURIST PASMO, iPhone의 Suica, 도쿄 Metro 하루권의 이용 가능·불가 범위를 결정도로 비교한다. 가격은 2026년 9월 확인.
- 교통
- 예산

가이드도쿄
도쿄 디즈니랜드·디즈니씨 가이드: 티켓 가격, 판타지 스프링스 Fantasy Springs, 디즈니 프리미어 액세스 DPA와 스탠바이 패스 이용법, 첫 방문에는 어느 파크가 좋을까
도쿄 디즈니 하루짜리 패스포트는 변동 가격제로, 2026년 9월에는 평일 대부분이 9,900엔, 주말이 10,900엔이다. 공식 홈페이지에서 매일 14:00에 두 달 뒤 같은 날짜의 티켓을 판매한다. 무료 프라이오리티 패스는 공식 서비스 목록에서 빠져 대기 시간을 줄이는 방법은 유료 디즈니 프리미어 액세스(한 사람당 한 번 1,000~3,500엔)뿐이다. 운영 시간, 25주년 행사, 스탠바이 패스, 엔트리 리퀘스트, 판타지 스프링스 이용법, 첫 방문 때 디즈니랜드와 디즈니씨 중 어디를 고를지도 담았다. 2026년 9월 공식 홈페이지에서 확인했다.
- 추천 일정
- 가족 여행