Hugging Faceは、急速にリリースされるオープンソースのテキスト読み上げ(TTS)モデルのペースに合わせるために設計された、新しい評価フレームワークであるOpen TTS Leaderboardをリリースしました。2026年9月30日時点で、Hugging Face Hubには8,000以上のTTSモデルが存在していますが、評価手法は断片的なままとなっていました。
製品発表Hugging FaceOpen TTS Leaderboard
Hugging Faceが拡張可能な多言語モデル評価のためのOpen TTS Leaderboardをリリース
この記事は翻訳です。 原文を読む
MOS(平均意見スコア)のような人間による好みのスコアはゴールドスタンダードと見なされていますが、アリーナ形式のリーダーボードは、ホスティング要件のためにスケーラビリティに欠けたり、オープンウェイトモデルの代表性が不足したりすることがよくあります。Open TTS Leaderboardは、数週間ではなく数時間で計算可能な客観的な指標を使用することで、これらの制限に対処します。
このリーダーボードでは、明瞭性の代用としてWord Error Rate (WER)を使用し、音声のアイデンティティ保持を測定するために話者類似度の推定値を使用します。中国語、日本語、韓国語などの文字ベースの言語については、Character Error Rate (CER)が報告されます。また、このプラットフォームには「Voice Cloning」モードと、インタラクティブな音声エージェントにとって重要な指標であるTime-to-First-Audio (TTFA)に基づいてモデルをランク付けする「Streaming」タブも備わっています。
現在、英語のパフォーマンスはSeed TTS EvalとCV3 Evalベンチマークを使用してランク付けされており、多言語ランキングではユーザーが異なる言語を切り替えることができます。Hugging Faceは、このリーダーボードをコミュニティ主導のものにする意図を持っており、評価スクリプトをGitHubでオープンソース化する予定です。
出典
- Open TTS Leaderboard: Scalable Evaluation for Multilingual Text-to-Speech and Voice Cloning (Hugging Face Blog, 2026-09-30)