音声
TTS Arenaでのリスナーによるブラインド評価に基づく音声合成モデルのランキング。価格は100万文字あたり、または1分あたりです。
ティアは当サイト独自のものです。ボード内での順位を、信頼区間全体がそのモデルより上にあるモデルだけを数えて決めます。S — 上位10%、A — 30%まで、B — 60%まで、C — 85%まで、D — それ以外。
音声合成のリーダーボード
このボードだけは、出典が LMArena ではなく TTS Arena V2 です。TTS-AGI コミュニティによるオープンなプロジェクトで、同じ文章を読み上げた二つの声を、聞き手が名前を知らないまま聞き比べて投票します。その結果を不確かさの幅が付いた Elo と投票数で表示しています。
ほかのボードとの違い
- 投票数はこの出典でも公開されており、300 票に満たないモデルは「ティア未判定」になります。
- まだ公開されていないモデルがコードネームで載っている行もあり、提供元と価格は表示されません。
- 価格は文章 1M 文字あたり、または音声 1 分あたりで表示します。
- 「低価格」は 1M 文字あたり 5 USD 未満のモデルです。
表の読み方
バーの長さは不確かさの幅を表し、二つのモデルの幅が重なっていれば、聞き比べでの差ははっきりしないと考えます。ティアは幅全体が自分より上にあるモデルの数から順位を決め、その割合で S(10% 未満)、A(30% 未満)、B(60% 未満)、C(85% 未満)、D に分けています。音声モデルは評価が近く幅も広いため、S に多くのモデルが並びます。価格の単位は列の見出しで確認でき、文字数で売るプロバイダーと時間で売るプロバイダーが混在しています。
使い道に合わせた選び方
ナレーションや読み上げ機能に組み込むなら、声の自然さだけでなく、長い文章での費用も大切です。「低価格」の印を手がかりに候補を絞り、月に読み上げる文字数から費用を試算してから、実際の原稿で聞き比べましょう。
評価の範囲
評価されているのは文章を読み上げる音声合成(text-to-speech)だけです。音声を文字にする音声認識のモデルは、出典にそのアリーナがないため載っていません。声の評価はおもに英語で行われているので、日本語の読み上げの自然さは別に確かめる必要があります。候補を絞ったら、実際の文章で試してみてください。