Audio
Modele zamiany tekstu na mowę uszeregowane według ślepych preferencji słuchaczy w TTS Arena, z ceną za milion znaków lub za minutę.
Zaktualizowano · Źródła: LiteLLM, TTS Arena
Tiery są nasze: miejsce modelu w rankingu liczone tylko względem modeli, których cały przedział ufności leży powyżej. S — górne 10%, A — do 30%, B — do 60%, C — do 85%, D — reszta.
Co pokazuje ranking mowy?
To ranking modeli syntezy mowy (text-to-speech), czyli zamiany tekstu na głos. Oceny pochodzą z TTS Arena V2, otwartego projektu społeczności TTS-AGI: słuchacze na ślepo porównują dwa głosy czytające ten sam tekst i wybierają lepszy. Wynikiem jest ocena Elo z przedziałem niepewności, a obok widać liczbę głosów każdego modelu.
Które modele mają tu tier?
Tak jak w innych rankingach tier dostają tylko modele z co najmniej 300 głosami. TTS Arena publikuje liczbę głosów, więc ten próg działa i tutaj – model z mniejszą liczbą ma etykietę „Jeszcze bez tieru”. Zasada podziału jest ta sama: miejsce modelu wynika z tego, ile modeli ma cały przedział niepewności powyżej jego przedziału, a progi to 10, 30, 60 i 85%. Oceny głosów są zbliżone, a przedziały szerokie, dlatego w tierze S znajduje się naraz wiele modeli.
W jakich jednostkach jest cena?
- za 1M znaków tekstu – to typowa jednostka;
- za minutę lub sekundę wygenerowanego dźwięku;
- za 1M tokenów, jeśli dostawca rozlicza model jak model językowy.
Etykieta „Niska cena” oznacza w tym rankingu mniej niż 5 USD za 1M znaków. Jeśli czytasz na głos długie teksty, np. artykuły czy książki, przelicz koszt na liczbę znaków w miesiącu.
Czy są tu modele rozpoznawania mowy?
Nie. Źródło nie prowadzi areny dla zamiany mowy na tekst (speech-to-text), więc takie modele nie są oceniane w tym rankingu. Część wierszy to z kolei modele jeszcze niewydane, pod nazwą kodową, bez producenta i bez ceny.
Czy ocena dotyczy języka polskiego?
Głosy są oceniane głównie po angielsku. Model wysoko w rankingu może brzmieć po polsku gorzej, a model z niższego tieru – lepiej. Zanim wybierzesz głos do projektu po polsku, odsłuchaj próbki u dostawcy i sprawdź wymowę nazw własnych oraz liczb. Kandydatów zestawisz na stronie porównania.
Jak wykorzystać ranking w praktyce?
Do audiobooka czy lektora w filmie liczy się naturalna intonacja przy długich fragmentach, a do asystenta głosowego – krótki czas odpowiedzi i stabilne brzmienie. Ranking pokazuje ogólne wrażenie słuchaczy, więc potraktuj go jako listę kandydatów do własnego odsłuchu, a nie ostateczny werdykt.