Przejdź do treści
fedi.software

Audio

Modele zamiany tekstu na mowę uszeregowane według ślepych preferencji słuchaczy w TTS Arena, z ceną za milion znaków lub za minutę.

Zaktualizowano · Źródła: LiteLLM, TTS Arena

Tier Model Elo Cena, USD za 1M znaków Kontekst Aplikacja Porównaj
–1 426— —
Porównaj ()

Tiery są nasze: miejsce modelu w rankingu liczone tylko względem modeli, których cały przedział ufności leży powyżej. S — górne 10%, A — do 30%, B — do 60%, C — do 85%, D — reszta.

Co pokazuje ranking mowy?

To ranking modeli syntezy mowy (text-to-speech), czyli zamiany tekstu na głos. Oceny pochodzą z TTS Arena V2, otwartego projektu społeczności TTS-AGI: słuchacze na ślepo porównują dwa głosy czytające ten sam tekst i wybierają lepszy. Wynikiem jest ocena Elo z przedziałem niepewności, a obok widać liczbę głosów każdego modelu.

Które modele mają tu tier?

Tak jak w innych rankingach tier dostają tylko modele z co najmniej 300 głosami. TTS Arena publikuje liczbę głosów, więc ten próg działa i tutaj – model z mniejszą liczbą ma etykietę „Jeszcze bez tieru”. Zasada podziału jest ta sama: miejsce modelu wynika z tego, ile modeli ma cały przedział niepewności powyżej jego przedziału, a progi to 10, 30, 60 i 85%. Oceny głosów są zbliżone, a przedziały szerokie, dlatego w tierze S znajduje się naraz wiele modeli.

W jakich jednostkach jest cena?

  • za 1M znaków tekstu – to typowa jednostka;
  • za minutę lub sekundę wygenerowanego dźwięku;
  • za 1M tokenów, jeśli dostawca rozlicza model jak model językowy.

Etykieta „Niska cena” oznacza w tym rankingu mniej niż 5 USD za 1M znaków. Jeśli czytasz na głos długie teksty, np. artykuły czy książki, przelicz koszt na liczbę znaków w miesiącu.

Czy są tu modele rozpoznawania mowy?

Nie. Źródło nie prowadzi areny dla zamiany mowy na tekst (speech-to-text), więc takie modele nie są oceniane w tym rankingu. Część wierszy to z kolei modele jeszcze niewydane, pod nazwą kodową, bez producenta i bez ceny.

Czy ocena dotyczy języka polskiego?

Głosy są oceniane głównie po angielsku. Model wysoko w rankingu może brzmieć po polsku gorzej, a model z niższego tieru – lepiej. Zanim wybierzesz głos do projektu po polsku, odsłuchaj próbki u dostawcy i sprawdź wymowę nazw własnych oraz liczb. Kandydatów zestawisz na stronie porównania.

Jak wykorzystać ranking w praktyce?

Do audiobooka czy lektora w filmie liczy się naturalna intonacja przy długich fragmentach, a do asystenta głosowego – krótki czas odpowiedzi i stabilne brzmienie. Ranking pokazuje ogólne wrażenie słuchaczy, więc potraktuj go jako listę kandydatów do własnego odsłuchu, a nie ostateczny werdykt.