Salt la conținut
fedi.software

Audio

Modele text-to-speech clasate după preferința oarbă a ascultătorilor în TTS Arena, cu prețul per milion de caractere sau per minut.

Actualizat · Surse: LiteLLM, TTS Arena

Tier Model Elo Preț, USD per 1M de caractere Context Aplicație Comparare
S1.559— —
Compară ()

Tier-urile sunt ale noastre: locul unui model în clasament, numărând doar modelele al căror interval de încredere este în întregime deasupra lui. S — primele 10%, A — până la 30%, B — până la 60%, C — până la 85%, D — restul.

O sursă diferită de celelalte clasamente

Clasamentul audio nu vine de la LMArena, ci din TTS Arena V2, un proiect deschis al comunității TTS-AGI. Ascultătorii aud două voci care citesc același text, fără să știe ce model vorbește, și aleg vocea preferată. Rezultatul este un scor Elo cu marjă de incertitudine, ca la celelalte clasamente.

Regula de tier rămâne cea obișnuită: sursa publică numărul de voturi, așa că un model cu mai puțin de 300 de voturi nu primește încă tier. Tier-ul se calculează din marjele de incertitudine, numărând modelele a căror marjă se află în întregime deasupra, cu pragurile obișnuite 10, 30, 60 și 85%. Scorurile vocilor sunt apropiate, iar marjele largi, așa că multe modele ajung împreună în tier-ul S.

Ce conține clasamentul

  • doar modele text-to-speech, care transformă textul în voce;
  • scorul Elo cu marja lui, numărul de voturi și tier-ul;
  • prețul per 1M de caractere de text sau per minut de audio, în funcție de cum vinde furnizorul.

Modelele de recunoaștere a vorbirii (speech-to-text) nu sunt evaluate, pentru că sursa nu are o arenă pentru ele. Unele rânduri sunt modele încă nelansate, sub un nume de cod, fără producător și fără preț.

Cum citiți prețul

„Preț mic” înseamnă în acest clasament sub 5 USD per 1M de caractere. Pentru o estimare, gândiți-vă cât text transformați lunar în voce: un articol lung are câteva zeci de mii de caractere, o carte audio mult mai multe. Unii furnizori vând pe minut de audio sau pe secundă; unitatea apare în antetul coloanei.

Limite

Vocile sunt evaluate mai ales în engleză. Un model foarte apreciat în engleză poate suna altfel în română sau în alte limbi, așa că ascultați exemple în limba dumneavoastră înainte de a alege. Scorul arată preferința ascultătorilor, nu viteza, latența sau costul. Pentru a pune modelele unul lângă altul, folosiți pagina Comparare.

Cum alegeți o voce

Porniți de la modelele din tier-urile de sus și ascultați-le pe texte asemănătoare cu ale dumneavoastră: un anunț scurt, un paragraf tehnic, un dialog. Verificați pronunția numelor proprii și a cifrelor, apoi calculați costul pentru volumul lunar de text. Scorul și tier-ul se actualizează zilnic, cu data și sursele deasupra tabelului.