Vai al contenuto
fedi.software

Audio

Modelli di sintesi vocale classificati in base alle preferenze alla cieca degli ascoltatori su TTS Arena, con prezzo per milione di caratteri o al minuto.

Aggiornato · Fonti: LiteLLM, TTS Arena

Tier Modello Elo Prezzo, USD per 1M di caratteri Contesto App Confronta
S1.566— —
S1.540— —
–1.528— —
S1.502— —
A1.477— —
A1.473— —
Confronta ()

I tier sono nostri: la posizione di un modello nella classifica contando solo i modelli il cui intervallo di confidenza è interamente sopra il suo. S — primo 10%, A — fino al 30%, B — fino al 60%, C — fino all'85%, D — il resto.

Voci confrontate all'ascolto

Per la sintesi vocale la fonte non è LMArena ma TTS Arena V2, un progetto aperto della comunità TTS-AGI. Il meccanismo è simile: chi ascolta sente due voci che leggono lo stesso testo, senza sapere a quali modelli appartengono, e vota quella che preferisce. Da questi confronti nasce un punteggio Elo con il suo margine di incertezza, che la pagina mostra insieme al numero di voti.

I tier seguono la regola comune

TTS Arena pubblica il numero di voti per modello. Per questo vale anche qui la regola dei 300 voti: chi ne ha meno resta con «Tier non ancora assegnato». La posizione si calcola confrontando i margini di incertezza: contano i modelli il cui margine sta tutto sopra, con le soglie comuni del 10, 30, 60 e 85% per S, A, B e C, e D per il resto. I punteggi delle voci sono vicini e i margini ampi, quindi molti modelli finiscono insieme nel tier S.

Come si legge il prezzo

  • Il costo è in USD per milione di caratteri di testo, oppure al minuto o al secondo di audio, secondo come vende il provider; l'unità è indicata nell'intestazione.
  • «Prezzo basso» su questa pagina significa meno di 5 USD per milione di caratteri.
  • Il valore mostrato è il più basso trovato tra i provider nel giorno dei dati, da models.dev e LiteLLM.

Cosa non trovi qui

La classifica riguarda solo la sintesi vocale, cioè il passaggio da testo a voce. I modelli che trascrivono l'audio in testo non sono valutati, perché la fonte non ha un'arena dedicata. Alcune righe sono modelli non ancora rilasciati, indicati con un nome in codice, senza produttore né prezzo. Inoltre le voci sono giudicate soprattutto in inglese: un modello molto apprezzato può suonare meno naturale in italiano, con accenti o intonazioni diverse. Prima di scegliere una voce per un podcast, un'app o un audiolibro, ascolta qualche esempio nella tua lingua.