Zum Inhalt springen
fedi.software

Audio

Text-to-Speech-Modelle, gereiht nach der blinden Präferenz von Hörern in der TTS Arena, mit Preis pro Million Zeichen oder pro Minute.

Aktualisiert · Quellen: LiteLLM, TTS Arena

Tier Modell Elo Preis, USD pro 1M Zeichen Kontext App Vergleichen
S1’519— —
S1’509— —
D1’405— —

Die Tiers stammen von uns: die Position eines Modells in der Rangliste, wobei nur Modelle zählen, deren gesamtes Konfidenzintervall darüber liegt. S – obere 10%, A – bis 30%, B – bis 60%, C – bis 85%, D – der Rest.

Was diese Rangliste bewertet

Auf dieser Seite stehen Modelle für Sprachausgabe (Text-to-Speech), also Modelle, die einen Text vorlesen. Die Wertungen stammen aus der TTS Arena V2, einem offenen Community-Projekt von TTS-AGI: Zuhörer hören denselben Text blind in zwei Stimmen und wählen die, die besser klingt. Aus den Stimmen entsteht eine Elo-Wertung mit Unsicherheitsbereich; die Tabelle zeigt auch, wie viele Stimmen dahinterstehen.

Preise

Sprachmodelle werden pro Million Zeichen Eingabetext oder pro Minute erzeugten Audios verkauft, je nach Anbieter; die Einheit steht im Spaltenkopf. Der günstigste aktuelle Preis kommt von models.dev oder LiteLLM. Der Chip «Günstig» markiert Modelle unter 5 US-Dollar pro Million Zeichen. Achten Sie bei langen Texten auf die Einheit: Abrechnung nach Zeichen und nach Minuten kann zu deutlich unterschiedlichen Summen führen.

Tiers und Stimmenzahl

Die TTS Arena veröffentlicht, wie viele Stimmen jedes Modell erhalten hat. Deshalb gilt hier unsere übliche Regel: Ein Modell mit weniger als 300 Stimmen erhält noch kein Tier. Die Position ergibt sich aus den Modellen, deren Unsicherheitsbereich vollständig darüber liegt, und der Anteil an der Tabelle ergibt S unter 10%, A unter 30%, B unter 60%, C unter 85%, sonst D. Die Wertungen der Sprachmodelle liegen eng beieinander und die Bereiche sind breit, deshalb landen viele Modelle gleichzeitig im Tier S.

Was nicht abgedeckt ist

  • Spracherkennung (Speech-to-Text) wird nicht bewertet: Die Quelle hat dafür keine Arena.
  • Stimmen werden überwiegend auf Englisch verglichen. Was dort gewinnt, kann auf Deutsch weniger natürlich klingen – hören Sie sich Proben in Ihrer Sprache an.
  • Latenz und Streaming, wichtig für Sprachassistenten, fliessen nicht in die Wertung ein.
  • Einige Zeilen sind noch nicht veröffentlichte Modelle unter einem Codenamen: ohne Hersteller und ohne Preis.

Für eine Vertonung oder die Stimme einer App wählen Sie anhand der Tabelle einige Modelle mit guter Wertung und passendem Preis aus und vergleichen dann Hörproben bei den Anbietern.