Ir al contenido
fedi.software

Audio

Modelos de texto a voz clasificados por la preferencia a ciegas de los oyentes en TTS Arena, con precio por millón de caracteres o por minuto.

Actualizado · Fuentes: LiteLLM, TTS Arena

Tier Modelo Elo Precio, USD por 1M de caracteres Contexto App Comparar
S1.566— —
S1.540— —
–1.528— —
S1.502— —
A1.477— —
A1.473— —
Comparar ()

Los tiers son nuestros: el puesto de un modelo en la clasificación contando solo los modelos cuyo intervalo de confianza completo está por encima. S: el 10% superior, A: hasta el 30%, B: hasta el 60%, C: hasta el 85%, D: el resto.

Una fuente distinta, la misma regla

La tabla de audio no viene de LMArena, sino de TTS Arena V2, un proyecto abierto de la comunidad TTS-AGI. Allí los oyentes escuchan a ciegas dos voces que leen el mismo texto y votan la que prefieren. El resultado es un Elo con su margen de incertidumbre, como en las demás tablas.

Los votos también se publican: TTS Arena indica cuántos recibe cada modelo, así que aplicamos el mínimo de 300 votos que usamos en otras tablas. Un modelo con menos votos aparece como «Aún sin tier». Algunas filas son modelos todavía no lanzados, con nombre en clave, sin fabricante ni precio.

Qué modelos entran y cuáles no

Solo se clasifican los modelos de texto a voz, los que convierten un texto escrito en habla. Los modelos de voz a texto, que transcriben audio, no aparecen porque la fuente no tiene una arena para ellos. Otra cautela: las voces se valoran sobre todo en inglés. Un modelo bien situado puede sonar menos natural en español, así que escucha una muestra en tu idioma antes de decidir.

Cómo se lee el precio

El precio se muestra en la unidad que usa el proveedor:

  • por 1M de caracteres de texto, la más habitual;
  • por minuto de audio generado;
  • en algunos casos, por segundo o por 1M de tokens.

La cabecera de la columna indica la unidad. En esta tabla, «Precio bajo» significa menos de 5 USD por 1M de caracteres. Los precios proceden de models.dev y LiteLLM y se actualizan a diario, igual que las puntuaciones.

Los tiers en esta tabla

El cálculo es el mismo que en el resto de la sección. El puesto de un modelo es uno más el número de modelos cuyo margen completo está por encima del suyo. Ese puesto sobre el total da la letra: S por debajo del 10%, A hasta el 30%, B hasta el 60%, C hasta el 85% y D el resto. Los modelos empatados con el líder comparten el tier S. Como las puntuaciones de voz están muy juntas y los márgenes son amplios, muchos modelos acaban a la vez en ese tier.

Para qué sirve

Es un buen punto de partida para elegir una voz para vídeos, audiolibros, asistentes o avisos automáticos. Haz una lista corta con los modelos de tier alto que encajen en tu presupuesto y compáralos con tu propio texto. Si necesitas ver varios datos juntos, usa comparar modelos; para vídeo con imagen, la tabla de vídeo.