Audio
Modèles de synthèse vocale classés selon les préférences à l'aveugle des auditeurs sur TTS Arena, avec le prix par million de caractères ou par minute.
Mis à jour · Sources: LiteLLM, TTS Arena
Les tiers sont les nôtres : la place d'un modèle dans le classement, en ne comptant que les modèles dont tout l'intervalle de confiance est au-dessus du sien. S — les 10 % du haut, A — jusqu'à 30 %, B — jusqu'à 60 %, C — jusqu'à 85 %, D — le reste.
Un classement de voix de synthèse
Ce tableau classe les modèles de synthèse vocale, qui transforment un texte en voix. La source n'est pas LMArena mais TTS Arena V2, un projet communautaire ouvert de TTS-AGI : des auditeurs écoutent à l'aveugle deux voix qui lisent le même texte et votent pour celle qu'ils préfèrent. Les votes donnent une note Elo avec sa marge d'incertitude, et le tableau indique le nombre de votes de chaque modèle. Le naturel, l'intonation et la clarté pèsent dans le choix des auditeurs, sans qu'une grille de critères soit imposée.
Les tiers : la même règle qu'ailleurs
Comme sur les autres pages, un modèle doit réunir au moins 300 votes pour recevoir un tier : TTS Arena publie le nombre de votes par modèle, le seuil s'applique donc ici aussi. La règle de calcul reste la même :
- la place d'un modèle vaut 1 plus le nombre de modèles dont toute la marge d'incertitude est au-dessus de la sienne ;
- cette place, rapportée au nombre de modèles, donne S sous 10 %, A sous 30 %, B sous 60 %, C sous 85 % et D au-delà ;
- des modèles à égalité statistique avec le modèle de tête partagent son rang.
Les notes des voix sont proches et les marges larges : beaucoup de modèles se retrouvent donc ensemble dans le tier S.
Comment lire les prix
Les tarifs sont exprimés par million de caractères de texte lu, ou par minute d'audio produite, selon le mode de facturation du fournisseur ; l'unité figure dans l'en-tête de la colonne. Ici, « Petit prix » désigne un tarif inférieur à 5 USD par million de caractères. Pour un livre audio ou un grand volume de notifications vocales, l'écart entre deux modèles peut vite devenir important : le calculateur des autres classements n'est pas là, mais un simple calcul à partir de la longueur de vos textes suffit.
Ce qui n'est pas évalué
Les modèles de reconnaissance vocale, qui transforment la parole en texte, ne sont pas classés : la source n'a pas d'arène pour eux. Certaines lignes sont des modèles pas encore sortis, testés sous un nom de code, sans éditeur ni prix. Et les voix sont évaluées surtout en anglais. Un modèle bien placé peut sonner moins naturel en français ; écoutez des exemples dans votre langue avant de choisir, et vérifiez les conditions d'usage des voix pour un projet commercial.
Sources
Notes : TTS Arena V2. Prix : models.dev et LiteLLM, actualisés chaque jour. Pour comparer quelques voix côte à côte, utilisez la page « Comparer ».