Langsung ke konten
fedi.software

Audio

Model teks-ke-suara yang diperingkat berdasarkan preferensi buta pendengar di TTS Arena, dengan harga per sejuta karakter atau per menit.

Diperbarui · Sumber: LiteLLM, TTS Arena

Tier Model Elo Harga, USD per 1 jt karakter Konteks Aplikasi Bandingkan
S1.519— —
S1.509— —

Tier ditentukan oleh kami: posisi model di papan peringkat dengan hanya menghitung model yang seluruh interval kepercayaannya berada di atasnya. S — 10% teratas, A — hingga 30%, B — hingga 60%, C — hingga 85%, D — sisanya.

Aturan khusus papan audio

Papan audio berbeda dari papan lain dalam satu hal penting. Sumbernya bukan LMArena, melainkan TTS Arena V2, proyek terbuka komunitas TTS-AGI. Sumber ini menerbitkan jumlah suara, jadi aturan minimal 300 suara tetap berlaku: model dengan suara lebih sedikit bertanda “Belum ada tier”. Posisi dihitung dari rentang ketidakpastian, yaitu berapa model yang seluruh rentangnya berada di atas, dengan batas 10, 30, 60, dan 85%. Nilai model suara berdekatan dan rentangnya lebar, sehingga banyak model masuk tier S sekaligus.

Apa yang dinilai

Papan ini berisi model teks-ke-suara, yaitu model yang mengubah teks tertulis menjadi suara. Pendengar mendengarkan dua suara yang membaca teks yang sama tanpa tahu modelnya, lalu memilih yang lebih disukai. Hasilnya adalah nilai bergaya Elo.

Satuan harga

  • Satuan paling umum adalah USD per 1M karakter teks.
  • Sebagian penyedia menagih per menit atau per detik audio; satuannya tertulis di judul kolom.
  • “Harga rendah” di papan ini berarti di bawah 5 USD per 1M karakter.

Untuk memperkirakan biaya buku audio atau kursus bernarasi, hitung jumlah karakter naskah lalu kalikan dengan harga satuan.

Yang tidak tercakup

Model suara-ke-teks, yang mentranskripsi rekaman, tidak dinilai karena sumbernya tidak punya arena untuk itu. Sebagian baris adalah model yang belum dirilis dengan nama sandi, tanpa vendor dan tanpa harga. Suara juga sebagian besar dinilai dalam bahasa Inggris. Suara yang unggul di sini bisa terdengar kurang alami dalam bahasa Indonesia, misalnya pada pelafalan nama atau intonasi kalimat tanya. Dengarkan contoh dalam bahasa yang akan Anda pakai sebelum memilih.

Contoh pemakaian

Narasi video pembelajaran. Pengumuman di aplikasi. Versi audio artikel blog. Semua itu bisa dibuat dengan model teks-ke-suara. Uji dulu kalimat pendek. Perhatikan jeda, angka, dan singkatan. Lalu pilih suara yang terasa cocok bagi pendengar Anda.

Jika naskah memuat istilah asing atau nama merek, tulis ejaannya sesuai cara pengucapan yang Anda inginkan, lalu dengarkan hasilnya sekali lagi.

Membandingkan

Centang hingga 4 model untuk dilihat di halaman perbandingan. Ingat bahwa nilai Elo papan audio hanya bermakna di dalam papan ini. Harga berasal dari models.dev dan LiteLLM, diperbarui setiap hari.