본문으로 건너뛰기
fedi.software

오디오

TTS Arena에서 청취자의 블라인드 선호도로 순위를 매긴 음성 합성 모델입니다. 가격은 100만 자 또는 1분 기준입니다.

업데이트 · 출처: LiteLLM, TTS Arena

티어 모델 Elo 가격, USD/100만 자 컨텍스트 앱 비교
–1,528— —
비교하기 ()

티어는 자체 기준입니다. 순위표에서 모델의 위치를 정할 때 신뢰 구간 전체가 그 모델보다 위에 있는 모델만 셉니다. S — 상위 10%, A — 30%까지, B — 60%까지, C — 85%까지, D — 나머지.

음성 합성 리더보드

이 보드만은 출처가 LMArena가 아니라 TTS Arena V2입니다. TTS-AGI 커뮤니티가 운영하는 공개 프로젝트로, 같은 문장을 읽은 두 목소리를 청취자가 이름을 모른 채 들어 보고 투표합니다. 그 결과를 불확실성 범위가 붙은 Elo와 투표 수로 보여 줍니다.

다른 보드와의 차이

  • 이 출처도 투표 수를 공개하므로, 300표에 못 미치는 모델은 「아직 티어 없음」으로 표시됩니다.
  • 아직 출시되지 않은 모델이 코드명으로 올라온 행도 있으며, 제공사와 가격은 표시되지 않습니다.
  • 가격은 텍스트 1M 글자당 또는 음성 1분당으로 표시합니다.
  • 「저렴한 가격」은 1M 글자당 5 USD 미만인 모델입니다.

표 읽는 법

막대 길이는 불확실성 범위이며, 두 모델의 범위가 겹치면 들어 보고 느끼는 차이가 뚜렷하지 않다고 봅니다. 티어는 범위 전체가 자기보다 위에 있는 모델 수로 순위를 정하고, 그 비율에 따라 S(10% 미만), A(30% 미만), B(60% 미만), C(85% 미만), D로 나눕니다. 음성 모델은 점수가 서로 가깝고 범위가 넓어서 S에 많은 모델이 함께 들어갑니다.

평가 범위

평가하는 것은 문장을 읽어 주는 음성 합성(text-to-speech)뿐입니다. 음성을 글자로 바꾸는 음성 인식 모델은 출처에 그런 아레나가 없어 싣지 않았습니다. 목소리 평가는 주로 영어로 이뤄지므로, 한국어 읽기의 자연스러움은 따로 확인해야 합니다. 후보를 좁혔다면 실제 원고로 들어 보십시오.

용도에 맞게 고르기

내레이션이나 읽어 주기 기능에 넣으려면 목소리의 자연스러움뿐 아니라 긴 글을 읽힐 때의 비용도 중요합니다. 「저렴한 가격」 표시로 후보를 줄이고, 한 달에 읽힐 글자 수로 비용을 어림한 뒤 실제 원고로 비교해 보십시오.