跳到主要內容
fedi.software

音訊

依 TTS Arena 聽眾盲測偏好排名的語音合成模型,價格以每百萬字元或每分鐘計。

更新日期 · 來源: LiteLLM, TTS Arena

等級 模型 Elo 價格,USD/每百萬字元 上下文 應用程式 比較
S1,525— —
比較 ()

等級由我們自行計算:模型在排行榜中的名次,只計入整個信賴區間都高於它的模型。S — 前 10%,A — 至 30%,B — 至 60%,C — 至 85%,D — 其餘。

這個來源的特別之處

音訊排行榜評比的是文字轉語音模型,來源不是 LMArena,而是 TTS Arena V2,由 TTS-AGI 社群維護的開放專案。這個來源會公布票數,因此同樣套用「至少 300 票」的規則:票數不足的模型顯示「尚未分級」。部分列是尚未發布、以代號出現的模型,沒有廠商也沒有價格。

評分怎麼來

聆聽者在不知道模型名稱的情況下,比較兩個朗讀同一段文字的聲音,選出聽起來較好的一個。這些選擇換算成 Elo 評分與不確定範圍;名次看有多少模型的整個範圍都在它之上,再依門檻 10%、30%、60%、85% 分成 S、A、B、C、D。語音模型的評分接近、範圍又寬,所以會有許多模型同時落在 S 級。

價格

  • 依供應商不同,以每 1M 字元或每分鐘音訊計價;
  • 「低價」代表每 1M 字元低於 5 美元;
  • 單位寫在欄位標題中,請比較相同的單位。

本頁不包含什麼

語音轉文字(聽寫)模型沒有評分,因為來源沒有這類競技場。聲音大多以英文評比,英文聽起來自然的模型,唸中文時可能不同。為 Podcast、有聲書或語音助理挑選聲音前,請用自己的文字測試,特別注意聲調與人名的發音。

怎麼挑選

先篩出有 API 且價格合適的模型,再到供應商頁面試聽。長篇內容請依字元數估算費用,並確認供應商是否限制單次請求的長度。取得管道見 API 供應商,多個模型對照見 比較。

來源:評分 TTS Arena V2;價格 models.dev、LiteLLM。