跳到主要內容
fedi.software

文字

依 LMArena 盲測投票排名的聊天模型,列出每個評分的信賴區間與目前每百萬 token 的價格。

更新日期 · 來源: LMArena, LiteLLM, models.dev

每月費用
等級 模型 Elo 輸入/輸出,每百萬 每月 上下文 應用程式 比較
S1,482US$0.338 / US$1.01 1M
S1,476US$0.825 / US$2.48 1M
S1,470— —
S1,462US$0.0015 / US$0.09免費 1M
S1,455US$0.282 / US$1.13 1M
S1,451US$0.2088 / US$0.4176 1M
S1,448US$0.959 / US$2.74 1M
S1,447US$1.03 / US$6.16 262K
A1,441US$0.045 / US$0.32 262K
A1,439US$0.36 / US$1.43 262K
A1,438US$0.1644 / US$0.9864免費 262K
A1,437US$0.276 / US$1.65 1M
A1,432US$0.035 / US$0.07 1M
A1,428US$0.25 / US$0.25 164K
A1,425US$0.22 / US$0.33 164K
A1,424US$0.18 / US$0.35 164K
A1,420US$0.25 / US$0.70 128K
A1,420US$0.20 / US$0.88 131K
A1,420US$0.19 / US$0.71 164K
A1,419US$0.09 / US$0.55 131K
A1,417US$0.144 / US$0.574免費 131K
A1,417US$0.1126 / US$0.9008免費 262K
A1,415US$0.11 / US$0.60 131K
A1,409US$0.0846 / US$0.6768 262K
B1,403US$0.09 / US$0.30免費 256K
B1,401US$0.287 / US$2.87 131K
B1,397US$0.0282 / US$0.282 1M
B1,394US$0.0564 / US$0.4512 262K
B1,384US$0.09 / US$0.30 256K
B1,375US$0.10 / US$0.425 164K
B1,373US$0.40 / US$0.40 80K
B1,368US$0.15 / US$0.65 131K
B1,367— —
B1,356US$0.13 / US$0.50免費 262K
B1,351US$0.21 / US$0.57 66K
B1,340US$0.05 / US$0.10 131K
B1,336— —
B1,329US$0.18 / US$0.20 24K
B1,326US$0.115 / US$0.287 1M
B1,321US$5.21 / US$16.44 16K
B1,317US$0.0509 / US$0.335 41K
B1,299— —
B1,294— —
B1,282US$0.345 / US$1.38 33K
C1,269US$0.12 / US$0.30 131K
C1,230US$0.06 / US$0.20免費 33K
C1,203US$0.90 / US$0.90 33K
C1,191— 33K
C1,175— —
C1,166— —
C1,137— —
C1,128— —
C1,105— —
D1,083— —
D1,051— —
D997— —
比較 ()

等級由我們自行計算:模型在排行榜中的名次,只計入整個信賴區間都高於它的模型。S — 前 10%,A — 至 30%,B — 至 60%,C — 至 85%,D — 其餘。

品質與價格 縱軸為評分,橫軸為混合價格(輸入 3:輸出 1),USD/每百萬 token
1,000 1,200 1,400 1,600 US$0.01 US$0.10 US$1 US$10 US$100 Claude Opus 5.5 Claude Fable 5.1 Claude Opus 5

文字模型排行榜使用 LMArena 文字競技場的整體(overall)類別。使用者送出任意問題,看到兩個匿名模型的回答後投票選出較好的一個,這些票數再換算成 Elo 式評分。我們在評分旁加上價格、上下文長度與價格走勢。

每一列顯示什麼

  • 等級與評分,以及 95% 信賴區間(橫條);
  • 開發商,權重公開時標示「開放權重」;
  • 目前每 1M 輸入與輸出 token 的最低價格,以及上下文長度;
  • 30 天價格變化;模型的 App 在我們目錄中時,附上下載連結。

點擊任一列會展開詳細資料:由便宜到貴排列的供應商、模態、最大輸出、票數、來源排名、授權、發佈日期與知識截止日。勾選方塊可把模型加入比較,一次最多 4 個。

如何解讀評分

兩個模型的信賴區間重疊時,差距在統計上並不明確,所以多個模型可能同在最高等級。票數少於 300 的模型還沒有等級,顯示為「尚未分級」。評分代表競技場使用者的偏好,而且題目多為英文;它不衡量速度、成本或特定任務的表現,請把它當作起點。

價格與試算

價格是資料當天在各供應商中找到的最低價,以美元計。供應商價格可能與開發商價格不同,快取、批次折扣與地區價格未列入。本榜的「低價」篩選代表混合價格低於每 1M token 1 美元,混合價格以輸入 3 份、輸出 1 份計算。「每月費用」試算依每月 token 數與輸入比例估算成本,「品質與價格」圖表則幫您找出評分高又不貴的模型。

篩選與排序

可以依開放權重、免費、低價或開發商篩選,並依評分、價格、上下文或名稱排序。寫程式請看 程式設計排行榜,想免費試用請看 免費 API。

來源:評分 LMArena;價格、上下文與模態 models.dev 與 LiteLLM。