跳到主要內容
fedi.software

文字

依 LMArena 盲測投票排名的聊天模型,列出每個評分的信賴區間與目前每百萬 token 的價格。

更新日期 · 來源: LMArena, LiteLLM, models.dev

每月費用
等級 模型 Elo 輸入/輸出,每百萬 每月 上下文 應用程式 比較
S1,471US$0.40 / US$1.40免費 1M
S1,470US$0.30 / US$1.05免費 1M
S1,470US$0.03 / US$0.10免費 1M
S1,461US$0.45 / US$2.15 200K
A1,446US$0.40 / US$1.75 205K
A1,440US$0.2740 / US$1.10 205K
A1,437US$0.7042 / US$3.10 200K
A1,436US$0.2740 / US$1.10 205K
A1,430US$0.286 / US$1.14 131K
A1,427— 131K
B1,384US$0.1165 / US$0.2911 131K
B1,377US$0.137 / US$0.411 128K
B1,355US$0.25 / US$0.75 128K
B1,351US$0.06 / US$0.40 200K
B1,333US$0.29 / US$0.86 64K
B1,331US$10.00 / US$10.00 128K
B1,282— —
C1,226— —
D972— —
D939— —
D918— —
比較 ()

等級由我們自行計算:模型在排行榜中的名次,只計入整個信賴區間都高於它的模型。S — 前 10%,A — 至 30%,B — 至 60%,C — 至 85%,D — 其餘。

品質與價格 縱軸為評分,橫軸為混合價格(輸入 3:輸出 1),USD/每百萬 token
1,000 1,200 1,400 1,600 US$0.01 US$0.10 US$1 US$10 US$100 Claude Opus 5.5 Claude Fable 5.1 Claude Opus 5

文字模型排行榜使用 LMArena 文字競技場的整體(overall)類別。使用者送出任意問題,看到兩個匿名模型的回答後投票選出較好的一個,這些票數再換算成 Elo 式評分。我們在評分旁加上價格、上下文長度與價格走勢。

每一列顯示什麼

  • 等級與評分,以及 95% 信賴區間(橫條);
  • 開發商,權重公開時標示「開放權重」;
  • 目前每 1M 輸入與輸出 token 的最低價格,以及上下文長度;
  • 30 天價格變化;模型的 App 在我們目錄中時,附上下載連結。

點擊任一列會展開詳細資料:由便宜到貴排列的供應商、模態、最大輸出、票數、來源排名、授權、發佈日期與知識截止日。勾選方塊可把模型加入比較,一次最多 4 個。

如何解讀評分

兩個模型的信賴區間重疊時,差距在統計上並不明確,所以多個模型可能同在最高等級。票數少於 300 的模型還沒有等級,顯示為「尚未分級」。評分代表競技場使用者的偏好,而且題目多為英文;它不衡量速度、成本或特定任務的表現,請把它當作起點。

價格與試算

價格是資料當天在各供應商中找到的最低價,以美元計。供應商價格可能與開發商價格不同,快取、批次折扣與地區價格未列入。本榜的「低價」篩選代表混合價格低於每 1M token 1 美元,混合價格以輸入 3 份、輸出 1 份計算。「每月費用」試算依每月 token 數與輸入比例估算成本,「品質與價格」圖表則幫您找出評分高又不貴的模型。

篩選與排序

可以依開放權重、免費、低價或開發商篩選,並依評分、價格、上下文或名稱排序。寫程式請看 程式設計排行榜,想免費試用請看 免費 API。

來源:評分 LMArena;價格、上下文與模態 models.dev 與 LiteLLM。