跳到主要內容
fedi.software

程式設計

依程式設計提示排名的模型:等級、附信賴區間的 Elo、每百萬 token 價格與上下文視窗。

更新日期 · 來源: LMArena, LiteLLM, models.dev

每月費用
等級 模型 Elo 輸入/輸出,每百萬 每月 上下文 應用程式 比較
S1,515US$0.10 / US$0.20 1M
S1,502US$0.338 / US$1.01 1M
S1,497US$1.25 / US$4.25 1M
S1,497US$0.825 / US$2.48 1M
S1,494US$0.10 / US$0.20 1M
S1,487— —
S1,485US$0.045 / US$0.32 262K
S1,482— —
S1,473US$0.282 / US$1.13 1M
S1,472US$1.03 / US$6.16 262K
A1,467US$0.276 / US$1.65 1M
A1,464US$0.1644 / US$0.9864免費 262K
A1,456US$0.36 / US$1.43 262K
A1,445US$0.09 / US$0.55 131K
A1,440US$0.144 / US$0.574免費 131K
A1,438US$0.20 / US$0.88 131K
A1,436US$0.1126 / US$0.9008免費 262K
A1,427US$0.0846 / US$0.6768 262K
A1,425US$0.287 / US$2.87 131K
A1,424US$0.11 / US$0.60 131K
A1,417— —
B1,416US$0.09 / US$0.30 256K
B1,412US$0.13 / US$0.50免費 262K
B1,412US$0.0282 / US$0.282 1M
B1,410US$0.0564 / US$0.4512 262K
B1,392US$0.15 / US$0.65 131K
B1,359— —
B1,358US$0.05 / US$0.10 131K
B1,347— —
B1,337US$0.0509 / US$0.335 41K
B1,333US$0.18 / US$0.20 24K
B1,328US$0.115 / US$0.287 1M
B1,319— —
B1,314— —
B1,302US$0.05 / US$0.10免費 1M
B1,292US$0.12 / US$0.30 131K
B1,291US$3.50 / US$3.50 4K
B1,288US$0.345 / US$1.38 33K
B1,286US$0.05 / US$0.10 328K
B1,276US$0.06 / US$0.20免費 33K
C1,268US$0.05 / US$0.23免費 24K
C1,260US$0.40 / US$0.40免費 131K
C1,235— —
C1,210— —
C1,206US$0.51 / US$0.74 8K
C1,196US$0.90 / US$0.90 33K
C1,195US$0.02 / US$0.04免費 32K
C1,184— —
C1,183— —
C1,165— —
C1,155— —
C1,152US$0.04 / US$0.04 8K
C1,138— —
C1,107— —
C1,098US$0.02 / US$0.02免費 80K
D1,079US$1 / US$1 4K
D1,072— —
D1,071US$0.01 / US$0.01免費 60K
D1,062US$0.10 / US$0.50 4K
D1,046— —
D1,016— —
D1,002US$0.05 / US$0.25 4K
D999— —
D683— —
比較 ()

等級由我們自行計算:模型在排行榜中的名次,只計入整個信賴區間都高於它的模型。S — 前 10%,A — 至 30%,B — 至 60%,C — 至 85%,D — 其餘。

品質與價格 縱軸為評分,橫軸為混合價格(輸入 3:輸出 1),USD/每百萬 token
1,000 1,200 1,400 1,600 US$0.01 US$0.10 US$1 US$10 US$100 MiMo-V2.6-Pro Claude Opus 5.5 Claude Opus 4.6

這個排行榜衡量什麼?

程式設計排行榜採用 LMArena 文字競技場的 coding 類別:同樣是盲測投票,但只計入和程式碼有關的問題,例如解釋錯誤、撰寫函式或轉換程式語言。票數換算成 Elo 評分,並附上 95% 信賴區間。

表格裡有哪些資料?

欄位與文字排行榜相同:等級、Elo 與區間、每 1M token 價格、上下文長度、30 天價格走勢,也提供「每月費用」試算、「品質與價格」圖表,以及最多 4 個模型的比較。

評分高就代表會做完整網站嗎?

不一定。這裡評的是聊天中的程式碼回答;建立完整網頁應用程式另有 網頁開發排行榜,多步驟使用工具則看 代理排行榜。聊天回答也不等於在真實專案中跑測試,正式使用前請用自己的程式碼試試看。

為什麼要看上下文長度?

想讓模型參考整個儲存庫時,需要一次放入大量內容,較長的上下文才裝得下;但每多一個 token 都要付費。請把上下文和價格一起比較,處理單一檔案時,較短的上下文往往就夠用。

模型什麼時候會有等級?

累積到至少 300 票之後。在那之前會標示「尚未分級」。等級依信賴區間的重疊計算,與榜首無法區分的模型並列第一,所以 S 級可能同時有好幾個模型。

選擇前還要確認什麼?

  • 您實際使用的供應商價格,可能與表中最低價不同;
  • 您的程式設計代理是否支援這個模型(見 程式設計代理);
  • 若要在自己的伺服器上執行,確認是否為開放權重及其授權。

來源:評分 LMArena;價格 models.dev 與 LiteLLM。