跳到主要內容
fedi.software

代理

依 LMArena 代理排行榜,在代理任務(工具呼叫與多步驟工作)上的模型排名。其分數以零為中心,並非 Elo。

更新日期 · 來源: LMArena, LiteLLM, models.dev

每月費用
等級 模型 分數 輸入/輸出,每百萬 每月 上下文 應用程式 比較
B0.005US$0.959 / US$2.74 1M
C-0.069US$0.20 / US$0.90免費 1M
比較 ()

等級由我們自行計算:模型在排行榜中的名次,只計入整個信賴區間都高於它的模型。S — 前 10%,A — 至 30%,B — 至 60%,C — 至 85%,D — 其餘。

品質與價格 縱軸為評分,橫軸為混合價格(輸入 3:輸出 1),USD/每百萬 token
-0.2 -0.1 0.0 0.1 0.2 US$0.01 US$0.10 US$1 US$10 Claude Fable 5.1 Claude Opus 5.5 Claude Sonnet 5.5

先說重點:這不是 Elo

代理排行榜和其他排行榜不同。LMArena 在這裡公布的不是 Elo,而是以零為中心、可正可負的分數。欄位名稱因此是「分數」,並顯示到小數點後三位。請不要把這些數字和文字或程式設計排行榜的 Elo 相比,它們是不同的尺度。

評的是什麼

模型要完成需要呼叫工具的多步驟任務,例如搜尋、讀取檔案或執行指令,再由人評判哪個完成得比較好。這裡的票數以工作階段計算,而不是單一回答。分數高於零,代表比本榜的平均模型更常被選中;低於零則相反。

等級與票數

S、A、B、C、D 等級的規則與其他排行榜相同:計入至少 300 票的模型,名次依信賴區間決定,門檻為 10%、30%、60% 與 85%。票數不足的模型顯示「尚未分級」。

閱讀方式

  • 只在這份排行榜內比較模型;
  • 信賴區間重疊時,小小的分數差距不代表明確領先;
  • 每 1M token 價格與其他榜相同,但代理任務會消耗大量 token,請用試算確認成本。

限制

這是較新的排行榜,模型數量比文字榜少。競技場使用的代理框架也不是您會用的那一套,實際結果可能不同。在這裡表現好的模型,適合拿到 程式設計代理 或 自動化 工具中實測,但不是保證。

聊天與寫作請改看 文字排行榜。來源:評分 LMArena agent;價格 models.dev 與 LiteLLM。