跳到主要內容
fedi.software

網頁開發

依 LMArena WebDev 競技場中從提示建構可運作網頁應用程式的能力排名的模型,附價格與上下文。

更新日期 · 來源: LMArena, LiteLLM, models.dev

每月費用
等級 模型 Elo 輸入/輸出,每百萬 每月 上下文 應用程式 比較

目前還沒有內容。

比較 ()

等級由我們自行計算:模型在排行榜中的名次,只計入整個信賴區間都高於它的模型。S — 前 10%,A — 至 30%,B — 至 60%,C — 至 85%,D — 其餘。

品質與價格 縱軸為評分,橫軸為混合價格(輸入 3:輸出 1),USD/每百萬 token
1,000 1,200 1,400 1,600 1,800 2,000 US$0.01 US$0.10 US$1 US$10 Claude Opus 5.5 GPT-6 Astra Claude Sonnet 5.5

在網頁開發排行榜上,模型不是回答問題,而是動手做。LMArena WebDev 競技場給兩個模型同樣的需求,例如一個小遊戲、價目表頁面或儀表板,兩者各自做出可運作的網頁應用程式,使用者比較成果後投票,事先不知道哪個模型做了哪一個。

評分反映什麼

評分反映的是整體成果:版面、程式能否運作、是否符合要求,而不只是程式碼風格。寫得整齊卻無法執行的程式,在這裡拿不到多少票。因此這份排行榜常和 程式設計排行榜 不同,後者評的是聊天中的回答。

自己的一組模型

WebDev 有自己的模型清單,和文字、程式設計排行榜不一樣,但欄位相同:

  • 等級與 Elo 評分,附 95% 信賴區間;
  • 最便宜供應商的每 1M token 價格;
  • 上下文長度與價格走勢;
  • 可加入比較。

限制

競技場中的應用程式規模都很小,含多個檔案、資料庫與登入系統的大型專案並不在評分範圍內。票數少於 300 的模型顯示為「尚未分級」。評分也看不出模型完成任務用了多少 token,長任務的成本差異可能很大,請用「每月費用」試算確認。

怎麼使用這份排行榜

想快速做出網站原型或內部工具時,先挑幾個高等級模型,用自己的需求測試,再到 比較 頁面對照價格與上下文。若在編輯器或終端機中搭配代理使用,也請看 程式設計代理,因為結果也取決於驅動模型的工具。

來源:評分 LMArena WebDev;價格 models.dev 與 LiteLLM。