Langsung ke konten
fedi.software

Agen

Model yang diperingkat pada tugas agentik — pemanggilan alat dan pekerjaan multi-langkah — menurut papan peringkat agen LMArena. Skornya berpusat di nol, bukan Elo.

Diperbarui · Sumber: LMArena, LiteLLM, models.dev

Biaya per bulan
Tier Model Skor Input / output, per 1 jt Per bulan Konteks Aplikasi Bandingkan
S0,076— —
A0,030US$0,75 / US$3,75 1M
B-0,006US$0,10 / US$0,25 1M
B-0,015US$0,75 / US$3,75 1M
C-0,069US$0,20 / US$0,90Gratis 1M
C-0,075US$0,40 / US$0,80 1M
C-0,077US$0,375 / US$1,88 1M
C-0,077US$1 / US$6 1M

Tier ditentukan oleh kami: posisi model di papan peringkat dengan hanya menghitung model yang seluruh interval kepercayaannya berada di atasnya. S — 10% teratas, A — hingga 30%, B — hingga 60%, C — hingga 85%, D — sisanya.

Kualitas vs harga rating ke atas, harga gabungan (3 bagian input : 1 output) ke samping, USD per 1 jt token
-0,2 -0,1 0,0 0,1 0,2 US$0,01 US$0,10 US$1 US$10 Claude Fable 5.1 Claude Opus 5.5 Claude Sonnet 5.5

Mengapa nilainya berbeda dari papan lain?

Papan agen memakai leaderboard agen dari LMArena, dan metriknya bukan Elo. Setiap model mendapat skor yang berpusat di nol, kira-kira dari nilai negatif sampai positif. Kolomnya bernama “Skor” dan menampilkan tiga angka di belakang koma. Karena skalanya lain, bandingkan model hanya di dalam papan ini dan jangan pernah menyandingkan angkanya dengan nilai Elo dari papan teks, pemrograman, atau gambar.

Tugas seperti apa yang dinilai?

Arena memberikan tugas bertahap yang mengharuskan model memanggil alat: mencari informasi, menjalankan tindakan, membaca hasilnya, lalu melanjutkan. Manusia menilai seluruh sesi, dan setiap sesi dihitung sebagai satu suara. Skor di atas nol berarti model tersebut lebih sering dipilih dibanding model rata-rata di papan ini.

Bagaimana tier dihitung?

Sama seperti di papan lain: minimal 300 suara, interval kepercayaan 95%, dan batas 10, 30, 60, serta 85%. Harga tetap per 1M token, lengkap dengan kalkulator “Biaya per bulan”. Pada tugas agen, satu pekerjaan sering menghabiskan banyak token, jadi simulasikan biaya sebelum memakai model dalam skala besar.

Apa kelemahan papan ini?

  • Papannya masih muda dan jumlah modelnya lebih sedikit dibanding papan teks.
  • Kerangka agen yang dipakai di arena bukan kerangka yang akan Anda gunakan; alat, izin, dan instruksi yang berbeda bisa mengubah hasil.

Anggap skor sebagai titik awal, lalu uji model di alur kerja Anda sendiri.

Bagaimana cara menguji sendiri?

Pilih satu tugas nyata yang berulang. Contohnya merapikan berkas laporan atau mencari informasi lalu menuliskannya ke dokumen. Beri tugas yang sama ke dua model. Catat berapa langkah yang dibutuhkan, berapa token terpakai, dan apakah hasilnya benar. Angka itu lebih berguna daripada skor mana pun.

Ke mana setelah ini?

Untuk pemrograman di terminal atau editor, buka halaman agen pemrograman. Untuk mengotomatiskan pekerjaan antaraplikasi, lihat otomasi. Jika agen Anda mendukung skill, direktori skill menunjukkan mana yang “Sedang tren”. Centang hingga 4 model untuk dibandingkan.