Langsung ke konten
fedi.software

Pemrograman

Model yang diperingkat pada prompt pemrograman: tier, Elo dengan interval kepercayaannya, harga per sejuta token, dan jendela konteks.

Diperbarui · Sumber: LMArena, LiteLLM, models.dev

Biaya per bulan
Tier Model Elo Input / output, per 1 jt Per bulan Konteks Aplikasi Bandingkan
S1.510US$1 / US$4Gratis 1M
S1.489US$0,275 / US$1,10Gratis 262K
S1.483US$0,30 / US$1,90 262K
A1.468US$0,10 / US$0,10 1M
A1.453US$1,15 / US$8 262K
B1.403US$0,05 / US$0,25 262K
B1.399US$0,40 / US$1,80 256K
B1.396— —
B1.378US$0,06 / US$0,25 131K
B1.378US$0,05 / US$0,20Gratis 131K
B1.371US$0,0115 / US$0,17 1M
B1.363— —
B1.354US$0,40 / US$0,40Gratis 131K
B1.312US$0,05 / US$0,10 131K
B1.312Gratis 128K
–1.296— —
C1.272US$0,357 / US$0,408Gratis 128K
C1.247— —
C1.223— —
C1.209— —
C1.186— —
C1.149— —
C1.113— —
C1.090— —
D1.025— —

Tier ditentukan oleh kami: posisi model di papan peringkat dengan hanya menghitung model yang seluruh interval kepercayaannya berada di atasnya. S — 10% teratas, A — hingga 30%, B — hingga 60%, C — hingga 85%, D — sisanya.

Kualitas vs harga rating ke atas, harga gabungan (3 bagian input : 1 output) ke samping, USD per 1 jt token
1.000 1.200 1.400 1.600 US$0,01 US$0,10 US$1 US$10 US$100 MiMo-V2.6-Pro Claude Opus 5.5 Claude Opus 4.6

Apa yang diukur di sini

Papan pemrograman memakai kategori coding dari arena teks LMArena. Metodenya sama dengan papan umum, yaitu pemungutan suara buta atas dua jawaban anonim, tetapi hanya untuk pertanyaan tentang kode. Nilainya bergaya Elo dengan interval kepercayaan 95%, dan tier mengikuti aturan yang sama di seluruh bagian ini: minimal 300 suara, lalu batas 10, 30, 60, dan 85%.

Langkah memilih model untuk pemrograman

  1. Saring kandidat dari tier teratas. Ingat, interval yang bertumpang tindih berarti selisihnya tidak nyata secara statistik.
  2. Bandingkan jendela konteks dengan harga. Untuk bekerja pada seluruh repositori, konteks panjang sangat berarti karena menentukan berapa banyak kode yang bisa dibaca sekaligus.
  3. Hitung perkiraan biaya di kalkulator “Biaya per bulan” dan lihat tren harga 30 hari.
  4. Centang hingga 4 kandidat dan bandingkan di halaman perbandingan.
  5. Uji kandidat pada proyek Anda sendiri sebelum memutuskan.

Batas penilaian

Papan ini menilai jawaban dalam percakapan tentang kode. Itu tidak sama dengan menjalankan tes pada proyek nyata yang punya dependensi, riwayat, dan aturan tim. Untuk jenis pekerjaan lain tersedia papan terpisah:

  • membangun aplikasi web utuh dari satu permintaan: web dev;
  • tugas bertahap dengan pemanggilan alat: agen;
  • percakapan umum: teks.

Kesalahan yang sering terjadi

Banyak orang langsung memilih model teratas tanpa melihat harga. Padahal pekerjaan kode memakan banyak token. Model yang sedikit lebih rendah bisa jauh lebih hemat. Ada juga yang lupa memeriksa jendela konteks, lalu kaget ketika model tidak bisa membaca berkas besar sekaligus. Cek keduanya sebelum berlangganan.

Setelah memilih model

Alat seperti Claude Code, Cursor, atau Aider bergantung pada model di belakangnya. Setelah menemukan kandidat di sini, lihat pilihan alatnya di halaman agen pemrograman. Model yang belum mencapai 300 suara tampil sebagai “Belum ada tier” sampai suaranya cukup, jadi pantau kembali papan ini secara berkala.