Μετάβαση στο περιεχόμενο
fedi.software

Προγραμματισμός

Μοντέλα κατατεταγμένα σε προτροπές προγραμματισμού: βαθμίδα, Elo με το διάστημα εμπιστοσύνης του, τιμή ανά εκατομμύριο tokens και παράθυρο συμφραζομένων.

Ενημερώθηκε · Πηγές: LMArena, LiteLLM, models.dev

Κόστος ανά μήνα
Βαθμίδα Μοντέλο Elo Είσοδος / έξοδος, ανά 1 εκατ. Ανά μήνα Συμφραζόμενα Εφαρμογή Σύγκριση
B1.396— —
B1.3780,06 $ / 0,25 $ 131K
B1.363— —
B1.3302,50 $ / 10 $ 256K
B1.3120,05 $ / 0,10 $ 131K
C1.247— —
C1.2282 $ / 8 $ 256K
C1.1970,50 $ / 1,50 $ 128K
C1.1872,50 $ / 10 $ 128K
C1.186— —
C1.1780,20 $ / 0,40 $ 256K
C1.1722,50 $ / 10 $ 128K
C1.1690,15 $ / 0,60 $ 128K
C1.149— —
C1.1280,15 $ / 0,60 $ 128K
C1.113— —
C1.090— —
Σύγκριση ()

Οι βαθμίδες είναι δικές μας: η θέση ενός μοντέλου στην κατάταξη, μετρώντας μόνο τα μοντέλα των οποίων ολόκληρο το διάστημα εμπιστοσύνης βρίσκεται πάνω από αυτό. S — κορυφαίο 10%, A — έως 30%, B — έως 60%, C — έως 85%, D — τα υπόλοιπα.

Ποιότητα έναντι τιμής βαθμολογία κάθετα, μικτή τιμή (3 μέρη εισόδου : 1 εξόδου) οριζόντια, USD ανά 1 εκατ. tokens
1.000 1.200 1.400 1.600 0,01 $ 0,10 $ 1 $ 10 $ 100 $ MiMo-V2.6-Pro Claude Opus 5.5 Claude Opus 4.6

Τι μετρά αυτός ο πίνακας;

Ο πίνακας προγραμματισμού είναι η κατηγορία coding της αρένας κειμένου του LMArena. Ισχύει η ίδια τυφλή ψηφοφορία με τον πίνακα κειμένου, αλλά μόνο για αιτήματα που αφορούν κώδικα: εξήγηση συνάρτησης, εύρεση σφάλματος, σενάριο αυτοματισμού. Ο χρήστης βλέπει δύο απαντήσεις χωρίς να ξέρει τα μοντέλα και ψηφίζει αυτή που βοήθησε περισσότερο. Οι ψήφοι γίνονται βαθμολογία Elo με διάστημα εμπιστοσύνης 95%.

Σε τι διαφέρει από τους πίνακες Web dev και Πράκτορες;

Εδώ βαθμολογούνται απαντήσεις σε συνομιλία για κώδικα. Αν σας ενδιαφέρουν μοντέλα που φτιάχνουν ολόκληρη εφαρμογή web από ένα αίτημα, δείτε τον πίνακα Web dev· για εργασίες πολλών βημάτων όπου το μοντέλο καλεί εργαλεία μόνο του, τον πίνακα Πράκτορες. Κάθε πίνακας έχει δικό του σύνολο μοντέλων και κλίμακα, οπότε συγκρίνετε μέσα στον ίδιο πίνακα.

Ποιες στήλες μετράνε για προγραμματισμό;

  • Βαθμίδα και Elo: πόσο συχνά οι χρήστες προτίμησαν τις απαντήσεις του μοντέλου.
  • Παράθυρο πλαισίου: σημαντικό όταν δίνετε στο μοντέλο ολόκληρο αποθετήριο ή πολλά αρχεία· δείτε το μαζί με την τιμή.
  • Τιμή ανά 1M tokens και τάση 30 ημερών: για εκτίμηση κόστους σε συχνή χρήση.
  • Υπολογιστής και γράφημα: αν η επιπλέον ποιότητα αξίζει την τιμή, με σύγκριση έως 4 μοντέλων.

Υψηλή θέση σημαίνει ότι ο κώδικας θα δουλέψει;

Όχι απαραίτητα. Μια απάντηση που αρέσει σε συνομιλία δεν είναι το ίδιο με τεστ σε πραγματικό έργο· ένα μοντέλο μπορεί να γράφει ευανάγνωστο κώδικα που αποτυγχάνει σε ακραίες περιπτώσεις του συστήματός σας. Ο κανόνας βαθμίδων είναι ίδιος με τον πίνακα κειμένου: χρειάζονται τουλάχιστον 300 ψήφοι, αλλιώς εμφανίζεται «Χωρίς βαθμίδα ακόμη». Οι τιμές προέρχονται από το models.dev και το LiteLLM την ημέρα των δεδομένων.

Πώς επιλέγω πρακτικά;

Διαλέξτε δύο μοντέλα με κοντινή βαθμίδα αλλά διαφορετική τιμή και δώστε τους το ίδιο πραγματικό σφάλμα από τον κώδικά σας. Αν τα αποτελέσματα είναι παρόμοια, το φθηνότερο συνήθως συμφέρει για την καθημερινή δουλειά. Αν θα χρησιμοποιήσετε το μοντέλο μέσα από πράκτορα τερματικού ή επέκταση επεξεργαστή κώδικα, δείτε τη σελίδα Πράκτορες κώδικα.