Vai al contenuto
fedi.software

Programmazione

Modelli classificati su prompt di programmazione: tier, Elo con il suo intervallo di confidenza, prezzo per milione di token e finestra di contesto.

Aggiornato · Fonti: LMArena, LiteLLM, models.dev

Costo mensile
Tier Modello Elo Input / output, per 1M Al mese Contesto App Confronta
S1.5350,40 USD / 0,80 USD 1M
S1.5354 USD / 20 USD 1M
S1.5354,30 USD / 21 USD 1M
S1.5345 USD / 25 USD 1M
S1.52510 USD / 50 USD 1M
S1.5203 USD / 18,50 USD 1M
S1.5192 USD / 10 USD 1M
S1.5184,30 USD / 21 USD 1M
S1.5110,10 USD / 0,25 USD 1M
S1.5040,90 USD / 5,55 USD 1M
S1.5030,71 USD / 3,57 USD 200K
S1.5020,40 USD / 0,80 USD 1M
S1.4900,425 USD / 2,12 USD 1M
S1.4890,959 USD / 2,74 USD 1M
S1.4880,43 USD / 2,14 USD 1M
S1.4831,44 USD / 7,20 USD 1M
S1.47913 USD / 64 USD 197K
S1.4760,435 USD / 0,87 USD 1M
A1.4690,14 USD / 0,28 USD 1M
A1.4670,14 USD / 0,28 USD 262K
A1.4530,14 USD / 0,71 USD 200K
A1.4430,10 USD / 0,30 USD 262K
A1.44213 USD / 64 USD 193K
A1.4360,09 USD / 0,30 USDGratis 256K
B1.4142,60 USD / 13 USD 983K
B1.3670,21 USD / 0,57 USD 66K
B1.3613 USD / 15 USD 200K
B1.3423 USD / 15 USD 200K
B1.339— —
B1.3165,21 USD / 16,44 USD 16K
B1.2870,80 USD / 4 USD 200K
C1.26415 USD / 75 USD 200K
C1.2233 USD / 15 USD 200K
C1.1990,25 USD / 1,25 USD 200K
Confronta ()

I tier sono nostri: la posizione di un modello nella classifica contando solo i modelli il cui intervallo di confidenza è interamente sopra il suo. S — primo 10%, A — fino al 30%, B — fino al 60%, C — fino all'85%, D — il resto.

Qualità e prezzo punteggio in verticale, prezzo combinato (3 parti di input : 1 di output) in orizzontale, USD per 1M di token
1.000 1.200 1.400 1.600 0,01 USD 0,10 USD 1 USD 10 USD 100 USD MiMo-V2.6-Pro Claude Opus 5.5 Claude Opus 4.6

Che cosa misura questa classifica?

È la categoria di programmazione della text arena di LMArena: stessi voti alla cieca della classifica di testo, ma solo sui prompt che riguardano il codice. Le persone chiedono di scrivere una funzione, spiegare un errore o riorganizzare un pezzo di programma, confrontano due risposte anonime e votano. Il risultato è un punteggio Elo con intervallo di confidenza al 95%, trasformato nei tier S, A, B, C e D con la stessa regola delle altre classifiche.

In cosa è diversa dalle altre?

Valuta le risposte in una chat sul codice. Costruire un'intera applicazione web è un'altra prova, con una sua classifica di sviluppo web; il lavoro in più passaggi con strumenti e comandi ha invece la classifica degli agenti. Un modello forte qui non è per forza il compagno ideale per un agente che modifica un progetto vero.

Quali colonne guardare?

  • Tier e Elo, con la barra dell'intervallo: se due barre si sovrappongono, la differenza non è netta.
  • Prezzo in USD per milione di token, con l'andamento di 30 giorni e il filtro «Prezzo basso» (prezzo combinato sotto 1 USD).
  • Contesto: per lavorare su un intero repository conta molto, confrontalo accanto al prezzo.
  • Confronta: spunta fino a 4 modelli per vederli fianco a fianco.

Il calcolatore del costo mensile e il grafico «Qualità e prezzo» funzionano come nella classifica di testo, con il prezzo combinato calcolato 3 a 1 tra input e output.

Ci sono limiti da conoscere?

Sì. Un modello riceve il tier solo con almeno 300 voti; prima compare come «Tier non ancora assegnato». Soprattutto, rispondere bene in chat su un frammento di codice non equivale a far passare i test su un progetto reale, con dipendenze, configurazioni e file sparsi. Usa la classifica per scegliere i candidati, poi provali sul tuo codice. I punteggi vengono da LMArena, i prezzi da models.dev e LiteLLM, con la data dei dati sopra la tabella.