Vai al contenuto
fedi.software

Programmazione

Modelli classificati su prompt di programmazione: tier, Elo con il suo intervallo di confidenza, prezzo per milione di token e finestra di contesto.

Aggiornato · Fonti: LMArena, LiteLLM, models.dev

Costo mensile
Tier Modello Elo Input / output, per 1M Al mese Contesto App Confronta
S1.5060,03 USD / 0,10 USDGratis 1M
S1.4970,40 USD / 1,40 USDGratis 1M
S1.4860,45 USD / 2,15 USD 200K
S1.4840,30 USD / 1,05 USDGratis 1M
A1.4680,10 USD / 0,10 USD 1M
A1.4670,7042 USD / 3,10 USD 200K
A1.4610,40 USD / 1,75 USD 205K
A1.4540,2740 USD / 1,10 USD 205K
A1.4490,2740 USD / 1,10 USD 205K
A1.4340,286 USD / 1,14 USD 131K
B1.4030,05 USD / 0,25 USD 262K
B1.3970,1165 USD / 0,2911 USD 131K
B1.3900,137 USD / 0,411 USD 128K
B1.3830,06 USD / 0,40 USD 200K
B1.3780,05 USD / 0,20 USDGratis 131K
B1.3710,0115 USD / 0,17 USD 1M
B1.3540,40 USD / 0,40 USDGratis 131K
B1.3470,29 USD / 0,86 USD 64K
B1.3302,50 USD / 10 USD 256K
B1.312Gratis 128K
–1.296— —
B1.29010,00 USD / 10,00 USD 128K
C1.2720,357 USD / 0,408 USDGratis 128K
C1.228— —
C1.223— —
C1.209— —
C1.1970,50 USD / 1,50 USD 128K
C1.1872,50 USD / 10 USD 128K
C1.1722,50 USD / 10 USD 128K
C1.1690,15 USD / 0,60 USD 128K
C1.1280,15 USD / 0,60 USD 128K
D1.025— —
D964— —
D919— —
–902— —
Confronta ()

I tier sono nostri: la posizione di un modello nella classifica contando solo i modelli il cui intervallo di confidenza è interamente sopra il suo. S — primo 10%, A — fino al 30%, B — fino al 60%, C — fino all'85%, D — il resto.

Qualità e prezzo punteggio in verticale, prezzo combinato (3 parti di input : 1 di output) in orizzontale, USD per 1M di token
1.000 1.200 1.400 1.600 0,01 USD 0,10 USD 1 USD 10 USD 100 USD MiMo-V2.6-Pro Claude Opus 5.5 Claude Opus 4.6

Che cosa misura questa classifica?

È la categoria di programmazione della text arena di LMArena: stessi voti alla cieca della classifica di testo, ma solo sui prompt che riguardano il codice. Le persone chiedono di scrivere una funzione, spiegare un errore o riorganizzare un pezzo di programma, confrontano due risposte anonime e votano. Il risultato è un punteggio Elo con intervallo di confidenza al 95%, trasformato nei tier S, A, B, C e D con la stessa regola delle altre classifiche.

In cosa è diversa dalle altre?

Valuta le risposte in una chat sul codice. Costruire un'intera applicazione web è un'altra prova, con una sua classifica di sviluppo web; il lavoro in più passaggi con strumenti e comandi ha invece la classifica degli agenti. Un modello forte qui non è per forza il compagno ideale per un agente che modifica un progetto vero.

Quali colonne guardare?

  • Tier e Elo, con la barra dell'intervallo: se due barre si sovrappongono, la differenza non è netta.
  • Prezzo in USD per milione di token, con l'andamento di 30 giorni e il filtro «Prezzo basso» (prezzo combinato sotto 1 USD).
  • Contesto: per lavorare su un intero repository conta molto, confrontalo accanto al prezzo.
  • Confronta: spunta fino a 4 modelli per vederli fianco a fianco.

Il calcolatore del costo mensile e il grafico «Qualità e prezzo» funzionano come nella classifica di testo, con il prezzo combinato calcolato 3 a 1 tra input e output.

Ci sono limiti da conoscere?

Sì. Un modello riceve il tier solo con almeno 300 voti; prima compare come «Tier non ancora assegnato». Soprattutto, rispondere bene in chat su un frammento di codice non equivale a far passare i test su un progetto reale, con dipendenze, configurazioni e file sparsi. Usa la classifica per scegliere i candidati, poi provali sul tuo codice. I punteggi vengono da LMArena, i prezzi da models.dev e LiteLLM, con la data dei dati sopra la tabella.