Vai al contenuto
fedi.software

Programmazione

Modelli classificati su prompt di programmazione: tier, Elo con il suo intervallo di confidenza, prezzo per milione di token e finestra di contesto.

Aggiornato · Fonti: LMArena, LiteLLM, models.dev

Costo mensile
Tier Modello Elo Input / output, per 1M Al mese Contesto App Confronta
S1.5070,0015 USD / 0,09 USDGratis 1M
S1.4690,2088 USD / 0,4176 USD 1M
A1.4570,035 USD / 0,07 USD 1M
A1.4540,18 USD / 0,35 USD 164K
A1.4390,22 USD / 0,33 USD 164K
A1.4270,25 USD / 0,25 USD 164K
A1.4260,25 USD / 0,70 USD 128K
A1.4170,19 USD / 0,71 USD 164K
B1.3710,40 USD / 0,40 USD 80K
B1.3680,10 USD / 0,425 USD 164K
B1.3302,50 USD / 10 USD 256K
B1.309— —
C1.251— 33K
C1.1970,50 USD / 1,50 USD 128K
C1.1872,50 USD / 10 USD 128K
C1.1722,50 USD / 10 USD 128K
C1.1690,15 USD / 0,60 USD 128K
C1.1280,15 USD / 0,60 USD 128K
C1.096— —
Confronta ()

I tier sono nostri: la posizione di un modello nella classifica contando solo i modelli il cui intervallo di confidenza è interamente sopra il suo. S — primo 10%, A — fino al 30%, B — fino al 60%, C — fino all'85%, D — il resto.

Qualità e prezzo punteggio in verticale, prezzo combinato (3 parti di input : 1 di output) in orizzontale, USD per 1M di token
1.000 1.200 1.400 1.600 0,01 USD 0,10 USD 1 USD 10 USD 100 USD MiMo-V2.6-Pro Claude Opus 5.5 Claude Opus 4.6

Che cosa misura questa classifica?

È la categoria di programmazione della text arena di LMArena: stessi voti alla cieca della classifica di testo, ma solo sui prompt che riguardano il codice. Le persone chiedono di scrivere una funzione, spiegare un errore o riorganizzare un pezzo di programma, confrontano due risposte anonime e votano. Il risultato è un punteggio Elo con intervallo di confidenza al 95%, trasformato nei tier S, A, B, C e D con la stessa regola delle altre classifiche.

In cosa è diversa dalle altre?

Valuta le risposte in una chat sul codice. Costruire un'intera applicazione web è un'altra prova, con una sua classifica di sviluppo web; il lavoro in più passaggi con strumenti e comandi ha invece la classifica degli agenti. Un modello forte qui non è per forza il compagno ideale per un agente che modifica un progetto vero.

Quali colonne guardare?

  • Tier e Elo, con la barra dell'intervallo: se due barre si sovrappongono, la differenza non è netta.
  • Prezzo in USD per milione di token, con l'andamento di 30 giorni e il filtro «Prezzo basso» (prezzo combinato sotto 1 USD).
  • Contesto: per lavorare su un intero repository conta molto, confrontalo accanto al prezzo.
  • Confronta: spunta fino a 4 modelli per vederli fianco a fianco.

Il calcolatore del costo mensile e il grafico «Qualità e prezzo» funzionano come nella classifica di testo, con il prezzo combinato calcolato 3 a 1 tra input e output.

Ci sono limiti da conoscere?

Sì. Un modello riceve il tier solo con almeno 300 voti; prima compare come «Tier non ancora assegnato». Soprattutto, rispondere bene in chat su un frammento di codice non equivale a far passare i test su un progetto reale, con dipendenze, configurazioni e file sparsi. Usa la classifica per scegliere i candidati, poi provali sul tuo codice. I punteggi vengono da LMArena, i prezzi da models.dev e LiteLLM, con la data dei dati sopra la tabella.