Vai al contenuto
fedi.software

Programmazione

Modelli classificati su prompt di programmazione: tier, Elo con il suo intervallo di confidenza, prezzo per milione di token e finestra di contesto.

Aggiornato · Fonti: LMArena, LiteLLM, models.dev

Costo mensile
Tier Modello Elo Input / output, per 1M Al mese Contesto App Confronta
S1.4970,75 USD / 6 USD 1M
S1.4962 USD / 10 USD 1M
S1.4941,50 USD / 12 USD 1M
S1.4898 USD / 40 USD 1M
S1.4831,50 USD / 2 USD 1M
S1.4822 USD / 10 USD 1M
A1.4660,06 USD / 0,37 USD 1M
A1.4541 USD / 8 USD 400K
A1.4481,60 USD / 8 USD 1M
A1.4470,25 USD / 2 USD 128K
A1.4440,08 USD / 0,40 USD 1M
A1.4380,375 USD / 4 USD 400K
A1.4361 USD / 8 USD 400K
B1.4134,50 USD / 14 USD 128K
B1.4081,80 USD / 7,20 USD 200K
B1.4071,75 USD / 14 USD 128K
B1.4060,04 USD / 0,29 USD 400K
B1.4050,16 USD / 1 USD 400K
B1.39775 USD / 150 USD 128K
B1.3911,60 USD / 6,40 USD 1M
B1.3800,032 USD / 0,14 USD 131K
B1.3780,99 USD / 4 USD 200K
B1.3680,99 USD / 4 USD 200K
B1.3670,32 USD / 1,28 USD 1M
B1.36714 USD / 54 USD 200K
B1.3630,99 USD / 4 USD 200K
B1.3621,10 USD / 4,40 USD 128K
B1.3570,25 USD / 0,80 USD 262K
B1.3510,04 USD / 0,32 USD 400K
B1.3302,50 USD / 10 USD 256K
B1.3070,009 USD / 0,045 USDGratis 131K
B1.3060,08 USD / 0,26 USD 1M
B1.2975 USD / 15 USD 128K
B1.2900,15 USD / 0,60 USD 128K
B1.2842,50 USD / 10 USD 128K
C1.2689 USD / 27 USD 128K
C1.25410 USD / 30 USD 8K
C1.1970,50 USD / 1,50 USD 128K
C1.1872,50 USD / 10 USD 128K
C1.1722,50 USD / 10 USD 128K
C1.1690,15 USD / 0,60 USD 128K
C1.1360,45 USD / 1,40 USD 16K
C1.1280,15 USD / 0,60 USD 128K
Confronta ()

I tier sono nostri: la posizione di un modello nella classifica contando solo i modelli il cui intervallo di confidenza è interamente sopra il suo. S — primo 10%, A — fino al 30%, B — fino al 60%, C — fino all'85%, D — il resto.

Qualità e prezzo punteggio in verticale, prezzo combinato (3 parti di input : 1 di output) in orizzontale, USD per 1M di token
1.000 1.200 1.400 1.600 0,01 USD 0,10 USD 1 USD 10 USD 100 USD MiMo-V2.6-Pro Claude Opus 5.5 Claude Opus 4.6

Che cosa misura questa classifica?

È la categoria di programmazione della text arena di LMArena: stessi voti alla cieca della classifica di testo, ma solo sui prompt che riguardano il codice. Le persone chiedono di scrivere una funzione, spiegare un errore o riorganizzare un pezzo di programma, confrontano due risposte anonime e votano. Il risultato è un punteggio Elo con intervallo di confidenza al 95%, trasformato nei tier S, A, B, C e D con la stessa regola delle altre classifiche.

In cosa è diversa dalle altre?

Valuta le risposte in una chat sul codice. Costruire un'intera applicazione web è un'altra prova, con una sua classifica di sviluppo web; il lavoro in più passaggi con strumenti e comandi ha invece la classifica degli agenti. Un modello forte qui non è per forza il compagno ideale per un agente che modifica un progetto vero.

Quali colonne guardare?

  • Tier e Elo, con la barra dell'intervallo: se due barre si sovrappongono, la differenza non è netta.
  • Prezzo in USD per milione di token, con l'andamento di 30 giorni e il filtro «Prezzo basso» (prezzo combinato sotto 1 USD).
  • Contesto: per lavorare su un intero repository conta molto, confrontalo accanto al prezzo.
  • Confronta: spunta fino a 4 modelli per vederli fianco a fianco.

Il calcolatore del costo mensile e il grafico «Qualità e prezzo» funzionano come nella classifica di testo, con il prezzo combinato calcolato 3 a 1 tra input e output.

Ci sono limiti da conoscere?

Sì. Un modello riceve il tier solo con almeno 300 voti; prima compare come «Tier non ancora assegnato». Soprattutto, rispondere bene in chat su un frammento di codice non equivale a far passare i test su un progetto reale, con dipendenze, configurazioni e file sparsi. Usa la classifica per scegliere i candidati, poi provali sul tuo codice. I punteggi vengono da LMArena, i prezzi da models.dev e LiteLLM, con la data dei dati sopra la tabella.