Vai al contenuto
fedi.software

Agenti

Modelli classificati su compiti agentici (chiamate a strumenti e lavoro in più passaggi) secondo la classifica degli agenti di LMArena. Il punteggio è centrato sullo zero, non è un Elo.

Aggiornato · Fonti: LMArena, LiteLLM, models.dev

Costo mensile
Tier Modello Punteggio Input / output, per 1M Al mese Contesto App Confronta
S0,1238 USD / 40 USD 1M
S0,1122 USD / 10 USD 1M
S0,0971,60 USD / 8 USD 1M
A0,0642 USD / 10 USD 1M
A0,0421,50 USD / 12 USD 1M
A0,0400,0015 USD / 0,09 USDGratis 1M
B0,0140,08 USD / 0,40 USD 1M
B0,0120,2088 USD / 0,4176 USD 1M
B0,0100,75 USD / 6 USD 1M
B0,0041,50 USD / 2 USD 1M
B-0,0120,06 USD / 0,37 USD 1M
Confronta ()

I tier sono nostri: la posizione di un modello nella classifica contando solo i modelli il cui intervallo di confidenza è interamente sopra il suo. S — primo 10%, A — fino al 30%, B — fino al 60%, C — fino all'85%, D — il resto.

Qualità e prezzo punteggio in verticale, prezzo combinato (3 parti di input : 1 di output) in orizzontale, USD per 1M di token
-0,2 -0,1 0,0 0,1 0,2 0,01 USD 0,10 USD 1 USD 10 USD Claude Fable 5.1 Claude Opus 5.5 Claude Sonnet 5.5

Compiti in più passaggi

Questa classifica usa la agent leaderboard di LMArena: i modelli affrontano compiti in più passaggi, chiamando strumenti e usando i risultati per decidere il passo successivo, e le persone giudicano come se la sono cavata. Ogni voto riguarda una sessione intera, non una singola risposta. È il riferimento più vicino a ciò che fa un agente di programmazione o di automazione, anche se l'ambiente dell'arena non è quello che userai tu.

Un punteggio diverso dall'Elo

Qui la metrica non è un Elo. La colonna si chiama «Punteggio» e mostra un valore centrato sullo zero, con tre decimali, che va all'incirca da numeri negativi a positivi. Un punteggio sopra lo zero significa che il modello è stato preferito più spesso del modello medio di questa classifica; sotto lo zero, meno spesso. Proprio perché la scala è diversa, i modelli vanno confrontati solo all'interno di questa pagina: mettere accanto il punteggio degli agenti e l'Elo della classifica di testo non ha senso.

Cosa resta uguale

  • I tier S, A, B, C e D seguono la regola comune: almeno 300 voti, intervallo di confidenza al 95%, soglie al 10, 30, 60 e 85%.
  • I prezzi sono i più bassi tra i provider, in USD per milione di token, con filtro «Prezzo basso» sotto 1 USD combinato.
  • Puoi confrontare fino a 4 modelli e aprire i dettagli di ogni riga.

Da ricordare prima di scegliere

È una classifica giovane, con meno modelli di quella di testo, e alcuni nomi noti potrebbero mancare o non avere ancora un tier. Il framework per agenti usato nell'arena non è quello che userai nel tuo terminale o nel tuo editor: strumenti, prompt di sistema e limiti cambiano il comportamento. Usa il punteggio per restringere la scelta e poi prova i candidati con il tuo agente, che trovi nella pagina degli agenti di programmazione. I dati arrivano da LMArena agent per i punteggi e da models.dev e LiteLLM per i prezzi.