Agenti
Modelli classificati su compiti agentici (chiamate a strumenti e lavoro in più passaggi) secondo la classifica degli agenti di LMArena. Il punteggio è centrato sullo zero, non è un Elo.
Aggiornato · Fonti: LMArena, LiteLLM, models.dev
I tier sono nostri: la posizione di un modello nella classifica contando solo i modelli il cui intervallo di confidenza è interamente sopra il suo. S — primo 10%, A — fino al 30%, B — fino al 60%, C — fino all'85%, D — il resto.
Compiti in più passaggi
Questa classifica usa la agent leaderboard di LMArena: i modelli affrontano compiti in più passaggi, chiamando strumenti e usando i risultati per decidere il passo successivo, e le persone giudicano come se la sono cavata. Ogni voto riguarda una sessione intera, non una singola risposta. È il riferimento più vicino a ciò che fa un agente di programmazione o di automazione, anche se l'ambiente dell'arena non è quello che userai tu.
Un punteggio diverso dall'Elo
Qui la metrica non è un Elo. La colonna si chiama «Punteggio» e mostra un valore centrato sullo zero, con tre decimali, che va all'incirca da numeri negativi a positivi. Un punteggio sopra lo zero significa che il modello è stato preferito più spesso del modello medio di questa classifica; sotto lo zero, meno spesso. Proprio perché la scala è diversa, i modelli vanno confrontati solo all'interno di questa pagina: mettere accanto il punteggio degli agenti e l'Elo della classifica di testo non ha senso.
Cosa resta uguale
- I tier S, A, B, C e D seguono la regola comune: almeno 300 voti, intervallo di confidenza al 95%, soglie al 10, 30, 60 e 85%.
- I prezzi sono i più bassi tra i provider, in USD per milione di token, con filtro «Prezzo basso» sotto 1 USD combinato.
- Puoi confrontare fino a 4 modelli e aprire i dettagli di ogni riga.
Da ricordare prima di scegliere
È una classifica giovane, con meno modelli di quella di testo, e alcuni nomi noti potrebbero mancare o non avere ancora un tier. Il framework per agenti usato nell'arena non è quello che userai nel tuo terminale o nel tuo editor: strumenti, prompt di sistema e limiti cambiano il comportamento. Usa il punteggio per restringere la scelta e poi prova i candidati con il tuo agente, che trovi nella pagina degli agenti di programmazione. I dati arrivano da LMArena agent per i punteggi e da models.dev e LiteLLM per i prezzi.