Agents
Modèles classés sur des tâches agentiques — appels d'outils et travail en plusieurs étapes — d'après le classement des agents de LMArena. Son score est centré sur zéro, ce n'est pas un Elo.
Mis à jour · Sources: LMArena, LiteLLM, models.dev
Les tiers sont les nôtres : la place d'un modèle dans le classement, en ne comptant que les modèles dont tout l'intervalle de confiance est au-dessus du sien. S — les 10 % du haut, A — jusqu'à 30 %, B — jusqu'à 60 %, C — jusqu'à 85 %, D — le reste.
Un classement pour le travail en plusieurs étapes
Un agent ne se contente pas de répondre : il enchaîne des actions, appelle des outils, lit le résultat et décide de la suite. Ce tableau reprend le classement agents de LMArena, où des personnes évaluent des modèles sur ce type de tâches à plusieurs étapes avec appels d'outils. C'est un classement récent, qui compte moins de modèles que le classement texte.
Un score, pas une note Elo
Point essentiel : la métrique de cette page n'est pas un Elo. La colonne s'appelle « Score » et affiche trois décimales. Ce score est centré sur zéro, avec des valeurs négatives et positives. Un score supérieur à zéro signifie que le modèle est préféré plus souvent que le modèle moyen de ce classement ; un score négatif, moins souvent. Comparez donc les modèles uniquement entre eux sur cette page, et jamais avec les notes Elo des autres classements : ce sont deux échelles différentes, qui ne se comparent pas. Ici, les votes correspondent à des sessions complètes plutôt qu'à des réponses isolées.
Comment les tiers sont attribués
La règle est la même que sur les autres classements, appliquée au score :
- seuls les modèles avec au moins 300 votes reçoivent un tier ; les autres affichent « Pas encore de tier » ;
- la place d'un modèle vaut 1 plus le nombre de modèles dont tout l'intervalle de confiance à 95 % est au-dessus du sien ;
- rapportée au nombre de modèles, cette place donne S sous 10 %, A sous 30 %, B sous 60 %, C sous 85 %, et D au-delà.
Prudence avant de choisir
Le cadre d'agent utilisé dans l'arène n'est pas celui que vous emploierez, qu'il s'agisse de Claude Code, d'un outil d'automatisation ou de votre propre code. Un modèle bien classé ici reste à tester dans votre environnement. Les colonnes de prix, de contexte et de tendance sur 30 jours aident à estimer ce que coûtera une tâche longue, qui consomme beaucoup de tokens ; le filtre « Petit prix » garde les modèles sous 1 USD par million de tokens en prix combiné.
Pour aller plus loin
Les outils qui exploitent ces modèles sont réunis dans la page des agents de code, et les compétences qu'on peut leur ajouter dans l'annuaire des skills. Notes : LMArena ; prix : models.dev et LiteLLM.