Aller au contenu
fedi.software

Agents

Modèles classés sur des tâches agentiques — appels d'outils et travail en plusieurs étapes — d'après le classement des agents de LMArena. Son score est centré sur zéro, ce n'est pas un Elo.

Mis à jour · Sources: LMArena, LiteLLM, models.dev

Coût par mois
Tier Modèle Score Entrée / sortie, par million Par mois Contexte Application Comparer
A0,0421 $US / 4 $USGratuit 1M
Comparer ()

Les tiers sont les nôtres : la place d'un modèle dans le classement, en ne comptant que les modèles dont tout l'intervalle de confiance est au-dessus du sien. S — les 10 % du haut, A — jusqu'à 30 %, B — jusqu'à 60 %, C — jusqu'à 85 %, D — le reste.

Qualité et prix note en vertical, prix combiné (3 parts d'entrée pour 1 de sortie) en horizontal, USD par million de tokens
-0,2 -0,1 0,0 0,1 0,2 0,01 $US 0,10 $US 1 $US 10 $US Claude Fable 5.1 Claude Opus 5.5 Claude Sonnet 5.5

Un classement pour le travail en plusieurs étapes

Un agent ne se contente pas de répondre : il enchaîne des actions, appelle des outils, lit le résultat et décide de la suite. Ce tableau reprend le classement agents de LMArena, où des personnes évaluent des modèles sur ce type de tâches à plusieurs étapes avec appels d'outils. C'est un classement récent, qui compte moins de modèles que le classement texte.

Un score, pas une note Elo

Point essentiel : la métrique de cette page n'est pas un Elo. La colonne s'appelle « Score » et affiche trois décimales. Ce score est centré sur zéro, avec des valeurs négatives et positives. Un score supérieur à zéro signifie que le modèle est préféré plus souvent que le modèle moyen de ce classement ; un score négatif, moins souvent. Comparez donc les modèles uniquement entre eux sur cette page, et jamais avec les notes Elo des autres classements : ce sont deux échelles différentes, qui ne se comparent pas. Ici, les votes correspondent à des sessions complètes plutôt qu'à des réponses isolées.

Comment les tiers sont attribués

La règle est la même que sur les autres classements, appliquée au score :

  • seuls les modèles avec au moins 300 votes reçoivent un tier ; les autres affichent « Pas encore de tier » ;
  • la place d'un modèle vaut 1 plus le nombre de modèles dont tout l'intervalle de confiance à 95 % est au-dessus du sien ;
  • rapportée au nombre de modèles, cette place donne S sous 10 %, A sous 30 %, B sous 60 %, C sous 85 %, et D au-delà.

Prudence avant de choisir

Le cadre d'agent utilisé dans l'arène n'est pas celui que vous emploierez, qu'il s'agisse de Claude Code, d'un outil d'automatisation ou de votre propre code. Un modèle bien classé ici reste à tester dans votre environnement. Les colonnes de prix, de contexte et de tendance sur 30 jours aident à estimer ce que coûtera une tâche longue, qui consomme beaucoup de tokens ; le filtre « Petit prix » garde les modèles sous 1 USD par million de tokens en prix combiné.

Pour aller plus loin

Les outils qui exploitent ces modèles sont réunis dans la page des agents de code, et les compétences qu'on peut leur ajouter dans l'annuaire des skills. Notes : LMArena ; prix : models.dev et LiteLLM.