Aller au contenu
fedi.software

Programmation

Modèles classés sur des requêtes de programmation : tier, Elo avec son intervalle de confiance, prix par million de tokens et fenêtre de contexte.

Mis à jour · Sources: LMArena, LiteLLM, models.dev

Coût par mois
Tier Modèle Elo Entrée / sortie, par million Par mois Contexte Application Comparer
S1 4890,959 $US / 2,74 $US 1M
S1 483— —
A1 4360,09 $US / 0,30 $USGratuit 256K
A1 433— —
B1 3860,30 $US / 2,50 $US 1M
B1 381— —
B1 375— —
B1 3670,21 $US / 0,57 $US 66K
B1 339— —
B1 3165,21 $US / 16,44 $US 16K
B1 312— —
B1 312— —
C1 270— —
C1 267— —
C1 239— —
C1 230— —
C1 218— —
C1 190— —
C1 169— —
C1 165— —
C1 159— —
C1 154— —
C1 143— —
C1 132— —
C1 129— —
C1 116— —
C1 113— —
C1 112— —
C1 098— —
C1 089— —
C1 080— —
D1 078— —
D1 067— —
D1 064— —
–1 053— —
D1 048— —
D1 045— —
D1 041— —
–1 039— —
D1 010— —
D1 001— —
–996— —
D945— —
D928— —
D913— —
D900— —
D886— —
D799— —
D776— —
D764— —
Comparer ()

Les tiers sont les nôtres : la place d'un modèle dans le classement, en ne comptant que les modèles dont tout l'intervalle de confiance est au-dessus du sien. S — les 10 % du haut, A — jusqu'à 30 %, B — jusqu'à 60 %, C — jusqu'à 85 %, D — le reste.

Qualité et prix note en vertical, prix combiné (3 parts d'entrée pour 1 de sortie) en horizontal, USD par million de tokens
1 000 1 200 1 400 1 600 0,01 $US 0,10 $US 1 $US 10 $US 100 $US MiMo-V2.6-Pro Claude Opus 5.5 Claude Opus 4.6

Que classe cette page ?

Les modèles selon leurs réponses aux questions de programmation. Il s'agit de la catégorie « code » de l'arène texte de LMArena : mêmes votes à l'aveugle entre deux réponses anonymes, mais uniquement sur des demandes liées au code, qu'il s'agisse d'écrire une fonction, de corriger un bug ou d'expliquer un message d'erreur. Les colonnes sont celles du classement texte : tier, note Elo avec son intervalle à 95 %, prix par million de tokens, contexte, tendance du prix sur 30 jours, calculateur, graphique et comparaison.

En quoi diffère-t-elle des pages développement web et agents ?

Ce classement juge des réponses dans une conversation. La création d'applications web complètes a son propre tableau, développement web, et le travail en plusieurs étapes avec des outils relève du classement agents. Un modèle excellent pour expliquer du code n'est pas forcément celui qui mène le mieux une tâche longue et autonome.

Pourquoi regarder la fenêtre de contexte ?

Pour travailler sur un dépôt entier, il faut que le modèle puisse lire beaucoup de fichiers à la fois. Une grande fenêtre de contexte compte alors autant que la note. Comparez-la avec le prix : envoyer tout un projet à chaque requête fait vite grimper la facture, que le calculateur « Coût par mois » permet d'estimer.

Que signifient les tiers ?

Ils sont calculés par le site, selon la même règle que sur toutes les pages : parmi les modèles qui ont au moins 300 votes, la place dépend du nombre de modèles dont l'intervalle de confiance est entièrement au-dessus. S correspond aux premiers 10 %, A à 30 %, B à 60 %, C à 85 %, D au reste. En dessous de 300 votes, un modèle reste « Pas encore de tier ».

Les votes suffisent-ils pour choisir ?

Non. Des réponses préférées dans un chat ne garantissent pas qu'un code passe les tests d'un vrai projet. Servez-vous du classement pour présélectionner quelques modèles, puis essayez-les sur votre base de code. Le filtre « Petit prix » (moins de 1 USD par million de tokens en prix combiné) aide à repérer des options économiques pour les tâches répétitives.

D'où viennent les données ?

Les notes viennent de LMArena, les prix et contextes de models.dev et LiteLLM, actualisés chaque jour.