Zum Inhalt springen
fedi.software

Programmieren

Modelle, gereiht nach Programmieraufgaben: Tier, Elo mit Konfidenzintervall, Preis pro Million Tokens und Kontextfenster.

Aktualisiert · Quellen: LMArena, LiteLLM, models.dev

Kosten pro Monat
Tier Modell Elo Input / Output, pro 1M Pro Monat Kontext App Vergleichen
S1.483— —
A1.4640,066 $ / 0,26 $ 262K
A1.4380,03 $ / 0,12 $ 524K
A1.433— —
A1.422— —
A1.419— —
B1.389— 131K
B1.3860,30 $ / 2,50 $ 1M
B1.361— 131K
–1.319— —
B1.307— —
B1.307— —
C1.270— —
B1.270— —
C1.239— —
C1.231— —
C1.218— —

Die Tiers stammen von uns: die Position eines Modells in der Rangliste, wobei nur Modelle zählen, deren gesamtes Konfidenzintervall darüber liegt. S – obere 10%, A – bis 30%, B – bis 60%, C – bis 85%, D – der Rest.

Qualität vs. Preis nach oben Wertung, nach rechts Mischpreis (3 Teile Input : 1 Output), USD pro 1M Tokens
1.000 1.200 1.400 1.600 0,01 $ 0,10 $ 1 $ 10 $ 100 $ MiMo-V2.6-Pro Claude Opus 5.5 Claude Opus 4.6

Was misst diese Rangliste?

Sie folgt der Kategorie Coding der LMArena-Text-Arena. Das Verfahren ist dasselbe wie bei der allgemeinen Textwertung – zwei anonyme Antworten, eine menschliche Stimme –, gezählt werden aber nur Anfragen rund ums Programmieren: eine Funktion schreiben, einen Fehler erklären, fremden Code umbauen. Jedes Modell erhält eine Elo-Wertung mit 95%-Konfidenzintervall.

Worin unterscheidet sie sich von Webentwicklung und Agenten?

Hier werden Antworten in einem Chat über Code bewertet. Wie gut ein Modell aus einer einzigen Anfrage eine funktionierende Web-App baut, zeigt die eigene Rangliste Webentwicklung; mehrstufige Arbeit mit Werkzeugen die Rangliste Agenten. Ein Modell kann in einer davon glänzen und in einer anderen zurückfallen. Wer einen Coding-Assistenten sucht, sollte alle drei ansehen.

Welche Spalten zählen beim Programmieren?

  • Tier und Elo-Wertung mit Intervallbalken;
  • der Preis pro Million Input- und Output-Tokens beim günstigsten Anbieter;
  • das Kontextfenster – entscheidend, wenn große Teile eines Repositorys ins Prompt wandern;
  • der Preisverlauf über 30 Tage.

Der Kostenrechner ist hier besonders nützlich. Beim Programmieren schicken Modelle deutlich mehr hin, als zurückkommt; stellen Sie den Input-Anteil hoch ein, und Sie sehen, was ein Monat mit dem jeweiligen Modell kosten würde.

Wie werden die Tiers berechnet?

Nach der gemeinsamen Regel aller Ranglisten. Ein Modell braucht mindestens 300 Stimmen. Seine Position ist eins plus die Zahl der Modelle, deren gesamtes Konfidenzintervall über seinem eigenen liegt. Bezogen auf die Größe der Tabelle ergibt eine Position unter 10% S, unter 30% A, unter 60% B, unter 85% C, sonst D. Gleichauf liegende Spitzenmodelle teilen sich S.

Woher kommen die Preise?

Von models.dev und LiteLLM, täglich aktualisiert. Wir speichern den Verlauf, deshalb sehen Sie, ob ein Modell billiger oder teurer wird.

Worauf sollte ich achten?

Eine Stimme für eine Chat-Antwort ist kein Testlauf in einem echten Projekt. Ein Modell kann eine Lösung elegant erklären und trotzdem Code liefern, der in Ihrer Umgebung nicht baut; zudem sind die Arena-Anfragen kurz. Nutzen Sie die Rangliste, um die Auswahl einzugrenzen, und testen Sie dann zwei oder drei Modelle mit Ihrem eigenen Code.