Die Tiers stammen von uns: die Position eines Modells in der Rangliste, wobei nur Modelle zählen, deren gesamtes Konfidenzintervall darüber liegt. S – obere 10%, A – bis 30%, B – bis 60%, C – bis 85%, D – der Rest.
Qualität vs. Preisnach oben Wertung, nach rechts Mischpreis (3 Teile Input : 1 Output), USD pro 1M Tokens
Was hier bewertet wird
Die Seite beruht auf der WebDev-Arena von LMArena. Zwei anonyme Modelle bekommen dieselbe Aufgabe: aus einer einzigen Anfrage eine funktionierende Web-Anwendung bauen – eine To-do-Liste, eine Landingpage, ein kleines Spiel. Heraus kommen zwei Apps, und wer abstimmt, wählt die, die funktioniert und besser aussieht. Aus den Stimmen entsteht eine Elo-Wertung mit 95%-Konfidenzintervall.
Die WebDev-Arena hat ein eigenes Teilnehmerfeld. Manche Modelle aus der Text- oder Coding-Rangliste fehlen hier, andere tauchen nur hier auf – die Liste wiederholt also nicht einfach die Nachbarseiten.
Wie die Wertung zu verstehen ist
Bewertet wird das Ergebnis als Ganzes, so wie ein Mensch es sieht: Läuft die App, erfüllt sie die Anfrage, wie wirkt die Oberfläche? Der Codestil allein spielt keine Rolle. Damit ist die Rangliste ein gutes Signal für Werkzeuge, die Prototypen oder Frontend-Code erzeugen, und ein schwächeres für Backend-Logik, Datenbankarbeit oder grosse Refactorings.
Das Tier fasst die Position innerhalb dieser Arena zusammen.
Der Balken um die Wertung ist das Konfidenzintervall; überlappen die Balken, gibt es keinen klaren Unterschied.
Preise pro Million Tokens, Kontext und der Verlauf über 30 Tage kommen von models.dev und LiteLLM.
Tiers
Ein Tier gibt es ab 300 Stimmen, davor steht «Noch kein Tier». Die Position ergibt sich aus der Zahl der Modelle, deren Intervall vollständig darüber liegt, und der Anteil an der Tabelle bestimmt den Buchstaben: bis 10% S, bis 30% A, bis 60% B, bis 85% C, danach D.
Grenzen der Methode
In der Arena entstehen kleine Projekte mit einer Seite, gebaut in einem Durchgang. Wie sich ein Modell über eine lange Sitzung, in einer grossen Codebasis oder mit Ihrem Framework schlägt, kann eine Abstimmung nicht erfassen. Gleichen Sie das Ergebnis mit der Rangliste Programmieren ab und – wenn das Modell als Agent arbeiten soll – mit der Rangliste Agenten.