Zum Inhalt springen
fedi.software

Webentwicklung

Modelle, gereiht danach, wie sie in der WebDev-Arena von LMArena aus einem Prompt funktionierende Web-Apps bauen, mit Preisen und Kontext.

Aktualisiert · Quellen: LMArena, LiteLLM, models.dev

Kosten pro Monat
Tier Modell Elo Input / Output, pro 1M Pro Monat Kontext App Vergleichen
S1’620$ 0.0015 / $ 0.09Kostenlos 1M
C1’365$ 0.10 / $ 0.25Kostenlos 262K
C1’358$ 0.042 / $ 0.22Kostenlos 262K

Die Tiers stammen von uns: die Position eines Modells in der Rangliste, wobei nur Modelle zählen, deren gesamtes Konfidenzintervall darüber liegt. S – obere 10%, A – bis 30%, B – bis 60%, C – bis 85%, D – der Rest.

Qualität vs. Preis nach oben Wertung, nach rechts Mischpreis (3 Teile Input : 1 Output), USD pro 1M Tokens
1’000 1’200 1’400 1’600 1’800 2’000 $ 0.01 $ 0.10 $ 1 $ 10 Claude Opus 5.5 GPT-6 Astra Claude Sonnet 5.5

Was hier bewertet wird

Die Seite beruht auf der WebDev-Arena von LMArena. Zwei anonyme Modelle bekommen dieselbe Aufgabe: aus einer einzigen Anfrage eine funktionierende Web-Anwendung bauen – eine To-do-Liste, eine Landingpage, ein kleines Spiel. Heraus kommen zwei Apps, und wer abstimmt, wählt die, die funktioniert und besser aussieht. Aus den Stimmen entsteht eine Elo-Wertung mit 95%-Konfidenzintervall.

Die WebDev-Arena hat ein eigenes Teilnehmerfeld. Manche Modelle aus der Text- oder Coding-Rangliste fehlen hier, andere tauchen nur hier auf – die Liste wiederholt also nicht einfach die Nachbarseiten.

Wie die Wertung zu verstehen ist

Bewertet wird das Ergebnis als Ganzes, so wie ein Mensch es sieht: Läuft die App, erfüllt sie die Anfrage, wie wirkt die Oberfläche? Der Codestil allein spielt keine Rolle. Damit ist die Rangliste ein gutes Signal für Werkzeuge, die Prototypen oder Frontend-Code erzeugen, und ein schwächeres für Backend-Logik, Datenbankarbeit oder grosse Refactorings.

  • Das Tier fasst die Position innerhalb dieser Arena zusammen.
  • Der Balken um die Wertung ist das Konfidenzintervall; überlappen die Balken, gibt es keinen klaren Unterschied.
  • Preise pro Million Tokens, Kontext und der Verlauf über 30 Tage kommen von models.dev und LiteLLM.

Tiers

Ein Tier gibt es ab 300 Stimmen, davor steht «Noch kein Tier». Die Position ergibt sich aus der Zahl der Modelle, deren Intervall vollständig darüber liegt, und der Anteil an der Tabelle bestimmt den Buchstaben: bis 10% S, bis 30% A, bis 60% B, bis 85% C, danach D.

Grenzen der Methode

In der Arena entstehen kleine Projekte mit einer Seite, gebaut in einem Durchgang. Wie sich ein Modell über eine lange Sitzung, in einer grossen Codebasis oder mit Ihrem Framework schlägt, kann eine Abstimmung nicht erfassen. Gleichen Sie das Ergebnis mit der Rangliste Programmieren ab und – wenn das Modell als Agent arbeiten soll – mit der Rangliste Agenten.